Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
Бесплатный сверхбыстрый вывод Llama 3.1 8B на ASIC: как получить доступ к 16,000 токенов в секунду
Тестируем сверхбыстрый инференс Llama 3.1 8B на ASIC от Taalas: 16,000 токенов в секунду через API. Полный обзор технологии, сравнение с vLLM и llama.cpp, инстр
02
Makimus-AI: ваш личный Google Photos, который не шпионит и работает на видеокарте
Полный обзор Makimus-AI - open-source инструмента для локального поиска по фото на GPU. Установка, сравнение с альтернативами, примеры использования.
03
Llama 4 16x17B: как заставить 67 ГБ мультимодальную модель видеть на вашем компьютере
Пошаговый гайд по настройке Llama 4 16x17B (67 ГБ) для анализа изображений локально. Ollama, Open WebUI, тесты производительности и сравнение с альтернативами.
04
GSI Engram на Intel Arc: 90% экономия VRAM и форк llama.cpp, который работает
Как запустить GSI Engram 70B на Intel Arc A770 с 16GB VRAM через модифицированный llama.cpp. Техника runtime expansion и SYCL бэкенд.
05
MicroGPT Playground: как собрать и понять архитектуру LLM прямо в браузере
Интерактивная демонстрация архитектуры трансформеров в браузере. Образовательный инструмент для понимания работы LLM без установки ПО.
06
Wispr Flow больше не нужен: приватный диктофон для iOS и Mac, который работает без интернета
Тест-драйв приложения с TestFlight для приватной транскрипции на iPhone и Mac. Полный офлайн-режим, экономия $29/месяц, сравнение с Wispr Flow.
07
Embedding Evaluator: Когда ваши векторы сходят с ума, а вы об этом не знаете
Обзор Embedding Evaluator — CLI-утилиты для диагностики проблем с векторными эмбеддингами в RAG-системах. Визуализация кластеров, детекция выбросов, JSON-отчёты
08
Mirai: как новый фреймворк от создателей Reface и Prisma ускоряет on-device AI на смартфонах
Обзор Mirai - нового фреймворка для оптимизации on-device inference на Android и iOS. Сравнение с альтернативами, примеры использования и рекомендации.
09
IQ*_K и IQ*_KS в llama.cpp: новая эра квантования или просто шум?
Разбираем новый Pull Request в llama.cpp с методами квантования IQ*_K и IQ*_KS. Сравниваем производительность с GGUF, даем команды для сборки и тестирования.
10
TextWeb: когда скриншоты весят как слоны, а нужны муравьи
Open-source инструмент для замены скриншотов веб-страниц на легковесные текстовые сетки. Интеграция с MCP, LangChain, CrewAI. Экономия памяти до 99.9%.
11
BM25 против нейросетей: как antaris-memory ускоряет память агентов в 50 раз без зависимостей
Сравнение BM25 и векторного поиска для AI агентов. Antaris-memory ускоряет поиск в 50 раз без API, зависимостей и облачных сервисов. Локальная память для агенто
12
LoopMaker: как собрать локальный Suno для Mac за выходные
Пошаговый гайд по созданию LoopMaker - локального приложения для генерации музыки на Mac с помощью MLX. Swift, Apple Silicon, полная независимость от облаков.