Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4377 материалов
01 Как исправить потерю KV-кэша в llama-server: руководство по сохранению и восстановлению сессий Подробный гайд по сохранению и восстановлению KV-кэша в llama-server. Решаем проблему потери контекста при длинных сессиях. Код, настройки, советы. 7 мин чтения 02 Как ускорить DeepSeek V4 Flash на Mac Studio: опыт использования oMLX и Codex для 1.6x prefill и 3x decode Реальный опыт: настройка oMLX и Codex optimization для DeepSeek V4 Flash на Mac Studio. Получаем ускорение prefill в 1.6 раза и decode в 3 раза. Пошаговый гайд 8 мин чтения 03 Как избежать attention drift при tool calls в агентных системах на llama.cpp: разбор проблемы и решения Разбираем, почему локальные LLM на llama.cpp 'забывают' результаты вызова инструментов. Пошаговое руководство по диагностике и устранению attention drift с прим 7 мин чтения 04 Как обучить LLM на малоресурсном языке: полный гайд на примере карачаево-балкарского с Qwen3-4B Пошаговое руководство по дообучению Qwen3-4B для карачаево-балкарского языка: создание токенизатора, морфологический процессор, аугментация диалектов, тонкая на 1 мин чтения 05 Как сократить галлюцинации LLM в CLI-агентах: чистка системных промптов и экономия токенов Пошаговый гайд по оптимизации системных промптов для CLI-агентов на примере Qwen Code. Снижаем галлюцинации и экономим до 53% токенов. 9 мин чтения 06 Claude против Покока: кто лучше выносит мозг Хабру? Эксперимент с парсингом Реальный эксперимент: официальная библиотека промптов Anthropic против скилла Мэтта Покока. Кто справится с парсингом Хабра? Сравнение, код, инсайты. 6 мин чтения 07 Бенчмарк 13 моделей на 65K-128K контексте: prefill и KV head count важнее параметров для агентских нагрузок Тест 13 моделей (Llama 4, Qwen3, DeepSeek-V4, Phi-4 и др.) в контексте 65-128K. Разбираем, почему скорость prefill и количество KV head важнее размера модели дл 8 мин чтения 08 Как выявить регрессию промптов: тестовый набор из 40 золотых запросов 40 золотых запросов и 4 типа проверок, чтобы поймать регрессию промптов до того, как она уйдет в прод. Методика False Improvement и пошаговый план. 7 мин чтения 09 Meta Pocket: Как создавать AI-игры с помощью vibe-coding (полный гайд и примеры промптов) Полный гайд по Meta Pocket — платформе для генерации игр с помощью AI-промптов. Примеры промптов, пошаговая инструкция и разбор типичных ошибок. 8 мин чтения 10 Codex exec: превращаем Claude Code в независимого ревьюера кода Научитесь использовать команду exec в Codex для создания независимых AI-ревьюеров. Полный гайд с примерами для Claude Code. Версия 2026. 9 мин чтения 11 Как построить надежного AI-агента для бизнеса: от контекста до анти-фейл-систем на примере XelaBot Пошаговое руководство по созданию бизнес-AI-агента: контекст, память, интеграции, anti-false-success. Пример XelaBot с кодом и архитектурой. 9 мин чтения 12 Гибридные паттерны LLM: когда и как сочетать локальные и облачные модели Системный подход к гибридным архитектурам LLM: три оси проектирования, реальный пример с Gemma 4 и GPT-5.4, пошаговая реализация и подводные камни. 7 мин чтения