Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4376
материалов
01
Как мы бенчмаркаем Deep Agents: фреймворк для сквозного тестирования AI-агентов
Как тестировать AI-агентов: методология Deep Agents на базе фреймворка Harbor. Три набора задач (Harbor-Index, τ³-bench, ContextBench), ускорение итераций в 8 р
02
Спекулятивный декодинг на частично выгруженных MoE: как не потерять 2.5x скорости на примере Laguna S 2.1 и 2× RTX 5090
Запустили Laguna S 2.1 (118B MoE) с DFlash на двух RTX 5090 и получили 23 tok/s вместо 58 — замедление в 2.5 раза. Разбираем три ошибки в настройках, механику ш
03
Бюджетный AI-инференс на Celeron N5095: тест Ollama CPU-only от 0.6B до 8B
Практический тест инференса Qwen3 на Celeron N5095 (Youyeetoo X1S) через Ollama. Модель 0.6B выдаёт 7 токенов/с и пригодна для классификации и суммаризации. 8B
04
Ручные Metal-ядра на Mojo: GPT-2 124M на M4 Max — в 1.71x быстрее PyTorch MPS, но медленнее MLX
Портирование llm.c на Mojo с ручными Metal-ядрами: bf16-конфигурация на M4 Max достигает 503.3 мс/шаг (8138 tok/s) — в 1.71x быстрее PyTorch MPS, но на 24% медл
05
NemoClaw + Deep Agents: как открытые агентные системы меняют правила игры в AI-разработке
NVIDIA NemoClaw Blueprint и LangChain Deep Agents: открытая архитектура с RLM, изолированными песочницами и оценкой через Harbor. Разбираем, как команды получаю
06
ASCIITermDraw-Bench: Как LLM и VLM справляются с ASCII-диаграммами архитектур
ASCIITermDraw-Bench — новый бенчмарк для оценки способности LLM и VLM генерировать ASCII-диаграммы архитектур. 80 задач, две метрики, лидер Gemma-4-31B-IT с 73,
07
Интеграция веб-поиска в llama.cpp для Claude Code: пошаговое руководство
Практическое руководство по интеграции серверного веб-поиска в llama.cpp для работы с Claude Code. Разбираем форки, PR и альтернативу через MCP на стороне клиен
08
Обзор интерфейсов для локальных LLM в 2026: от минимализма llama-server до корпоративного Open WebUI
Сравниваем три интерфейса для локальных LLM в 2026: консольный llama-server для быстрых тестов, веб-комбайн Open WebUI для ежедневной работы с документами и Sil
09
Архитектурные паттерны Amazon Bedrock Guardrails для высокопроизводительной генерации кода: от инлайн-сканирования к селективной валидации
Троттлинг, задержки и перерасход текстовых юнитов при генерации кода с Bedrock Guardrails — симптомы избыточного инлайн-сканирования. Шесть архитектурных паттер
10
Gemma 4 на RTX 5090: Почему agentic-сценарии не работают и при чём тут 4-битная квантизация
Практический тест Gemma 4 (31B) на RTX 5090 с NVFP4-квантованием: модель полностью проваливает создание игры Snake в agentic-цикле. Разбираем три причины отказа
11
AegisAI: Как AI-агенты бывших инженеров Google защищают от фишинга нового поколения
Стартап AegisAI, основанный экс-руководителями безопасности Google, привлек $36 млн и строит агентную защиту почты. Разбираем архитектуру AI-агентов, которые вы
12
Открытая модель транскрипции хинди против ElevenLabs и Sarvam Saarvas v3: детальное сравнение и бенчмарки
Новая открытая модель транскрипции хинди (Apache 2.0) против ElevenLabs и Sarvam Saarvas v3: сравнение WER, скорости и стоимости инференса. Узнайте, в каких сце