Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4365
материалов
01
Situational Awareness вкладывает $400 млн в Source Foundry: почему AI-фонд ставит на чипы, несмотря на потери
AI-хедж-фонд Situational Awareness вложил $400 млн в Source Foundry, несмотря на сокращение активов вдвое. Разбираем логику ставки на чипы, технологию стэнфордс
02
Харнесс для ИИ-разработки: как два агента заменили команду и почему SDD стал новым стандартом
Соло-разработчик создал Electron-продукт за 56 дней с помощью Claude Code и Codex. Разбираем устройство харнесса: спек-контракты, чистый контекст ревью и автома
03
KLQ: training-free квантизация LLM с waterfilling, которая обходит SpinQuant на W4A4KV4
KLQ — training-free метод квантизации LLM, который обходит SpinQuant на W4A4KV4 без градиентного обучения. Разбираем, как каузальные KL-возмущения и waterfillin
04
BigBang-v1: Реальные результаты финтюна Qwen 3.5 против гигантов — независимый тест
Независимый тест BigBang-v1: финтюн Qwen 3.5 35B не дотягивает до заявленной производительности между DeepSeek Flash и Pro. Разбираем аномальный разброс на HLE
05
SupraElegans-500K: Рекуррентная модель без Transformer — архитектура, тесты и перспективы
Разбираем архитектуру SupraElegans-500K — рекуррентной модели на 500K параметров без Transformer и KV-кэша. Бенчмарки HellaSwag 26.5%, ARC 21-22%, WinoGrande 52
06
Бюджетный домашний AI-сервер: 3x RX 9060 XT против 3x RTX 5060 Ti — выбираем платформу для LLM и MoE
Собираем домашний AI-сервер с тремя GPU по 16 ГБ и бюджетом $3500. Сравниваем AMD RX 9060 XT и NVIDIA RTX 5060 Ti, платформы AM5 и б/у EPYC, разбираем влияние P
07
Сжатие LLM на 233 ГБ без потери точности: как удаление мультиязычности оптимизировало Kimi K3
Энтузиаст hellohazine сжал Kimi K3 с 711 до 478 ГБ, удалив все языки кроме английского. Точность на английском сохранилась, требования к GPU снизились на треть.
08
gitTalk: как нейросеть превращает естественный язык в Git-команды — опыт разработки на Go
Утилита gitTalk конвертирует фразы на естественном языке в Git-команды через Gemini API. Разбор архитектуры на Go, строгий промпт для точных ответов модели и ре
09
OpenAI приобретает NextSlide: как стартап по созданию презентаций усилит ChatGPT
OpenAI приобрела стартап NextSlide и интегрировала его команду в ChatGPT. Разбираем, как технология генерации презентаций изменит продукт, какие функции появятс
10
Спекулятивное декодирование в llama-server: почему DSpark даёт 1-2 токена/с, а MTP — 30-40, и как это исправить
DSpark draft-модель в llama-server режет скорость DeepSeek-V4-Flash до 1-2 токенов/с вместо обещанного ускорения. Разбираем три главные причины деградации и даё
11
Тестирование квантованных версий DeepSeek Flash 0731: какие бенчмарки использовать и как оценить деградацию
Сравниваем оригинальную DeepSeek Flash 0731 с квантованными версиями через MMLU, HellaSwag и логические задачи. Готовая методика тестирования за 1 млн токенов,
12
Как включить PCI-E P2P на потребительских GPU Nvidia и получить +25% к скорости инференса: пошаговый гайд с тестами
Включите PCI-E P2P на потребительских видеокартах Nvidia и ускорьте инференс LLM на 25% без замены железа. Пошаговый гайд с тестами на 4×RTX 5060 Ti: настройка