Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
4153
Как заменить двухмодельную агентную настройку на Qwen3.5 35B-A3B на Mac M1: гайд по производительности и квантованию
Пошаговый гайд по замене двухмодельной агентной настройки на Qwen3.5 35B-A3B на Mac M1. Квантование Q4_K_XL, настройка llama.cpp server, тесты производительност
4154
Чиним лаги ChatGPT на длинных диалогах: перехватываем API и обрезаем историю
Пошаговый гайд по оптимизации фронтенда ChatGPT: перехватываем fetch API, обрезаем историю сообщений и убираем лаги на диалогах 500+ сообщений. Код и объяснения
4155
Заголовок: ломаем догму 'длиннее reasoning - лучше'. Как DTR ускоряет локальные LLM в 2 раза без потери качества
Полное руководство по DTR и Think@n стратегии для ускорения локальных LLM. Экономия 50% вычислений без потери точности. Актуально на 2026 год.
4156
Multi-Directional Refusal Suppression: как подавить отказы в LLM с помощью самоорганизующихся карт
Глубокий разбор метода Multi-Directional Refusal Suppression для подавления отказов в языковых моделях с помощью самоорганизующихся карт (SOM). Технический гайд
4157
Как уйти от шаблонного AI-дизайна: 5 приёмов для уникального вида сайтов
Разрабатываем сайты, которые не похожи на пластиковый AI-лендинг. Конкретный пайплайн из пяти шагов для дизайнеров и разработчиков.
4158
Claude Skills: инструкция по созданию переиспользуемых промптов и победа над рутиной
Полное руководство по Claude Skills от Anthropic. Узнайте, как создавать skill.md файлы для автоматизации рутинных задач с Claude 4.5. Примеры, ошибки, FAQ.
4159
Как построить гибридного чат-бота с ИИ за 5000 руб. в месяц: обзор подходов и выбор стека
Практический гайд по архитектуре гибридного чат-бота. Детальный разбор затрат: SaaS, open-source, кастомные решения. Учет 152-ФЗ и выбор стека.
4160
Используем Qwen2.5-Coder-32B как хакера: какая opensource модель реально справляется с Red Teaming?
Практический бенчмарк opensource моделей для кибербезопасности. Сравниваем Qwen2.5-Coder-32B, Seneca-Cybersecurity и другие — кто генерирует рабочие эксплойты,
4161
Оптимизация ML inference на Databricks: partitioned tables vs liquid clustering vs salting на боевом кейсе
Реальный кейс ускорения инференса с 24 до 6 часов: сравниваем partitioned tables, liquid clustering и salting на Databricks с метриками производительности.
4162
Тест производительности Qwen3.5-35B в multi-agent задачах: почему он справился, а другие sub-100B модели — нет
Детальный разбор эксперимента: почему только Qwen3.5-35B справился с multi-agent workflow, а другие модели sub-100B провалились. Анализ reasoning effort, пошаго
4163
Unsloth Dynamic 2.0: Как умное выборочное квантование GGUF ускоряет инференс и экономит память
Unsloth Dynamic 2.0 ускоряет инференс и экономит память с помощью выборочного квантования слоев. Сравнение, примеры использования и рекомендации.
4164
Speechos: ваш личный полигон для речевых моделей, который не шпионит за вами
Speechos: open-source инструмент для локального бенчмаркинга речевых моделей. Сравнивайте Whisper, Vosk, Supertonic 2 TTS без облаков. Адаптация к железу.