Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 REAP-квантования MiniMax-M2.5: что дают новые 19-50% сжатия и как сравниваются с Qwen Coder Next на 128GB RAM Сравнение REAP-квантований от 19 до 50 процентов сжатия против Qwen Coder Next, настройка памяти для запуска моделей на 128GB RAM 1 мин чтения 02 Распознавание речи на Mac в 4.7 раза быстрее: запуск Qwen3-ASR с MLX, квантованием и тестами Запуск Qwen3-ASR 1.7B на Apple Silicon с MLX. Квантование 4-bit, бенчмарки скорости против Whisper v3 и Parakeet. Инструкция по установке и тестам на Mac M-seri 6 мин чтения 03 Как модель Aeneas находит связи в древних текстах: инструмент для историков и цифровых гуманитариев Обзор модели Aeneas v3.1 — специализированного ИИ для работы с латинской эпиграфикой. Поиск параллелей, контекстуализация, восстановление фрагментов. 5 мин чтения 04 Семантический кэш для RAG на AlloyDB Omni: настройка ScaNN и экономия токенов Практический гайд по настройке семантического кэша для RAG-систем с использованием AlloyDB Omni и ScaNN индекса. Экономьте до 70% токенов, кэшируя похожие вопро 7 мин чтения 05 Агенты Codex и Claude пишут CUDA-ядра для трансформеров: как работает skill для автоматизации низкоуровневой оптимизации Как агенты Codex и Claude автоматически генерируют оптимизированные CUDA-ядра для трансформеров. Skill для низкоуровневой оптимизации, интеграция с Kernel Hub и 5 мин чтения 06 Perplex: как заставить LLM показать, где она врёт Perplex — Rust-инструмент для визуализации предсказаний LLM по токенам. Анализируем, где модель не уверена или ошибается. Работает с любыми GGUF моделями. 7 мин чтения 07 Baichuan-M3: как запустить медицинскую модель для сбора анамнеза на своём сервере Полное руководство по установке Baichuan-M3 - медицинской LLM с открытыми весами для сбора анамнеза. Сравнение с альтернативами, требования к железу и практичес 5 мин чтения 08 P1-235B-A22B: как открытая модель победила на физической олимпиаде и где скачать веса Как открытая модель P1-235B-A22B от Shanghai AI Laboratory получила золото на IPhO 2026. Скачать веса на HuggingFace, возможности и примеры использования Physic 7 мин чтения 09 AdaLLM: Полное руководство по запуску NVFP4-моделей на RTX 4090 с FP8 KV-кэшем и кастомным ядром Подробное руководство по установке и использованию AdaLLM для запуска квантованных моделей на RTX 4090 с оптимизациями FP8 KV-кэша и кастомным ядром Triton. 6 мин чтения 10 SnapLLM: Как мгновенно переключаться между локальными LLM и SD моделями без перезагрузки Обзор SnapLLM — инструмента для мгновенного переключения между локальными LLM и Stable Diffusion моделями без перезагрузки. Архитектура vPID, три уровня памяти, 6 мин чтения 11 EdgeDox и MNN: как запустить полноценный RAG с LLM офлайн на Android Обзор EdgeDox — приложения для запуска RAG с локальной LLM на Android с использованием движка MNN. Приватность, офлайн работа, квантованные модели. 5 мин чтения 12 Qwen3-TTS.cpp: ускорение TTS в 4 раза на CPU и Apple Silicon Обзор Qwen3-TTS.cpp: ускорение TTS в 4 раза, поддержка Metal/CoreML, голосовой клон. Локальный синтез речи без облаков для разработчиков. 5 мин чтения