Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 TranscriptionSuite: Полный гайд по локальной транскрипции аудио с GUI, дизаризацией и интеграцией с LLM Обзор TranscriptionSuite - локального приложения для транскрипции на базе faster-whisper с GUI, дизаризацией говорящих и интеграцией с LLM. 6 мин чтения 02 Chatterbox Extended и другие локальные инструменты для псевдо-конвертации голоса Сравнение Chatterbox Extended, RVC и других локальных инструментов для голосового клонирования по короткому аудио. Какое качество за 15 секунд? 6 мин чтения 03 Обзор Kreuzberg v4: как Rust-библиотека для обработки документов ускоряет RAG-пайплайны Обзор Kreuzberg v4 - Rust-библиотеки для извлечения текста, OCR, чанкинга и эмбеддингов. Ускоряет RAG-пайплайны, поддерживает 10 языков и плагины. 4 мин чтения 04 Falcon-H1-Arabic: Когда гибридная архитектура встречает арабскую сложность Обзор Falcon-H1-Arabic — семейства моделей с гибридной архитектурой для обработки арабского языка, включая диалекты и длинный контекст. 5 мин чтения 05 Alexa+ вышла в браузер: как бесплатно попробовать и стоит ли переходить на Prime Amazon запустил Alexa+ в веб-версии. Получите ранний доступ бесплатно, сравните с ChatGPT и Gemini, решите - стоит ли переходить на Prime за $20. 6 мин чтения 06 Новый RL-алгоритм без TD-обучения: масштабируемое решение для задач с длинным горизонтом Обзор нового RL-алгоритма без TD-обучения. Сравнение с Q-learning, примеры использования для робототехники и рекомендации по применению. 7 мин чтения 07 Nemotron-Personas-India: синтетические индийцы для AI без приватности Как использовать первый открытый синтетический датасет для индийских демографических данных. Создание культурно-адаптированных AI-систем без нарушения приватнос 6 мин чтения 08 LTX-2: открытая модель, которая генерирует видео и звук одновременно. И это работает LTX-2 — первая полноценная open-source мультимодальная модель для одновременной генерации видео и аудио. Разбираем возможности, сравнение с аналогами и примеры 5 мин чтения 09 Gemini Pro для разработчиков: возможности, архитектура и как начать использовать Подробный обзор Gemini Pro от Google для разработчиков. Возможности, архитектура, сравнение с Flash и Ultra, инструкция по началу работы с API. 6 мин чтения 10 DeepMath от Intel: как заставить маленькую модель решать сложную математику с помощью smolagents и GRPO Как Intel заставил Qwen3-4B решать сложную математику с помощью агентов, Python-песочницы и GRPO. Сравнение с альтернативами и примеры использования. 5 мин чтения 11 MiniMax-M2.1: как запустить новую open-source модель для кодинга (Rust, Java, Go) Полное руководство по запуску MiniMax-M2.1 — open-source модели с 49.4% на Multi-SWE-bench. Установка через SGLang, vLLM, Transformers для Rust, Java, Go разраб 7 мин чтения 12 Gemini Robotics 1.5: как AI-агенты начинают управлять роботами в реальном мире Как Gemini Robotics 1.5 через API заставляет роботов искать в интернете, сортировать предметы и выполнять многошаговые задачи. Сравнение с Nvidia Isaac и Physic 6 мин чтения