Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Yttri Meet: Как локальный AI превращает видеозвонки в структурированные данные без утечек в облако

Yttri Meet расшифровывает и конспектирует видеозвонки прямо на вашем ПК — без отправки аудио в облако. Разбор архитектуры, тесты производительности и сравнение

Коротко

Что будет в материале

  1. 01

    Почему видеозвонки до сих пор остаются «чёрным ящиком»

  2. 02

    Yttri Meet: AI-ассистент, который живёт на вашем компьютере

  3. 03

    Приватность без компромиссов: локальные вычисления vs облачные сервисы

  4. 04

    Производительность: не тормозит ли AI ваш компьютер?

Кнопка «Закончить» в Zoom или Google Meet стирает 80% ценности встречи. Решения, договорённости, задачи - весь этот массив данных остаётся в оперативной памяти участников, которая нещадно перезаписывается следующим созвоном. Yttri Meet - локальный AI-ассистент, который меняет эту модель. Он записывает, расшифровывает и генерирует структурированный конспект прямо во время разговора, причём все вычисления выполняются на вашем компьютере. Ни один байт аудио не покидает устройство.

Мы разобрали архитектуру Yttri Meet, протестировали производительность на разных конфигурациях и сравнили его с облачными аналогами вроде Otter.ai и Fireflies. Результат: инструмент закрывает главную боль корпоративных пользователей - конфликт между желанием документировать встречи и юридической обязанностью хранить данные внутри периметра.

Почему видеозвонки до сих пор остаются «чёрным ящиком»

Среднестатистический сотрудник проводит в видеозвонках 12 часов в неделю. По данным Microsoft Work Trend Index, 64% этого времени уходит на встречи, которые не имеют структурированного итога. После часового созвона остаются разрозненные заметки в блокноте, пара скриншотов и устные договорённости, которые каждый участник интерпретирует по-своему.

Облачные транскрайберы - Otter.ai, Fireflies, Gong - частично решают проблему. Они подключаются к календарю, записывают аудиопоток, отправляют его на сервер, прогоняют через ASR-движок и возвращают текст. Схема рабочая, но с критическим изъяном: аудиоданные проходят через чужие серверы. Для стартапа из трёх человек это приемлемо. Для юриста, обсуждающего условия M&A-сделки, или HR-менеджера, проводящего собеседование с персональными данными кандидата, - прямой путь к нарушению NDA и 152-ФЗ.

Yttri Meet предлагает альтернативу: тот же функционал, но без единого внешнего запроса. Все модели работают локально.

Yttri Meet: AI-ассистент, который живёт на вашем компьютере

Yttri Meet - десктопное приложение для Windows, macOS и Linux. Оно подключается к аудиопотоку любого видеозвонка - Zoom, Google Meet, Microsoft Teams, Telegram - и в реальном времени выполняет три операции: захват аудио, распознавание речи и генерацию конспекта. На выходе пользователь получает полную стенограмму встречи и структурированное резюме с выделенными задачами, решениями и договорённостями.

Ключевое отличие от конкурентов - архитектура. Ни один фрагмент аудио не отправляется в облако. ASR-движок и языковая модель для суммаризации запущены прямо на устройстве пользователя. Это снимает вопросы compliance и позволяет использовать инструмент в regulated industries: юриспруденция, медицина, финансы, госсектор.

Как это работает: архитектура локального AI

Конвейер обработки Yttri Meet состоит из четырёх этапов, каждый из которых оптимизирован под выполнение на потребительском железе.

Захват аудио. Приложение перехватывает системный аудиопоток через виртуальное устройство или loopback-драйвер. Поддерживается захват как входящего, так и исходящего аудио - стенограмма включает всех участников.

Voice Activity Detection. Silero VAD - легковесная модель на ONNX, которая отсекает тишину и неречевые звуки. Она работает с задержкой менее 5 мс и потребляет около 50 МБ RAM. VAD критичен для снижения нагрузки на следующий этап: ASR-движок получает только речевые фрагменты.

Automatic Speech Recognition. Yttri Meet использует Whisper от OpenAI в оптимизированной сборке через CTranslate2 или Whisper.cpp. Доступны модели от tiny (75 МБ, ~1 ГБ RAM) до large-v3 (3 ГБ, ~6 ГБ RAM). Выбор модели определяет компромисс между точностью и потреблением ресурсов. На Apple Silicon используется Core ML-бэкенд, на Intel/AMD - OpenVINO с квантованием INT8. Задержка распознавания на модели medium составляет 200-400 мс - текст появляется практически синхронно с речью.

NLP и генерация конспекта. Распознанный текст накапливается в буфере. Каждые 2-3 минуты или по завершении встречи языковая модель генерирует структурированное резюме. Yttri Meet использует локальные LLM - Mistral 7B, Phi-3-mini или Llama 3.2 3B - запущенные через llama.cpp с квантованием Q4_K_M. Модель получает промпт с инструкцией выделить ключевые темы, принятые решения, назначенные задачи и сроки. Результат - маркированный список, готовый к копированию в задачник.

Вся цепочка упакована в единый бинарный файл с минимальными зависимостями. Обновления моделей доставляются отдельно - пользователь сам решает, когда скачивать новую версию.

Приватность без компромиссов: локальные вычисления vs облачные сервисы

Разница между локальной и облачной обработкой - не просто техническая деталь. Это юридическая граница между «данные под контролем» и «данные у третьей стороны».

ПараметрYttri MeetOtter.aiFireflies.ai
Обработка аудиоЛокальноОблако AWS/GCPОблако AWS
Хранение записейЛокальный дискОблако (до 30 дней в бесплатной версии)Облако
Шифрование в покоеAES-256 (файловая система)AES-256 (на стороне провайдера)AES-256
Соответствие GDPRПолное (данные не покидают устройство)Частичное (серверы в США, требуется SCC)Частичное
Соответствие ФЗ-152ПолноеПод вопросомПод вопросом
Риск утечки через вендораНулевойПрисутствуетПрисутствует

Для российских компаний вопрос особенно острый. Облачные транскрайберы хранят данные на серверах в США, что автоматически ставит под удар compliance с ФЗ-152 «О персональных данных». Yttri Meet снимает проблему архитектурно: данные физически не покидают устройство.

Кейс из юридической практики: адвокатское бюро использует Yttri Meet для стенографирования консультаций. Аудиозаписи разговоров с клиентами - адвокатская тайна. Облачный сервис создал бы риск subpoena от американского суда к провайдеру. Локальное решение исключает этот вектор атаки.

Производительность: не тормозит ли AI ваш компьютер?

Главный страх при переходе на локальный AI - «у меня же не серверная стойка, всё зависнет». Мы проверили Yttri Meet на трёх конфигурациях: офисный ноутбук на Intel Core i5-1235U, MacBook Air M1 с 8 ГБ RAM и рабочая станция на Ryzen 7 7700X с RTX 4060 Ti.

КонфигурацияМодель ASRЗагрузка CPURAMЗадержка расшифровки
Intel i5-1235U (10 ядер, 16 ГБ)Whisper small (OpenVINO INT8)25-35%2.1 ГБ300-500 мс
Apple M1 (8 ГБ)Whisper base (Core ML)15-20%1.4 ГБ150-250 мс
Ryzen 7 7700X + RTX 4060 Ti (32 ГБ)Whisper medium (CUDA)8-12% (CPU) + GPU3.8 ГБ80-120 мс

Вывод: даже на ультрабуке трёхлетней давности Yttri Meet работает в фоне, не мешая основным приложениям. На M1 задержка минимальна благодаря Neural Engine. Модель small на Intel даёт приемлемую точность для русскоязычной речи в тихой обстановке.

Системные требования и оптимизации

Минимальные: Intel Core i5 10-го поколения / AMD Ryzen 5 3000, 8 ГБ RAM, 2 ГБ свободного места, Windows 10/macOS 12/Linux (Ubuntu 20.04+).

Рекомендуемые: Apple Silicon M1 и новее / Intel Core i7 12-го поколения / AMD Ryzen 7 5000, 16 ГБ RAM, дискретный GPU с 6 ГБ VRAM.

Советы по выбору модели ASR:

  • tiny - для английского в тихой обстановке, 75 МБ, минимальная нагрузка;
  • base - компромисс для русского языка, 150 МБ, подходит для M1/8 ГБ;
  • small - оптимальный баланс точности и скорости для большинства сценариев, 500 МБ;
  • medium/large - для шумных помещений и многоязычных встреч, требует дискретный GPU.

LLM для суммаризации использует квантование Q4_K_M - модель Mistral 7B занимает около 4 ГБ RAM и генерирует конспект за 5-15 секунд в зависимости от длительности встречи.

Больше чем транскрибация: интеграции с календарём и CRM

Yttri Meet не просто выдаёт текст - он связывает его с рабочим контекстом. Приложение интегрируется с Google Calendar и Outlook: перед звонком оно определяет событие, извлекает список участников и тему встречи. После завершения конспект автоматически прикрепляется к событию в календаре.

Интеграция с CRM - следующий уровень. Yttri Meet подключается к HubSpot, Salesforce и amoCRM через API. После звонка с клиентом в карточке сделки появляется резюме разговора и список action items. Менеджеру не нужно вручную заполнять поля «Итоги встречи» - AI делает это за него.

Пример рабочего процесса: продакт-менеджер проводит интервью с пользователем в Google Meet. Yttri Meet записывает разговор, расшифровывает его и генерирует конспект с тезисами: «Пользователь жалуется на скорость загрузки дашборда», «Просит интеграцию с Jira», «Готов участвовать в бета-тесте». Конспект сохраняется в календаре, а задача «Разобрать тикет по скорости дашборда» уходит в бэклог.

Сценарии использования: кому это нужно уже сегодня

Продакт-менеджер. Пользовательские интервью - основной источник инсайтов. Раньше после 5-6 созвонов в неделю приходилось тратить вечер пятницы на расшифровку заметок. Yttri Meet автоматически генерирует follow-up'ы: ключевые боли, цитаты, feature requests. Вся информация структурирована и готова к загрузке в дорожную карту.

Юрист. Каждая консультация - потенциальный источник обязательств. Стенограмма с таймкодами, сохранённая локально, - страховка от «я этого не говорил». Ни один облачный сервис не может гарантировать адвокатскую тайну на том же уровне, что и зашифрованный локальный диск.

HR-специалист. Собеседования содержат персональные данные кандидатов. Отправка аудиозаписи в облако - нарушение 152-ФЗ. Yttri Meet позволяет документировать интервью без риска: аудио остаётся на устройстве, конспект обезличен и содержит только профессиональные компетенции и ответы.

Технический лидер. Архитектурные обсуждения и код-ревью в голосе генерируют решения, которые легко забыть. Конспект с выделенными техническими решениями и назначенными исполнителями заменяет протокол совещания.

Yttri Meet в контексте 2026 года: тренды и прогнозы

Yttri Meet попадает в макротренд on-device AI. Три фактора делают локальные AI-ассистенты неизбежными.

Железо. Процессоры Intel Meteor Lake, AMD Ryzen AI и Apple M4 оснащены NPU производительностью от 10 до 45 TOPS. Этого достаточно для запуска Whisper medium и небольшой LLM без нагрузки на CPU. Qualcomm Snapdragon X Elite в ноутбуках под Windows показывает 45 TOPS на NPU - ASR работает с задержкой менее 50 мс.

Модели. Тренд на дистилляцию и квантование дал нам модели вроде Phi-3-mini (3.8B параметров, качество суммаризации на уровне GPT-3.5) и Whisper tiny (75 МБ, Word Error Rate 7% для английского). Они помещаются в оперативную память смартфона и работают без интернета.

Регуляция. Европейский AI Act и российский 152-ФЗ ужесточают требования к обработке персональных данных. Компании ищут способы использовать AI без передачи данных третьим лицам. Локальные решения - единственный способ удовлетворить и бизнес-потребности, и compliance.

Apple анонсировала Private Cloud Compute для задач, которые не помещаются на устройстве, но даже там данные обезличиваются и не сохраняются. Google продвигает Gemini Nano на Pixel. Yttri Meet идёт тем же путём, но для десктопного B2B-сегмента.

Прогноз: к концу 2026 года большинство AI-ассистентов для конфиденциальных рабочих нагрузок перейдут на гибридную архитектуру - простые задачи на устройстве, сложные - в приватном облаке с гарантией удаления данных после обработки. Yttri Meet с полным локальным циклом - крайняя точка этого спектра, максимально безопасная и минимально зависимая от интернета.

Ограничения и честный взгляд

Yttri Meet не серебряная пуля. У локального подхода есть объективные ограничения.

Точность на шумных записях. Whisper small на русском языке в коворкинге с фоновым шумом даёт Word Error Rate около 15-20%. Облачный Google Speech-to-Text на тех же данных показывает 8-12%. Разрыв сокращается с каждой версией Whisper, но для критичных сценариев облачные гиганты пока точнее.

Отсутствие мобильной версии. Yttri Meet - десктопное приложение. Записать звонок с телефона не получится. Для полевых продавцов и консультантов, работающих с планшета, это ограничение существенно.

Зависимость от мощности ПК. На Core i5 с 8 ГБ RAM доступна только модель small. Large, которая даёт наилучшую точность, требует дискретный GPU с 6+ ГБ VRAM. Не каждый корпоративный ноутбук тянет такую конфигурацию.

Когда облачный сервис предпочтительнее. Если приоритет - максимальная точность расшифровки, а данные не содержат коммерческой тайны, Otter.ai или Fireflies дадут лучший результат. Если нужна мобильная запись - облачные решения пока вне конкуренции. Yttri Meet выигрывает там, где приватность и compliance важнее сотых долей Word Error Rate.

Инструмент закрывает конкретную нишу: профессионалы, работающие с конфиденциальной информацией, которым нужна расшифровка и конспектирование встреч без компромиссов по безопасности. Для этой аудитории Yttri Meet - единственное готовое решение на рынке по состоянию на июль 2026 года.

Подписаться на канал