Перейти к содержанию
Публикация AiManual

«Гига Писарь» на Windows: офлайн-диктовка на GigaAM v3 без GPU и интернета

Вышла первая бета «Гига Писаря» для Windows: голосовой ввод работает офлайн на CPU, использует GigaAM v3, занимает около 600 МБ и вставляет текст туда, где стои

Коротко

Что будет в материале

  1. 01

    Что такое «Гига Писарь» и как он работает на Windows

  2. 02

    Технические детали: как GigaAM v3 и ONNX Runtime работают на C#

  3. 03

    Производительность и потребление ресурсов

  4. 04

    Ограничения первой беты: что уже работает, а что нет

«Гига Писарь» вышел на Windows: доступна первая бета приложения для голосового ввода, которое распознаёт речь прямо на компьютере пользователя. Удерживаете правый Ctrl, говорите, отпускаете клавишу, и текст появляется там, где стоит курсор. Интернет не нужен, видеокарта тоже.

Распознавание построено на модели GigaAM v3 от Сбера и целиком идёт на процессоре. По данным автора, приложению нужно около 600 МБ памяти, а 13 секунд речи на его стенде обрабатываются за 0,35 секунды. Это первая версия с базовым функционалом: без «Мозга» и без команд над выделенным текстом.

Дальше разберём, что именно умеет бета, как устроено ядро распознавания, каких функций пока нет и что делать, если Windows ругается на неподписанный установщик.

Что такое «Гига Писарь» и как он работает на Windows

«Гига Писарь» - приложение для голосового ввода, работающее локально. Первая Windows-сборка сделана с базовым набором: запись, распознавание, вставка текста. Возможностей «Мозга», о котором автор писал в предыдущей статье, и команд над выделенным фрагментом здесь ещё нет.

Сценарий укладывается в три движения: нажать и удерживать правый Ctrl, продиктовать фразу, отпустить клавишу. Распознанный текст мгновенно попадает туда, где стоит курсор. Переключаться в отдельное окно, копировать результат вручную или запускать расшифровку отдельной командой не требуется. Механику и остальные детали релиза автор описал в публикации о Windows-версии.

Как устроено управление: правый Ctrl и вставка текста

Правый Ctrl выбран как клавиша-триггер: пока она нажата, приложение пишет звук, после отпускания запускается распознавание. Клавиша удобна тем, что почти не участвует в горячих комбинациях текстовых редакторов и браузеров, в отличие от левого Ctrl.

Состояние записи видно по плашке с волной у курсора. Индикатор можно перетащить мышью, и он запомнит новое место, если перекрывает нужный участок экрана.

Автор рассчитывает, что ввод заработает в любой программе, но сам отмечает: это ещё требует тестирования. Практический вывод для первых дней - проверьте диктовку там, где вы реально пишете: в браузере, мессенджере, редакторе кода, таблицах, поле поиска в терминале или IDE. Разные приложения по-разному принимают вставку текста, особенно если внутри работают свои буферы обмена и горячие клавиши.

Почему не нужны интернет и видеокарта

Распознавание идёт целиком на процессоре с моделью GigaAM v3. Подключение к сети не требуется, аудио не покидает компьютер, GPU не задействован. Это снимает два типичных барьера: расходы на видеокарту и зависимость от стабильного канала связи.

По памяти ориентир такой: около 600 МБ. Величина приблизительная, но она позволяет держать приложение открытым параллельно с браузером и редактором даже на 8 ГБ оперативной памяти.

Скорость: 13 секунд речи на стенде автора обрабатываются за 0,35 секунды. Оценка «на слабом ноутбуке должно быть меньше секунды» - это предположение автора, а не измеренный результат, и проверять её стоит на своей машине.

Технические детали: как GigaAM v3 и ONNX Runtime работают на C#

Ядро распознавания одно на все версии приложения. Логика не меняется при переходе между платформами, различается язык реализации: Swift на macOS, Python для Linux, C# в сборке для Windows.

Этапы распознавания: от звука до текста

  1. Звук с микрофона превращается в мел-спектрограмму: это представление сигнала, где по одной оси отложено время, по другой - частоты, а яркость показывает энергию.
  2. Мел-спектрограмма уходит в энкодер, который сжимает её в компактное описание акустических признаков.
  3. Декодирование RNN-T превращает это описание в последовательность токенов.
  4. Кусочки слов склеиваются в готовый текст, который и вставляется в активное поле.

RNN-T объединяет акустическую и языковую части в одной модели, поэтому отдельный шаг выравнивания аудио и текста не нужен. Вся цепочка выполняется на CPU: ни один этап не требует видеокарты, что и держит требования к железу на уровне офисного ноутбука.

Задержку стоит оценивать целиком, а не только по времени работы модели: в реальном использовании к обработке добавляются запись с микрофона и вставка текста в приложение. На коротких фразах это доли секунды, на длинных диктантах результат зависит уже от программы, в которую попадает текст.

Почему C# и ONNX Runtime

Для Windows ядро перенесено на C#, а модели выполняются через ONNX Runtime, который автор называет родным для этого языка. Практический смысл переноса: сама модель остаётся той же, что на macOS, меняется только платформенная обвязка вокруг неё.

Автор не раскрывает, какие именно оптимизации применялись под конкретные процессоры и менялась ли математика вычислений. Из публикации следует факт переноса и выбранный стек, поэтому воспринимать C#-версию как автоматически более быструю или более медленную, чем Swift и Python-варианты, оснований нет. Сравнивать имеет смысл на своих записях и своём железе.

Производительность и потребление ресурсов

Все цифры по производительности в этой статье - из публикации о релизе, без дополнительных замеров.

ПараметрЗначениеЧто это значит
Обработка 13 секунд речи0,35 секундызамер на стенде автора
Потребление памятиоколо 600 МБприблизительная величина
Видеокартане используетсявся обработка на CPU
Интернетне нуженраспознавание локальное
Слабый ноутбукменее секундыпредположение автора, не измерение

Соотношение длительности записи и времени обработки здесь примерно 37 к 1. На практике это значит, что узким местом будет не распознавание, а скорость вашей речи и паузы между фразами.

Отсутствие GPU меняет класс устройств, на которых инструмент применим: ноутбуки без дискретной видеокарты, офисные ПК, тонкие клиенты с достаточным объёмом памяти. Отдельного требования к интернету нет, поэтому сценарии в закрытой сети или на выезде не отличаются от домашних.

Ограничения первой беты: что уже работает, а что нет

  • Это первая версия с базовым функционалом: без «Мозга» и без команд над выделенным текстом.
  • Работа в любой программе предполагается, но ещё требует тестирования.
  • Установщик не подписан, поэтому Windows и Edge будут показывать предупреждения.
  • Оценка скорости на слабом ноутбуке - предположение автора.

Неподписанный установщик: как обойти предупреждения

Windows предупреждает о запуске неподписанных установщиков, а Edge показывает предупреждение при скачивании. Для беты это ожидаемое поведение, но источник файла всё равно нужно проверить. Порядок действий:

  1. Скачивайте установщик только со страницы официального репозитория проекта, ссылку на который автор приводит в публикации о релизе.
  2. Если автор публикует контрольные суммы, сверьте хеш файла до запуска.
  3. В окне предупреждения убедитесь, что путь к файлу совпадает с местом, куда вы его сохранили, и что имя файла не подменено.
  4. Исключение для одного файла безопаснее, чем полное отключение защиты на постоянной основе; выключать компоненты безопасности стоит только с пониманием риска.

Подпись установщика автор планирует получить через SignPath после того, как настроит сборку в GitHub Actions. До этого шага предупреждения останутся частью установки.

Отсутствие «Мозга» и команд над текстом

«Мозг» упоминается как отдельная функция, разбор которой остался в предыдущей статье автора. В публикации о Windows-релизе не сказано, из чего этот функционал состоит, поэтому приписывать ему конкретные возможности пока нельзя. Ясно одно: в этой бете его нет.

Команд над выделенным текстом тоже нет. Приложение набирает текст голосом, но не переписывает, не переводит и не переформатирует уже готовый фрагмент. Если рабочий процесс построен вокруг правок выделенного текста голосом, бета его не закроет.

Как установить и настроить «Гига Писарь» на Windows

Установка идёт обычным мастером: «Далее, Установить, Готово». Репозиторий проекта - github.com/moznoazachem/giga-pisar-win, код открыт под лицензией MIT. Сторонние сборки лучше не использовать: проверить происхождение файла в них сложнее.

Системные требования и совместимость

Нужны процессор, микрофон и около 600 МБ свободной памяти. Дискретная видеокарта не требуется, постоянное подключение к сети тоже. Точную минимальную версию Windows автор не называет; интерфейс при этом оформлен в стиле Windows 11. Совместимость с конкретной сборкой системы проверяйте на своей машине.

Первый запуск и настройка

После установки приложение живёт в трее, отдельное окно держать открытым не нужно. Язык интерфейса берётся из системы, уведомления приходят штатными средствами Windows, обновления ставятся автоматически.

Что стоит сделать в первые минуты:

  1. Разрешить доступ к микрофону, если система его запросит.
  2. Продиктовать короткую фразу и посмотреть, как ведёт себя плашка с волной у курсора.
  3. Перетащить плашку в удобное место: позицию она запомнит.
  4. Проверить диктовку в двух-трёх программах, где вы пишете чаще всего, и заодно оценить, как распознаются ваши термины и имена.

Сравнение с другими решениями для голосового ввода

Подходы к голосовому вводу различаются по двум осям: где обрабатывается аудио и что требуется от железа.

Облачные сервисы диктовки отправляют запись на свои серверы. Плюс: на машине не нужно ничего держать и считать. Минус: без интернета ввод не работает, а аудио покидает ваш компьютер. «Гига Писарь» устроен наоборот: модель работает локально, сеть не нужна, записи остаются у вас.

Отдельный класс инструментов - голосовое управление программами и агентами, где цель не набрать текст, а выполнить действие. Такой сценарий разобран в материале про ChatGPT Voice на десктопе: там речь идёт о командах для программ, сайтов и AI-агентов, а не о диктовке в поле ввода. «Гига Писарь» решает более узкую и более предсказуемую задачу.

Среди локальных решений распознавания речи требования к железу различаются: у части движков заявлена поддержка видеокарты, и это стоит сверять до установки. Windows-версия «Гига Писаря» обходится CPU и примерно 600 МБ памяти. Ещё одна особенность - единое ядро на всех платформах при разных языках реализации: Swift на macOS, Python для Linux, C# для Windows. Версии для macOS и Linux уже существуют, поэтому поведение можно сопоставить между системами.

Отдельно стоит держать в голове модель: GigaAM v3 от Сбера. Качество распознавания на вашей лексике, акцентах, аббревиатурах и английских терминах публикация о релизе не разбирает, поэтому проверяйте на своих записях. Если задача шире диктовки и нужно искать по содержимому локальных файлов, включая речь в аудиозаписях, это другой класс инструментов, о котором мы рассказывали в разборе поиска по содержимому файлов на Windows.

Кому и зачем нужен «Гига Писарь» на Windows

Инструмент закрывает несколько практических сценариев:

  • Быстрый набор текста без клавиатуры, когда курсор уже стоит в нужном поле.
  • Работа без стабильного интернета или в закрытом контуре: распознавание локальное.
  • Приватность: аудио не уходит в облако, потому что обработка идёт на машине.
  • Ноутбуки и офисные ПК без дискретной видеокарты.
  • Разработчики и пользователи локальных LLM, которым нужен офлайн-ввод в привычные редакторы, с поправкой на то, что поведение в разных программах ещё тестируется.

Кому бета не подойдёт: тем, кто рассчитывает на команды над выделенным текстом или на «Мозг»; тем, кому нужна гарантированная работа в каждом приложении без сюрпризов; тем, кто не готов запускать неподписанный установщик на рабочей машине. Программа набирает текст, но не выполняет действия за пользователя.

Открытый код и планы по развитию

Код открыт под лицензией MIT и лежит в репозитории проекта. Это даёт три возможности: прочитать реализацию ядра на C# с ONNX Runtime, собрать свою сборку и прислать правки. Для инструмента голосового ввода открытый код полезен ещё и тем, что видно, куда уходит аудио.

Ближайший пункт планов - подпись установщика через SignPath после настройки сборки в GitHub Actions. Пока её нет, предупреждения Windows и Edge остаются частью процесса установки.

Дальше по списку функции, которых в бете нет: «Мозг» и команды над выделенным текстом. Сроков в публикации автор не называет, поэтому планировать рабочий процесс вокруг них рано.

Если решите попробовать, поставьте бету на тестовую машину или отдельный профиль, прогоните короткую фразу, длинный абзац и текст с вашими терминами в двух-трёх программах. Так вы за пару минут поймёте, хватает ли базового набора и подходит ли качество распознавания вашей лексике.

Подписаться на канал