«Гига Писарь» вышел на Windows: доступна первая бета приложения для голосового ввода, которое распознаёт речь прямо на компьютере пользователя. Удерживаете правый Ctrl, говорите, отпускаете клавишу, и текст появляется там, где стоит курсор. Интернет не нужен, видеокарта тоже.
Распознавание построено на модели GigaAM v3 от Сбера и целиком идёт на процессоре. По данным автора, приложению нужно около 600 МБ памяти, а 13 секунд речи на его стенде обрабатываются за 0,35 секунды. Это первая версия с базовым функционалом: без «Мозга» и без команд над выделенным текстом.
Дальше разберём, что именно умеет бета, как устроено ядро распознавания, каких функций пока нет и что делать, если Windows ругается на неподписанный установщик.
Что такое «Гига Писарь» и как он работает на Windows
«Гига Писарь» - приложение для голосового ввода, работающее локально. Первая Windows-сборка сделана с базовым набором: запись, распознавание, вставка текста. Возможностей «Мозга», о котором автор писал в предыдущей статье, и команд над выделенным фрагментом здесь ещё нет.
Сценарий укладывается в три движения: нажать и удерживать правый Ctrl, продиктовать фразу, отпустить клавишу. Распознанный текст мгновенно попадает туда, где стоит курсор. Переключаться в отдельное окно, копировать результат вручную или запускать расшифровку отдельной командой не требуется. Механику и остальные детали релиза автор описал в публикации о Windows-версии.
Как устроено управление: правый Ctrl и вставка текста
Правый Ctrl выбран как клавиша-триггер: пока она нажата, приложение пишет звук, после отпускания запускается распознавание. Клавиша удобна тем, что почти не участвует в горячих комбинациях текстовых редакторов и браузеров, в отличие от левого Ctrl.
Состояние записи видно по плашке с волной у курсора. Индикатор можно перетащить мышью, и он запомнит новое место, если перекрывает нужный участок экрана.
Автор рассчитывает, что ввод заработает в любой программе, но сам отмечает: это ещё требует тестирования. Практический вывод для первых дней - проверьте диктовку там, где вы реально пишете: в браузере, мессенджере, редакторе кода, таблицах, поле поиска в терминале или IDE. Разные приложения по-разному принимают вставку текста, особенно если внутри работают свои буферы обмена и горячие клавиши.
Почему не нужны интернет и видеокарта
Распознавание идёт целиком на процессоре с моделью GigaAM v3. Подключение к сети не требуется, аудио не покидает компьютер, GPU не задействован. Это снимает два типичных барьера: расходы на видеокарту и зависимость от стабильного канала связи.
По памяти ориентир такой: около 600 МБ. Величина приблизительная, но она позволяет держать приложение открытым параллельно с браузером и редактором даже на 8 ГБ оперативной памяти.
Скорость: 13 секунд речи на стенде автора обрабатываются за 0,35 секунды. Оценка «на слабом ноутбуке должно быть меньше секунды» - это предположение автора, а не измеренный результат, и проверять её стоит на своей машине.
Технические детали: как GigaAM v3 и ONNX Runtime работают на C#
Ядро распознавания одно на все версии приложения. Логика не меняется при переходе между платформами, различается язык реализации: Swift на macOS, Python для Linux, C# в сборке для Windows.
Этапы распознавания: от звука до текста
- Звук с микрофона превращается в мел-спектрограмму: это представление сигнала, где по одной оси отложено время, по другой - частоты, а яркость показывает энергию.
- Мел-спектрограмма уходит в энкодер, который сжимает её в компактное описание акустических признаков.
- Декодирование RNN-T превращает это описание в последовательность токенов.
- Кусочки слов склеиваются в готовый текст, который и вставляется в активное поле.
RNN-T объединяет акустическую и языковую части в одной модели, поэтому отдельный шаг выравнивания аудио и текста не нужен. Вся цепочка выполняется на CPU: ни один этап не требует видеокарты, что и держит требования к железу на уровне офисного ноутбука.
Задержку стоит оценивать целиком, а не только по времени работы модели: в реальном использовании к обработке добавляются запись с микрофона и вставка текста в приложение. На коротких фразах это доли секунды, на длинных диктантах результат зависит уже от программы, в которую попадает текст.
Почему C# и ONNX Runtime
Для Windows ядро перенесено на C#, а модели выполняются через ONNX Runtime, который автор называет родным для этого языка. Практический смысл переноса: сама модель остаётся той же, что на macOS, меняется только платформенная обвязка вокруг неё.
Автор не раскрывает, какие именно оптимизации применялись под конкретные процессоры и менялась ли математика вычислений. Из публикации следует факт переноса и выбранный стек, поэтому воспринимать C#-версию как автоматически более быструю или более медленную, чем Swift и Python-варианты, оснований нет. Сравнивать имеет смысл на своих записях и своём железе.
Производительность и потребление ресурсов
Все цифры по производительности в этой статье - из публикации о релизе, без дополнительных замеров.
| Параметр | Значение | Что это значит |
|---|---|---|
| Обработка 13 секунд речи | 0,35 секунды | замер на стенде автора |
| Потребление памяти | около 600 МБ | приблизительная величина |
| Видеокарта | не используется | вся обработка на CPU |
| Интернет | не нужен | распознавание локальное |
| Слабый ноутбук | менее секунды | предположение автора, не измерение |
Соотношение длительности записи и времени обработки здесь примерно 37 к 1. На практике это значит, что узким местом будет не распознавание, а скорость вашей речи и паузы между фразами.
Отсутствие GPU меняет класс устройств, на которых инструмент применим: ноутбуки без дискретной видеокарты, офисные ПК, тонкие клиенты с достаточным объёмом памяти. Отдельного требования к интернету нет, поэтому сценарии в закрытой сети или на выезде не отличаются от домашних.
Ограничения первой беты: что уже работает, а что нет
- Это первая версия с базовым функционалом: без «Мозга» и без команд над выделенным текстом.
- Работа в любой программе предполагается, но ещё требует тестирования.
- Установщик не подписан, поэтому Windows и Edge будут показывать предупреждения.
- Оценка скорости на слабом ноутбуке - предположение автора.
Неподписанный установщик: как обойти предупреждения
Windows предупреждает о запуске неподписанных установщиков, а Edge показывает предупреждение при скачивании. Для беты это ожидаемое поведение, но источник файла всё равно нужно проверить. Порядок действий:
- Скачивайте установщик только со страницы официального репозитория проекта, ссылку на который автор приводит в публикации о релизе.
- Если автор публикует контрольные суммы, сверьте хеш файла до запуска.
- В окне предупреждения убедитесь, что путь к файлу совпадает с местом, куда вы его сохранили, и что имя файла не подменено.
- Исключение для одного файла безопаснее, чем полное отключение защиты на постоянной основе; выключать компоненты безопасности стоит только с пониманием риска.
Подпись установщика автор планирует получить через SignPath после того, как настроит сборку в GitHub Actions. До этого шага предупреждения останутся частью установки.
Отсутствие «Мозга» и команд над текстом
«Мозг» упоминается как отдельная функция, разбор которой остался в предыдущей статье автора. В публикации о Windows-релизе не сказано, из чего этот функционал состоит, поэтому приписывать ему конкретные возможности пока нельзя. Ясно одно: в этой бете его нет.
Команд над выделенным текстом тоже нет. Приложение набирает текст голосом, но не переписывает, не переводит и не переформатирует уже готовый фрагмент. Если рабочий процесс построен вокруг правок выделенного текста голосом, бета его не закроет.
Как установить и настроить «Гига Писарь» на Windows
Установка идёт обычным мастером: «Далее, Установить, Готово». Репозиторий проекта - github.com/moznoazachem/giga-pisar-win, код открыт под лицензией MIT. Сторонние сборки лучше не использовать: проверить происхождение файла в них сложнее.
Системные требования и совместимость
Нужны процессор, микрофон и около 600 МБ свободной памяти. Дискретная видеокарта не требуется, постоянное подключение к сети тоже. Точную минимальную версию Windows автор не называет; интерфейс при этом оформлен в стиле Windows 11. Совместимость с конкретной сборкой системы проверяйте на своей машине.
Первый запуск и настройка
После установки приложение живёт в трее, отдельное окно держать открытым не нужно. Язык интерфейса берётся из системы, уведомления приходят штатными средствами Windows, обновления ставятся автоматически.
Что стоит сделать в первые минуты:
- Разрешить доступ к микрофону, если система его запросит.
- Продиктовать короткую фразу и посмотреть, как ведёт себя плашка с волной у курсора.
- Перетащить плашку в удобное место: позицию она запомнит.
- Проверить диктовку в двух-трёх программах, где вы пишете чаще всего, и заодно оценить, как распознаются ваши термины и имена.
Сравнение с другими решениями для голосового ввода
Подходы к голосовому вводу различаются по двум осям: где обрабатывается аудио и что требуется от железа.
Облачные сервисы диктовки отправляют запись на свои серверы. Плюс: на машине не нужно ничего держать и считать. Минус: без интернета ввод не работает, а аудио покидает ваш компьютер. «Гига Писарь» устроен наоборот: модель работает локально, сеть не нужна, записи остаются у вас.
Отдельный класс инструментов - голосовое управление программами и агентами, где цель не набрать текст, а выполнить действие. Такой сценарий разобран в материале про ChatGPT Voice на десктопе: там речь идёт о командах для программ, сайтов и AI-агентов, а не о диктовке в поле ввода. «Гига Писарь» решает более узкую и более предсказуемую задачу.
Среди локальных решений распознавания речи требования к железу различаются: у части движков заявлена поддержка видеокарты, и это стоит сверять до установки. Windows-версия «Гига Писаря» обходится CPU и примерно 600 МБ памяти. Ещё одна особенность - единое ядро на всех платформах при разных языках реализации: Swift на macOS, Python для Linux, C# для Windows. Версии для macOS и Linux уже существуют, поэтому поведение можно сопоставить между системами.
Отдельно стоит держать в голове модель: GigaAM v3 от Сбера. Качество распознавания на вашей лексике, акцентах, аббревиатурах и английских терминах публикация о релизе не разбирает, поэтому проверяйте на своих записях. Если задача шире диктовки и нужно искать по содержимому локальных файлов, включая речь в аудиозаписях, это другой класс инструментов, о котором мы рассказывали в разборе поиска по содержимому файлов на Windows.
Кому и зачем нужен «Гига Писарь» на Windows
Инструмент закрывает несколько практических сценариев:
- Быстрый набор текста без клавиатуры, когда курсор уже стоит в нужном поле.
- Работа без стабильного интернета или в закрытом контуре: распознавание локальное.
- Приватность: аудио не уходит в облако, потому что обработка идёт на машине.
- Ноутбуки и офисные ПК без дискретной видеокарты.
- Разработчики и пользователи локальных LLM, которым нужен офлайн-ввод в привычные редакторы, с поправкой на то, что поведение в разных программах ещё тестируется.
Кому бета не подойдёт: тем, кто рассчитывает на команды над выделенным текстом или на «Мозг»; тем, кому нужна гарантированная работа в каждом приложении без сюрпризов; тем, кто не готов запускать неподписанный установщик на рабочей машине. Программа набирает текст, но не выполняет действия за пользователя.
Открытый код и планы по развитию
Код открыт под лицензией MIT и лежит в репозитории проекта. Это даёт три возможности: прочитать реализацию ядра на C# с ONNX Runtime, собрать свою сборку и прислать правки. Для инструмента голосового ввода открытый код полезен ещё и тем, что видно, куда уходит аудио.
Ближайший пункт планов - подпись установщика через SignPath после настройки сборки в GitHub Actions. Пока её нет, предупреждения Windows и Edge остаются частью процесса установки.
Дальше по списку функции, которых в бете нет: «Мозг» и команды над выделенным текстом. Сроков в публикации автор не называет, поэтому планировать рабочий процесс вокруг них рано.
Если решите попробовать, поставьте бету на тестовую машину или отдельный профиль, прогоните короткую фразу, длинный абзац и текст с вашими терминами в двух-трёх программах. Так вы за пару минут поймёте, хватает ли базового набора и подходит ли качество распознавания вашей лексике.