В версии 1.0.5 «Гига Писаря» для Windows появилась функция «Мозг»: распознанный на компьютере текст уходит в нейросеть, которая вычищает слова-паразиты, повторы и оговорки, расставляет знаки препинания и возвращает в документ готовый к чтению вариант. Пулреквест прислал сторонний автор, автор приложения его принял и доработал.
Подключить можно любую нейросеть с OpenAI-совместимым API: облачные сервисы по ключу (OpenRouter, DeepSeek, OpenAI, Groq, Gemini, Claude) или свой сервер (LM Studio, Ollama, llama.cpp). Распознавание речи остаётся локальным, звук никуда не отправляется, на сервер уходит только текст и только при явном включении функции. По умолчанию «Мозг» выключен.
Обновления вышли на обеих платформах: 1.0.5 для Windows и 3.7.1 для macOS. Функция помечена как бета, а следующим шагом заявлен офлайн-«Мозг» на Windows. Windows-сборку с момента релиза скачали больше трёхсот раз, первые баги из комментариев автор починил в тот же день в описании обновления.
Что нового в Гига Писарь 1.0.5
Главное изменение Windows-версии - облачная правка текста. До этого «Гига Писарь» распознавал речь и вставлял результат туда, где стоит курсор. Теперь между распознаванием и вставкой появился промежуточный шаг: черновик можно отправить в нейросеть, которая приводит его в человеческий вид. О том, как устроена офлайн-диктовка на GigaAM v3 и как поставить сборку с неподписанным инсталлятором, мы писали в отдельном материале.
Ключевые улучшения в Windows-версии
- Постобработка текста нейросетью. Из диктовки уходят «ну», «э-э», повторы и оговорки, знаки препинания расставляются автоматически, в документ попадает уже причёсанный текст.
- Правка выделенного текста голосом. Выделяете фрагмент, зажимаете клавишу диктовки и говорите, что с ним сделать: «сделай короче», «исправь ошибки», «переведи на английский».
- Вторая клавиша диктовки на выбор: левый Ctrl + Win.
- Переработанное окно настроек. Вместо одного длинного окна, которое на ноутбуке не влезало в экран, разделы «Диктовка», «Мозг» и «О программе» слева и их содержимое справа, по логике Параметров Windows 11.
- Упрощённая настройка «Мозга». Раньше требовалось вписать адрес сервиса, ключ и название модели. Теперь достаточно выбрать сервис из списка и вставить ключ: Писарь по виду ключа определяет провайдера, проверяет его, загружает список моделей и выбирает подходящую.
Ключ хранится в зашифрованном виде, а в меню у значка в трее всегда видно, включён «Мозг» или нет и на какой сервер уходит текст.
Что изменилось на macOS в версии 3.7.1
На macOS «Мозг» был и раньше, но только встроенный. Возможность подключить свою нейросеть по ключу стояла в планах, и в версии 3.7.1 её собрали заново на другом языке программирования. Ключ на этой платформе хранится в Связке ключей. Также на macOS доступна правка выделенного текста голосом и опция «Править каждую диктовку»: через нейросеть проходит весь распознанный текст, а не отдельные фрагменты.
Как работает «Мозг»: постобработка текста нейросетью
Схема простая. Приложение распознаёт речь на компьютере и получает черновую расшифровку. Если «Мозг» включён, текст уходит по OpenAI-совместимому API в выбранную модель, а вернувшийся отредактированный вариант вставляется в активное окно вместо сырой расшифровки. Ничего другого в цепочку не добавляется: ни записи звука, ни промежуточных сервисов.
Как это выглядит на практике: черновая расшифровка вроде «ну, это, короче, я хотел сказать...» превращается в аккуратное «Я хотел сказать...». Пример условный, но он показывает суть: смысл остаётся, словесный мусор и паузы исчезают.
Какие задачи решает «Мозг»
- удаление слов-паразитов вроде «ну» и «э-э»;
- удаление повторов и оговорок, которые появляются при быстрой речи;
- расстановка знаков препинания, включая запятые в длинных перечислениях;
- правка уже готового текста по голосовой команде.
Черновая диктовка почти всегда требует второго прохода: перечитать, вычистить «э-э», разбить на предложения. «Мозг» делает этот проход автоматически, поэтому время уходит только на проговаривание, а не на редактуру. На macOS опция «Править каждую диктовку» избавляет и от ручного запуска обработки.
Поддерживаемые сервисы и модели
Требование одно: у нейросети должен быть OpenAI-совместимый API. Этому условию соответствуют крупные облачные провайдеры и локальные серверы, которые обычно поднимают на домашней машине.
| Вариант | Что это | Что потребуется |
|---|---|---|
| OpenRouter | Агрегатор: один ключ открывает доступ к множеству моделей | API-ключ |
| DeepSeek, OpenAI, Groq, Gemini, Claude | Облачные сервисы, выбираются в настройках из списка | API-ключ |
| LM Studio, Ollama, llama.cpp | Локальные серверы на своём компьютере или в рабочей сети | Запущенный сервер |
Никаких отдельных плагинов под каждый сервис ставить не нужно: разница только в ключе и адресе, к которому обращается приложение.
Настройка «Мозга»: пошаговая инструкция
Функция выключена по умолчанию, поэтому после обновления её нужно включить вручную. На Windows настройки разбиты на три раздела: «Диктовка», «Мозг» и «О программе».
Подключение облачного сервиса
- Получите API-ключ у выбранного провайдера: OpenRouter, DeepSeek, OpenAI, Groq, Gemini или Claude.
- Откройте настройки и перейдите в раздел «Мозг».
- Выберите сервис из списка. OpenRouter удобен тем, что один ключ даёт доступ сразу к большому набору моделей.
- Вставьте ключ. Писарь сам определит сервис по виду ключа, проверит его, загрузит список моделей и выберет подходящую.
- Включите «Мозг» и посмотрите на трей: там отображается, активна ли функция и на какой сервер уходит текст.
Ключ на Windows хранится в зашифрованном виде, на macOS - в Связке ключей. Название модели вручную вписывать не нужно, его подбирает приложение.
Подключение локального сервера
Если не хочется отдавать текст наружу, в списке сервисов выбирается свой сервер: LM Studio, Ollama или llama.cpp. Нейросеть работает на вашем железе, и текст остаётся в локальной сети или на самой машине. Какие именно поля потребуется заполнить для своего сервера, в описании обновления не расписано: смотрите на интерфейс раздела «Мозг» в вашей сборке и на параметры, с которыми запущен локальный сервер. Автоматический подбор модели по ключу в этом случае не работает, потому что ключа нет.
Безопасность и приватность
Распознавание речи целиком идёт на компьютере, поэтому аудио никуда не уходит. На сервер отправляется только текст и только при явном включении «Мозга», а по умолчанию отправка выключена. Формулировка автора звучит так:
Звук при этом никуда не уходит, распознавание остаётся на компьютере, на сервер отправляется только текст, и только если ты сам это включил, по умолчанию всё выключено.
Ключи тоже защищены: на Windows в зашифрованном виде, на macOS в Связке ключей. Статус функции и адрес сервера видны в трее, то есть проверить, куда уходит текст, можно в любой момент, не открывая настройки.
Практический вывод простой. Если в диктовке бывают рабочие документы, переписка или что-то чувствительное, есть два пути: держать «Мозг» выключенным и пользоваться сырой расшифровкой либо подключать локальный сервер, при котором текст не покидает вашу машину. Облачный вариант означает, что текст обрабатывается на стороне провайдера, и дальше вопрос к его политике и условиям.
Ограничения и статус бета-версии
Функция помечена как бета, и это главное, что нужно учитывать. Первые баги из комментариев автор починил в день релиза, но единичный случай не гарантирует, что проблем не будет в других сценариях. Что стоит держать в голове:
- Облачный режим требует интернета и рабочего API-ключа. Тарифы, лимиты и правила обработки данных задаёт провайдер, их стоит прочитать до подключения.
- Локальный сервер должен быть запущен на вашей стороне, и часть нагрузки ложится на железо этой машины.
- Офлайн-«Мозг» на Windows пока только заявлен как следующий шаг. В версии 1.0.5 его нет: постобработка возможна либо через облако, либо через локальный сервер.
- Описание обновления опубликовано сразу после релиза, и часть деталей интерфейса в нём не раскрыта. Поведение отдельных элементов удобнее проверять в самой сборке.
Следующим шагом автор называет офлайн-«Мозг» для Windows. Когда он появится, облако и ключи перестанут быть обязательными для постобработки на этой платформе.
Практические сценарии использования
Сценарии, под которые функция заточена, понятны из её устройства.
- Черновик статьи или письма. Вы наговариваете текст в том темпе, в котором думаете, а «Мозг» убирает «ну», «э-э», повторы и оговорки и расставляет знаки. На выходе получается текст, который можно сразу читать, а не расшифровка стенограммы.
- Правка выделенного фрагмента голосом. Пара фраз вроде «сделай короче» или «исправь ошибки» заменяет ручную редактуру абзаца. Команду «переведи на английский» удобно использовать при переписке с зарубежными коллегами.
- Заметки на ходу. Быстрая диктовка мыслей с автоматической очисткой подходит, когда печатать некогда, а читать черновик потом придётся вам же.
- Править каждую диктовку на macOS. Опция избавляет от выбора отдельных фрагментов: обработка идёт по умолчанию для всего распознанного текста.
Обратная сторона у сценариев с облаком одна: чем чаще включён «Мозг», тем больше текста уходит провайдеру. Для чувствительных заметок логичнее держать функцию на паузе или переключиться на локальный сервер.
Сравнение с аналогами и альтернативами
На рынке есть два соседних класса решений. Первый - приложения для диктовки, которые распознают речь и вставляют текст в любое поле. Второй - AI-надстройки над конкретным редактором, например ChatGPT for Word: он работает в боковой панели Word, правит документ напрямую и тоже умеет переписывать абзацы и проверять ошибки. Разница в точке применения: там редактор внутри Word, здесь системная диктовка с постобработкой, которая вставляется в любое активное окно.
Ключевое отличие «Гига Писаря» в том, что провайдера постобработки выбирает пользователь: облако по ключу или собственный сервер с OpenAI-совместимым API. Распознавание речи при этом остаётся локальным, что для голосового ввода важнее, чем для правки текста. Детальные сравнения по качеству и скорости без замеров приводить смысла нет.
Итоги: кому стоит обновиться
Обновление до 1.0.5 на Windows имеет смысл в первую очередь тем, кто уже диктует много и регулярно правит расшифровки руками. Автоматическая чистка от слов-паразитов и расстановка знаков экономят тот самый второй проход по тексту. Пользователям macOS версия 3.7.1 интересна возможностью подключить свою нейросеть по ключу и опцией «Править каждую диктовку».
Отдельная группа - те, для кого приватность важнее удобства: им подойдёт связка локального распознавания с локальным сервером вроде LM Studio, Ollama или llama.cpp. Текст в этом случае не покидает машину.
Статус беты стоит учитывать всем: если диктовка встроена в критичный рабочий процесс, разумно сначала проверить функцию на нескольких задачах и только потом делать её частью ежедневной рутины. Начать проще с локального сервера: он показывает, как работает постобработка, не отправляя наружу ни строчки.
Источник
Основные факты и цитаты приведены по публикации автора: «Гига Писарь: первый пулреквест на Windows и Мозг со своим ключом в облаке».