Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Автоматическая транскрибация аудио и видео с Whisper: пошаговая настройка на Windows

Пошаговое руководство по установке и настройке Whisper от OpenAI на Windows. Узнайте, как расшифровать аудио и видео в текст одной командой, выбрать модель под

Коротко

Что будет в материале

  1. 01

    Что такое Whisper и почему он решает проблему транскрибации

  2. 02

    Подготовка среды: установка Python и FFmpeg

  3. 03

    Установка Whisper и выбор модели

  4. 04

    Первая транскрибация: из аудио и видео в текст

Whisper - нейросеть от OpenAI для распознавания речи, которая работает локально на вашем компьютере. Ей не нужен интернет, ваши аудиозаписи не покидают устройство, а качество транскрибации сопоставимо с коммерческими облачными сервисами. Система определяет 99+ языков, включая русский, и справляется с акцентами, фоновым шумом и технической лексикой.

Это руководство проведёт вас от установки Python до готового текстового протокола или субтитров. Вы узнаете, какую модель выбрать под свою задачу, как запустить расшифровку одной командой и что делать, если результат не идеален. Все примеры проверены на Windows 10/11, но логика применима к macOS и Linux.

Что такое Whisper и почему он решает проблему транскрибации

Whisper - это нейросетевая архитектура типа encoder-decoder, обученная на 680 000 часах размеченной речи. OpenAI выложила модель в открытый доступ, и сейчас это стандарт де-факто для офлайн-распознавания речи. Модель принимает аудиофайл, разбивает его на 30-секундные сегменты и предсказывает текст, временные метки и язык. Результат - связный текст, а не поток слов.

Ключевые преимущества перед облачными аналогами вроде Google Speech-to-Text или Deepgram:

  • Приватность. Аудио не отправляется на сторонние серверы. Это критично для врачебных консилиумов, юридических консультаций и внутренних совещаний, где NDA запрещает облачную обработку.
  • Отсутствие подписки. Вы платите только электричеством и временем GPU/CPU. Однажды настроенный Whisper расшифровывает гигабайты аудио без лимитов.
  • Автономность. Работает в полевых условиях, в цеху без интернета, в командировке. Ноутбука с интегрированной графикой достаточно для модели small.

Типичные сценарии, в которых Whisper окупает час настройки: расшифровка лекций и семинаров в текст для студентов, создание субтитров к видео на YouTube, подготовка протоколов совещаний, транскрибация интервью и подкастов. Разработчики встраивают Whisper в пайплайны обработки звонков колл-центра, а журналисты используют для быстрой расшифровки диктофонных записей.

Для тех, кто хочет попробовать Whisper без установки, существуют веб-реализации на WebAssembly - например, Whisper Web. Обработка идёт прямо в браузере, данные не покидают устройство. Подходит для разовых задач, но проигрывает нативной версии в скорости на больших файлах.

Подготовка среды: установка Python и FFmpeg

Whisper написан на Python и требует FFmpeg для декодирования аудио- и видеоконтейнеров. Без FFmpeg вы получите ошибку «FileNotFoundError: ffmpeg not found» при попытке обработать MP4 или MP3. Установим оба компонента.

Установка Python: первый шаг

  1. Скачайте установщик с python.org. Для Windows берите версию 3.10 или 3.11 - с ними протестирована стабильная работа openai-whisper. Версия 3.12 тоже работает, но могут быть нюансы с зависимостями.
  2. Запустите установщик. Обязательно отметьте чекбокс «Add Python to PATH» внизу окна. Без этого команда python не будет доступна из командной строки.
  3. Нажмите «Install Now» и дождитесь завершения.
  4. Откройте командную строку (Win+R, cmd) и проверьте установку: python --version. Ответ должен быть «Python 3.10.x» или аналогичным.

Если получили ошибку «python не является внутренней или внешней командой», перезапустите командную строку. Не помогло - добавьте PATH вручную: «Этот компьютер» → Свойства → Дополнительные параметры системы → Переменные среды → Path → Добавьте пути к папке Python и Scripts (обычно C:\Users\ВашеИмя\AppData\Local\Programs\Python\Python310 и ...\Python310\Scripts).

Настройка FFmpeg: ключевой компонент для работы с медиа

FFmpeg - набор библиотек для работы с аудио и видео. Whisper использует его для чтения сжатых форматов (MP3, AAC, Opus) и извлечения звуковой дорожки из видеофайлов. Два способа установки:

Способ 1: через Chocolatey (рекомендуемый)

Если у вас установлен пакетный менеджер Chocolatey, откройте терминал от имени администратора и выполните:

choco install ffmpeg

Chocolatey сам скачает сборку, распакует и пропишет PATH. Перезапустите терминал и проверьте: ffmpeg -version.

Способ 2: ручная установка

  1. Скачайте актуальную сборку с gyandev (выбирайте «release essentials» для вашей архитектуры).
  2. Распакуйте архив в C:\ffmpeg.
  3. Добавьте C:\ffmpeg\bin в системный PATH (как описано выше для Python).
  4. Проверьте командой ffmpeg -version в новом окне терминала.

После установки обоих компонентов среда готова. Переходим к Whisper.

Установка Whisper и выбор модели

Установка openai-whisper выполняется одной командой:

pip install openai-whisper

Пакет потянет зависимости: torch, numpy, tiktoken. Если у вас видеокарта NVIDIA и вы хотите ускорить инференс, предварительно установите PyTorch с поддержкой CUDA по инструкции с pytorch.org. Для процессорного режима дополнительных действий не требуется.

При первом запуске Whisper автоматически скачает выбранную модель в папку %USERPROFILE%\.cache\whisper. Размеры моделей и сценарии применения - в таблице.

Сравнение моделей: скорость vs точность

МодельПараметрыVRAM/RAMСкорость (отн.)WER на русскомСценарий
tiny39M~1 ГБ10x~15-20%Черновая расшифровка длинных записей, поиск по ключевым словам
base74M~1 ГБ7x~12-15%Быстрая транскрибация подкастов, первичный анализ содержания
small244M~2 ГБ4x~8-12%Субтитры для внутреннего использования, расшифровка встреч
medium769M~5 ГБ2x~6-9%Хорошие субтитры для публикации, транскрибация интервью
large1550M~10 ГБ1x~4-7%Субтитры вещательного качества, протоколы с высокой точностью

WER (Word Error Rate) - процент неправильно распознанных слов. Цифры ориентировочные, реальный WER зависит от качества записи, дикции говорящего и фонового шума. Модель large-v3 на чистом студийном аудио даёт WER около 4%, на уличной записи с ветром - до 15%.

Рекомендация: начните с base или small. Оцените качество на своих данных. Если ошибок слишком много - переходите на medium. Large используйте для ответственных задач: субтитры к видео на широкую аудиторию, расшифровка медицинских диктовок, создание текстовых архивов с требованием высокой точности.

Пример команды с указанием модели:

whisper zapis.mp3 --model small

При первом запуске модель загрузится (small весит около 500 МБ). Последующие запуски используют кешированную версию.

Первая транскрибация: из аудио и видео в текст

Базовый синтаксис:

whisper путь_к_файлу --model модель [опции]

Whisper принимает все распространённые форматы: MP3, WAV, FLAC, OGG для аудио; MP4, AVI, MKV, MOV для видео. Аудиодорожка из видео извлекается автоматически через FFmpeg.

Примеры:

# Расшифровка MP3-записи лекции моделью base
whisper lekciya.mp3 --model base

# Транскрибация видео с собрания моделью small
whisper meeting.mp4 --model small

# Принудительное указание языка (ускоряет обработку)
whisper interview.wav --model medium --language ru

Без флага --language Whisper автоматически определяет язык по первым секундам аудио. Для многоязычных записей это полезно, для моноязычных - добавляет 1-2 секунды к обработке. Указание языка явно отключает автоопределение и немного ускоряет инференс.

Результат по умолчанию выводится в консоль и сохраняется в файлы: TXT (сплошной текст), VTT (субтитры с временными метками), SRT (альтернативный формат субтитров), TSV (таблица слов с таймингами), JSON (полные метаданные).

Экспорт результатов: TXT, SRT, VTT

Управлять форматами вывода можно флагом --output_format:

# Только субтитры
whisper video.mp4 --model medium --output_format srt

# Текст и субтитры
whisper audio.mp3 --model small --output_format txt,vtt

# Все форматы
whisper recording.wav --model large --output_format all

Разница между форматами:

  • TXT - сплошной текст без временных меток. Подходит для чтения, копирования в документ, полнотекстового поиска.
  • SRT/VTT - субтитры с номерами блоков и временными метками начала/конца. SRT используют видеоредакторы (DaVinci Resolve, Premiere Pro), VTT - веб-плееры и YouTube. Для загрузки субтитров на YouTube берите VTT.
  • TSV - таблица, где каждая строка - слово с временной меткой начала и конца. Нужна для лингвистического анализа и тонкой постобработки.
  • JSON - полные метаданные: текст, сегменты, вероятности токенов, язык. Используется при интеграции Whisper в программные пайплайны.

После выполнения команды в папке с исходным файлом появятся результаты. Для файла meeting.mp4 и модели small это будут meeting.mp4.txt, meeting.mp4.srt, meeting.mp4.vtt, meeting.mp4.tsv, meeting.mp4.json.

Если вы работаете с видео на Mac и хотите выжать максимум производительности из Apple Silicon, обратите внимание на Yttri Meet - инструмент, который расшифровывает и конспектирует видеозвонки прямо на вашем ПК без отправки аудио в облако.

Типичные проблемы и ограничения

Whisper не идеален. Качество транскрибации падает в четырёх случаях:

  1. Фоновый шум. Уличный трафик, гул офиса, эхо в пустой комнате. Модель начинает «додумывать» слова, которых не было. Решение: предварительная очистка аудио через фильтры FFmpeg или Audacity. Простейший шумодав на FFmpeg: ffmpeg -i input.mp3 -af "highpass=200,lowpass=3000" output.wav - обрезает частоты вне речевого диапазона.
  2. Несколько говорящих. Whisper не различает спикеров (диаризация не встроена). Реплики сливаются в сплошной текст. Для разделения нужен дополнительный инструмент - pyannote.audio. Связка Whisper + pyannote даёт диаризацию с точностью DER около 15-20% на чистых записях. Наш обзор Trelis Tiron разбирает open-weight модель, которая объединяет транскрипцию и диаризацию в единой архитектуре - альтернативу связке Whisper + PyAnnote.
  3. Специфическая терминология. Медицинские, юридические, технические термины Whisper может путать с похожими по звучанию словами. Решение: постобработка с заменой по словарю или fine-tuning модели на доменных данных (трудоёмко, но даёт прирост точности на 10-15%).
  4. Ресурсоёмкость. Модель large требует до 10 ГБ оперативной памяти. На ноутбуке с 8 ГБ ОЗУ она уйдёт в своп и будет работать в 5-10 раз медленнее. Используйте medium или small, если железо ограничено.

Другие частые ошибки:

  • «CUDA out of memory» - видеокарта не тянет модель. Уменьшите размер модели или используйте CPU-режим (флаг --device cpu).
  • «FileNotFoundError: ffmpeg» - FFmpeg не установлен или не прописан в PATH. Вернитесь к разделу «Настройка FFmpeg».
  • Путаница в цифрах и именах собственных. Whisper склонен ошибаться в числах (12 vs 17) и редких фамилиях. Для протоколов с цифрами выверяйте результат вручную.

Альтернативы: Whisper в браузере без установки

Если установка Python и FFmpeg кажется избыточной для разовой задачи, используйте веб-реализации Whisper на WebAssembly. Whisper Web загружает модель (обычно tiny или base) в память браузера и выполняет инференс локально. Аудио не отправляется на сервер - приватность сохраняется.

Плюсы: не требует установки, работает на любой ОС с современным браузером (Chrome, Edge, Firefox), модель кешируется для повторных запусков. Минусы: только модели tiny и base из-за ограничений WebAssembly по памяти, скорость ниже нативной версии в 1.5-2 раза, файлы больше 100 МБ обрабатываются с задержками.

Для регулярной работы с транскрибацией нативная установка выигрывает по всем параметрам. Веб-версия - компромисс для тестирования и эпизодических задач.

Практические сценарии внедрения

Whisper закрывает три основные бизнес-потребности:

Протоколы совещаний. Запись митинга в Zoom/Teams → экспорт аудиодорожки → транскрибация моделью medium/large → текстовая основа протокола. Экономия: 30-60 минут ручной расшифровки с каждой встречи. При 10 совещаниях в неделю это 5-10 часов сэкономленного времени. Для тех, кто хочет автоматизировать процесс полностью - от захвата звука до готового конспекта - Yttri Meet интегрирует транскрибацию прямо в видеозвонки с локальной обработкой.

Субтитры для видео. Образовательные курсы, корпоративные вебинары, YouTube-каналы. Whisper генерирует VTT-файл, который загружается в видеохостинг или видеоредактор. Точность large-модели на чистом голосе достаточна для публикации без ручной коррекции в 80% случаев. Оставшиеся 20% - имена собственные и термины, которые проще поправить вручную, чем расшифровывать всё с нуля.

Транскрибация интервью и подкастов. Журналисты и исследователи получают текстовую версию для анализа, цитирования и поиска. Модель medium на часовом интервью работает 10-15 минут на GPU среднего уровня. Ручная расшифровка того же часа заняла бы 4-6 часов.

Для голосового взаимодействия в реальном времени посмотрите голосовой режим Claude - он позволяет не только распознавать речь, но и выполнять действия через Gmail, Calendar и Slack. А если вы экспериментируете с локальным синтезом речи в паре с распознаванием, пригодится TTS Studio - десктопный GUI для Kokoro и Chatterbox с автоматическим чанкингом длинных текстов.

Whisper - базовый строительный блок для любого офлайн-пайплайна обработки речи. Один раз настроив, вы получаете инструмент, который работает без подписки, без интернета и без утечек данных.

Подписаться на канал