Новости ИИЗнаков 9688Время чтения25 мин

Google запускает Gemini 3.5 Transcribe с умной диктовкой и двумя API преобразования речи в текст

Gemini 3.5 Transcribe добавляет умную диктовку, поддержку более 85 языков, потоковую обработку в реальном времени, метки говорящих, временные метки и платный доступ к API.

Google представила Gemini 3.5 Transcribe 26 августа 2026 года как специализированную модель преобразования речи в текст для голосовых интерфейсов в реальном времени и записанного аудио. Выпуск в публичной предварительной версии поддерживает более 85 языков и добавляет необязательный «умный» режим, который удаляет слова-паразиты, обрабатывает произнесённые исправления и преобразует неструктурированную речь в читаемый текст.

Модель доступна разработчикам через два отдельных endpoint Gemini API. gemini-3.5-transcribe-live обрабатывает аудио в реальном времени через Live API, а gemini-3.5-transcribe обрабатывает загруженные записи через Interactions API. Google также внедрила базовую технологию транскрибации в ряд потребительских продуктов, включая Rambler в Gboard и приложение Gemini для macOS.

Различие между транскрибацией и более широким поведением ассистента важно. Gemini 3.5 Transcribe сама по себе генерирует текст; в справочнике моделей Google вызов функций, поиск по файлам, генерация изображений, выполнение кода и рассуждение указаны как неподдерживаемые возможности. Когда приложение для macOS использует продиктованную команду для создания сводки файла или генерации изображения, эту работу после транскрибации речи выполняют другие модели Gemini и инструменты на уровне продукта.

1. Две модели обслуживают разные аудиосценарии

Потоковая модель подключается через двунаправленную WebSocket-сессию и выдаёт инкрементальный текст, пока аудио ещё поступает. Google характеризует задержку как менее одной секунды, что делает endpoint подходящим для субтитров, интерфейсов диктовки и голосовых приложений, которым нужен видимый текст ещё до того, как говорящий завершит длинный фрагмент.

Потоковые сессии принимают необработанное 16-битное PCM-аудио; руководство Google по реализации указывает монофонический звук с частотой дискретизации 16 кГц и рекомендует фрагменты длительностью примерно 100 миллисекунд. Непрерывная сессия потоковой транскрибации ограничена 10 минутами. Приложениям, которым нужны более длительные разговоры, необходимо самостоятельно управлять сменой сессий в собственной инфраструктуре.

Непотоковая модель принимает предварительно записанные аудиофайлы и может обрабатывать до одного часа в одном запросе. При включении временных меток на уровне слов или диаризации говорящих этот лимит сокращается до 30 минут. В отличие от потокового endpoint, она может добавлять смещения начала и конца к отдельным словам и определять говорящих в записи.

В анонсе Google говорится об определении говорящих для не более чем трёх человек. В справочнике API указана поддержка до восьми, однако атрибуция с участием трёх и более говорящих помечена как экспериментальная. Поэтому разработчикам, обрабатывающим более крупные встречи, следует рассматривать показатель в восемь говорящих как технический предел, а не как гарантию стабильного качества атрибуции.

Оба endpoint автоматически определяют поддерживаемые языки и могут переключать языки в рамках сессии или предложения, не требуя от разработчиков заранее задавать один язык. Если язык известен, приложение может передать код BCP-47, чтобы сместить распознавание в его сторону.

Пользовательский словарь предлагает второй способ управления. Разработчики могут предоставить до 1 000 терминов для имён, аббревиатур, технических выражений или других редких фраз. Google сообщает, что результаты обычно лучше со списками не более чем из 100 терминов, что указывает на предпочтительность целевых словарей перед широкими словарными базами.

2. Умная транскрибация меняет результат, а не только его представление

Gemini 3.5 Transcribe имеет два режима вывода. Режим по умолчанию VERBATIM сохраняет слова-паразиты, повторы, ложные начала и произнесённые самокоррекции. Вместо этого режим SMART пытается сформировать текст, который говорящий намеревался передать.

В умном режиме модель может удалять выражения вроде «эм» и «ээ», устранять заикание и расставлять пунктуацию и регистр предложений. Она также обрабатывает встроенные исправления: если говорящий сначала называет вторник, а затем исправляет дату на среду, транскрипт содержит только среду.

Система форматирования может преобразовать произнесённую последовательность в абзацы, маркированные пункты или нумерованные списки. Она также применяет обратную нормализацию текста, превращая произнесённые величины в компактные письменные формы — например, преобразуя «двадцать шесть миллионов долларов» в $26M.

Такое поведение делает умный режим полезным для сообщений, заметок, промптов и первых черновиков. Однако он не равнозначен дословной записи. Поскольку модель намеренно удаляет и переписывает части высказывания, организациям, создающим юридические транскрипты, исследовательские данные, цитаты или записи для соблюдения требований, следует использовать дословный вывод и сверять результат с исходным аудио.

Google также устанавливает техническое разделение между очищенным выводом и подробными аннотациями. Умную транскрибацию нельзя объединить с временными метками на уровне слов или диаризацией говорящих в API для записанного аудио. Для этих функций требуется дословный режим. Потоковая транскрибация поддерживает умное форматирование, но не предоставляет ни временных меток на уровне слов, ни диаризации говорящих; вместо этого она выдаёт временные метки на уровне высказываний.

3. Независимое тестирование относит модель к наиболее точным облачным системам

Google называет Gemini 3.5 Transcribe своей самой точной на сегодняшний день моделью преобразования речи в текст и позиционирует её как преемника Chirp 3. В многоязычном бенчмарке FLEURS Google сообщает о коэффициенте ошибок в словах 5.50% для потоковой транскрибации и 5.04% для непотоковой обработки по выборке ведущих языков и локалей.

Коэффициент ошибок в словах измеряет замены, удаления и вставки относительно эталонного транскрипта; более низкие значения означают меньше ошибок. Эти показатели относятся к конкретному бенчмарку и не должны восприниматься как универсальные уровни ошибок для любого акцента, микрофона или акустической среды.

Отдельно Google сообщает, что Artificial Analysis измерила средние уровни ошибок 4.0% для потокового и 2.6% для непотокового использования. Компания также заявляет о сокращении на 70% времени, необходимого для создания итогового транскрипта, по сравнению с Chirp 3.

Публичный рейтинг Artificial Analysis для непотоковых систем подтверждает результат 2.6%. На момент публикации он помещал Gemini 3.5 Transcribe на пятое место по точности среди перечисленных систем, после моделей с результатами от 1.7% до 2.4%. Тест объединяет около восьми часов аудио из разговорных, парламентских и корпоративных датасетов отчётности о доходах, а не опирается на один корпус чистой речи.

Та же независимая таблица указывает коэффициент скорости обработки приблизительно 82.5, то есть в условиях этого бенчмарка сервис обрабатывал около 82.5 секунды аудио за секунду. Artificial Analysis оценила стоимость в $5 за 1 000 минут, что соответствует приблизительной смешанной цене непотокового API от Google.

Эти измерения подтверждают утверждение Google о конкурентоспособности модели, но не то, что она неизменно является наиболее точным доступным сервисом. Для производственного применения всё равно требуются оценки на репрезентативных записях, особенно когда пригодность транскрипта определяется переключением кодов, специализированной лексикой, перекрывающейся речью или шумными каналами.

4. Стоимость начинается примерно с половины цента за минуту записанного аудио

В ценах платного Gemini Developer API Google указывает стоимость непотокового аудиоввода $2 за миллион токенов, или ориентировочно $0.003 за минуту. Текстовый вывод стоит $12 за миллион токенов, что оценивается ещё в $0.002 за минуту. Поэтому Google приводит смешанную оценку приблизительно $0.005 за каждую минуту записанного аудио.

Потоковая транскрибация стоит дороже. Аудиоввод оценивается в $3.50 за миллион токенов, или приблизительно $0.005 за минуту, а сгенерированный текст — в $21 за миллион токенов, что оценивается в $0.004 за минуту. Google рассчитывает эффективную совокупную цену около $0.009 за минуту потоковой обработки.

Оба варианта имеют бесплатный уровень API. В таблице цен Google также указано, что контент на бесплатном уровне может использоваться для улучшения её продуктов, тогда как контент на платном уровне по указанным условиям для этой цели не используется. Командам, обрабатывающим конфиденциальные записи, следует до внедрения оценить применимый уровень сервиса, региональную доступность и условия управления данными.

Ни одна из моделей транскрибации не поддерживает пакетный, flex- или priority-инференс. Заземление через Google Search также недоступно. Это специализированный сервис преобразования аудио в текст, а не универсальная модель Gemini, в которую транскрибация добавлена как одна из возможностей, вызываемых промптом.

5. Google встраивает транскрибацию в интерфейсы диктовки и агентов

Для потребителей Gemini 3.5 Transcribe доступна на английском языке через приложение Gemini для macOS и через Rambler на Android в отдельных странах и на отдельных языках. Rambler может очищать продиктованный текст, исправлять орфографические ошибки, вносить правки и менять стиль письма с помощью голосовых инструкций.

В Google Antigravity транскрибация может использовать разрешённый экранный контекст и историю чата, чтобы лучше обрабатывать имена файлов, активные документы и вывод агента. Google AI Studio также предоставляет модель в режиме Build, чтобы разработчики могли диктовать при создании приложений.

Приложение Gemini для macOS объединяет транскрибацию с экранным контекстом и другими моделями Gemini. Голосовые запросы могут запускать рабочие процессы, включающие сводки локальных файлов, повторное использование текста между приложениями, поиск или генерацию изображений. Эти действия являются функцией интеграции: специализированная модель транскрибации преобразует речь в текст, а окружающее приложение маршрутизирует полученную команду.

Google сообщает, что поддержка голосового ввода для произвольных веб-полей появится в Chrome, но она не входит в текущий доступный выпуск. Корпоративный доступ находится в публичной предварительной версии через Gemini Enterprise Agent Platform, а поддержка Gemini Enterprise for Customer Experience планируется отдельно.

Таким образом, запуск меняет не только точность распознавания. Google теперь предлагает единый слой транскрибации для потребительской диктовки, сред разработки, корпоративной обработки аудио и голосовых интерфейсов в реальном времени. Разработчики могут выбирать очищенный или дословный вывод, но им также приходится выбирать между низкой задержкой потокового endpoint и метками говорящих и пословным таймингом endpoint для записанного аудио.

Частые вопросы

Gemini 3.5 Transcribe уже доступна в общем режиме?

Нет. Google указывает сервисы для разработчиков и предприятий как публичные предварительные версии.

Сколько языков поддерживает модель?

Она автоматически определяет и транскрибирует более 85 языков, включая переключение языка внутри высказывания или сессии.

Может ли потоковая модель определять говорящих?

Нет. Диаризация говорящих и временные метки на уровне слов доступны только для предварительно записанного аудио в дословном режиме.

Сохраняет ли умная транскрибация точные слова говорящего?

Нет. Она может удалять слова-паразиты, обрабатывать исправления, перестраивать текст и менять форматирование. Используйте дословный режим, когда точная формулировка имеет значение.

Сколько стоит API?

Google оценивает стоимость приблизительно в $0.005 за минуту для непотоковой транскрибации и $0.009 за минуту для потоковой транскрибации на платном уровне.

Источники

Share

Поделиться статьёй