UA / RU
Поддержать ZN.ua

Google выпустила новую модель Gemini 3.5 Transcribe для транскрипции аудио в режиме реального времени

Модель автоматически распознает более 85 языков, учитывает специальную лексику и различает голоса.

Google недавно выпустила Gemini 3.7 Flash — модель для программирования и автоматизации бизнес-задач. Теперь компания представила Gemini 3.5 Transcribe — новую модель для точного преобразования речи в текст в режиме реального времени и по записанному аудио. Она автоматически удаляет слова-паразиты, учитывает исправления пользователя и форматирует результат. Об этом сообщили в Google.

Google называет Gemini 3.5 Transcribe своей самой точной моделью для распознавания речи. Она создана в первую очередь для голосовых интерфейсов и должна работать лучше, чем обычные системы speech-to-text, в шумной обстановке, со сложной терминологией и естественными речевыми паузами. Модель преобразует необработанную аудиозапись сразу в очищенный и структурированный текст. Компания уже использует эту технологию в своих продуктах, в частности в Gemini и Android.

Читайте также: Крупные издатели подали в суд на Google из-за обучения Gemini на книгах

Теперь аналогичные возможности стали доступны разработчикам через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Модель можно интегрировать в голосовые агенты, системы субтитров в реальном времени и сервисы для анализа звонков. Google предлагает два отдельных режима. Первый работает с потоковым аудио в реальном времени через Live API и модель gemini-3.5-transcribe-live, второй обрабатывает предварительно записанные файлы через Interactions API и модель gemini-3.5-transcribe.

В режиме реального времени Gemini 3.5 Transcribe поддерживает непрерывную двустороннюю передачу данных с задержкой менее секунды. Такой вариант ориентирован на интерактивные голосовые приложения. Для записанного аудио модель может создавать транскрипции встреч, телефонных разговоров и других материалов, определять собеседников и добавлять временные метки на уровне отдельных слов.

Одной из главных возможностей стала так называемая «умная транскрипция». Модель понимает самоисправления прямо во время речи. Например, фразу «встретимся во вторник — нет, в среду» она может сразу преобразовать в окончательный вариант без лишнего фрагмента. Также система удаляет «эм», «ээ» и другие слова-паразиты и самостоятельно форматирует текст.

Gemini 3.5 Transcribe поддерживает функциональные вызовы других моделей Gemini. Благодаря этому голосовая команда может запускать более сложные действия, например анализ файла или генерацию изображения. Пока такая возможность доступна, в частности, в приложении Gemini для macOS. Другие модели Gemini выполняют отдельные задачи, а Transcribe отвечает за понимание голосового запроса.

По данным Artificial Analysis, средний показатель Word Error Rate для Gemini 3.5 Transcribe составляет 4% в потоковом режиме и 2,6% при обработке записанного аудио. Модель также демонстрирует высокую точность в реальной шумной среде. Она способна правильно распознавать сложные буквенно-цифровые последовательности, в частности почтовые индексы, номера заказов и подобные данные.

Отдельная функция позволяет передавать модели специальный словарь. Благодаря этому система лучше распознает профессиональный жаргон, термины, необычные варианты написания и собственные названия. Gemini 3.5 Transcribe автоматически распознает более 85 языков. Она также учитывает региональные акценты и диалекты и может переключаться между языками в ходе одного разговора. Для записанного аудио доступно определение нескольких собеседников. Модель может точно разделять речь до трёх человек и ставить временные метки. Поддержка большего количества голосов пока имеет экспериментальный статус.

Google заявляет, что Gemini 3.5 Transcribe стала значительным шагом вперед по сравнению с предыдущей моделью Chirp 3. Новинка получила дополнительные функции, более низкую частоту ошибок и существенно меньшую задержку. По данным измерений Artificial Analysis, время до получения окончательной транскрипции сократилось на 70%.

Gemini 3.5 Transcribe уже интегрируется в повседневные продукты Google. На Android она работает в новой функции клавиатуры Gboard. Пользователь может диктовать произвольный текст, а система автоматически структурирует его и удаляет лишние слова. Голосом также можно исправлять орфографические ошибки, редактировать текст и менять стиль написания.

В Google Antigravity модель, с разрешения пользователя, может учитывать содержимое экрана и историю чата. Это должно помочь точнее распознавать названия файлов, высказывания агентов и открытые документы. Такой контекст снижает количество ошибок в специфических названиях и словах, которые без дополнительной информации трудно правильно распознать. В Google AI Studio Gemini 3.5 Transcribe доступна в режиме Build. Разработчики могут диктовать команды при создании приложений и таким образом писать код голосом. В компании называют такой подход одним из вариантов voice-based vibe coding.

В приложении Gemini для macOS модель преобразует естественную речь в очищенный и отформатированный текст и одновременно использует контекст экрана. Это позволяет голосом запускать более сложные сценарии. Например, пользователь может попросить подытожить локальный файл, перенести текст из одного приложения в другое или сгенерировать изображение прямо возле курсора.

Google также планирует добавить Gemini 3.5 Transcribe в Chrome. Пользователи смогут диктовать текст в любом поле на веб-странице. Это должно упростить написание ответов, сообщений и запросов в Gemini без ручного ввода с клавиатуры.

Читайте также: В области программирования и кибербезопасности: Google выпустила три новые модели Gemini

Напомним, что развитие голосовых функций Gemini происходит на фоне стремительного роста аудитории сервиса. Приложение Gemini превысило один миллиард ежемесячных активных пользователей и стало 14-м продуктом Google, преодолевшим эту отметку. По данным компании, 63% пользователей напрямую общаются с помощником с помощью голосовых функций.