Представлена языковая модель Gemini 3.5 Transcribe для распознавания речи

Компания ​Google анонсировала модель распознавания речи Gemini 3.5 Transcribe, предназначенную для высокоточной транскрибации голосовых потоков в реальном времени и обработки готовых аудиозаписей. В отличие от традиционных систем распознавания речи, разработка удаляет из текста паузы и слова-паразиты, самостоятельно расставляет знаки препинания, автоматически вносит правки по контексту и адаптируется под специфическую терминологию. Заявляется, что показатель ошибок при обработке аудиофайлов составляет 2,6% и 4,0% при работе в режиме реального времени, опережая предыдущее решение Chirp 3 по скорости отклика и точности распознавания более чем 85 языков и диалектов.

​Для разработчиков инструмент доступен через API в Google AI Studio и Gemini Enterprise Agent Platform в двух форматах: с минимальной задержкой для интерактивных голосовых сервисов и для фонового анализа записанных аудиофайлов с распознаванием до трех говорящих одновременно. Алгоритмы интегрированы в приложения и сервисы компании, включая функции ввода на клавиатуре Gboard на Android, систему Google Antigravity, приложение Gemini на macOS и браузер Chrome. В версии для macOS система позволяет отдавать голосовые команды для генерации изображений и анализа файлов прямо через курсор, делегируя задачи другим языковым моделям.

v_romashov@list.ru
наверх