Google выпустила модель распознавания речи, которая пытается понять не только слова, но и то, что человек хотел сказать
Google представила Gemini 3.5 Transcribe — новую модель для преобразования речи в текст. Она работает как с заранее записанным аудио, так и в реальном времени с задержкой меньше секунды и умеет разделять говорящих, ставить временные метки и переключаться между языками прямо посреди разговора. Интереснее обычной транскрипции то, что модель автоматически чистит речь: убирает «э-э», учитывает исправления человека на ходу и может сразу выдавать нормально оформленный текст. Google отдельно продвигает её как основу для голосовых агентов, а не просто сервис расшифровки диктофона. На многоязычном тест
Источники сюжета
Заголовки и краткие цитаты приведены со ссылкой на источник в порядке информирования. Полные тексты доступны на сайтах изданий, права на них принадлежат правообладателям.