
Google представила нову модель Gemini 3.5 Transcribe для перетворення мовлення на текст. Вона вміє працювати з понад 85 мовами, розпізнавати акценти й діалекти, розрізняти до трьох співрозмовників та автоматично ставити часові мітки.
Gemini 3.5 Transcribe має замінити технологію Chirp 3, яку Google використовувала для розпізнавання мовлення. Нова модель призначена для точнішої роботи з природною людською мовою та враховує особливості вимови.
Система здатна самостійно визначати мову, якою говорять, а також розпізнавати регіональні акценти та місцеві діалекти. Це має зменшити кількість помилок під час роботи із записами людей, які говорять із різною вимовою.
Ще одна нова можливість — автоматичне форматування готового тексту. ШІ може прибирати зайві звуки та інші елементи мовлення, які не несуть змістового навантаження.
Користувачі також зможуть редагувати записи за допомогою голосових команд. Окремо Google додала підтримку власних словників, завдяки чому модель має краще розпізнавати професійні терміни, специфічний жаргон та незвичайні імена.
У компанії пояснюють, що модель створювали з урахуванням природного стилю мовлення. ШІ має не лише переводити слова в текст, а й краще розуміти намір людини та її особливий словник.
Gemini 3.5 Transcribe отримала і функцію делегування завдань. За потреби модель може залучати інші версії Gemini, наприклад для створення зображень або аналізу великих файлів.
Розробники також заявляють про високу точність нової системи. За даними Neowin, під час потокового розпізнавання рівень помилок становить 4%, а для готових аудіофайлів — 2,6%.
Модель може одночасно розпізнавати до трьох різних спікерів. Для кожного з них система здатна автоматично визначати часові межі мовлення, а також створювати часові мітки для окремих слів.
Перші інтеграції Gemini 3.5 Transcribe вже з’явилися в екосистемі Google. Нова технологія покращила роботу фірмового застосунку для macOS та функції Rambler у клавіатурі Gboard для Android.
Наступним кроком стане інтеграція технології у браузер Chrome. Після цього користувачі зможуть вводити текст голосом безпосередньо в поля на вебсторінках.
Нова модель може бути корисною не лише для звичайного голосового введення. Розпізнавання кількох співрозмовників, підтримка спеціальної термінології та робота з часовими мітками дають змогу використовувати її для транскрипції розмов, роботи з аудіозаписами та виконання завдань голосом.
🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover



