OpenAI та Alibaba вдосконалюють розпізнавання мовлення: нові AI-моделі вже тут

OpenAI та Alibaba представили нові AI-моделі для розпізнавання мовлення Компанія OpenAI представила дві інноваційні моделі для перетворення мови на текст: GPT-Live-Transcribe, що забезпечує транскрипцію в реальному часі з мінімальною затримкою, та GPT-Transcribe, оптимізовану для пакетної обробки аудіофайлів. Обидві розробки вирізняються покращеним розумінням контексту, що гарантує вищу точність розпізнавання специфічної термінології, імен власних та багатомовності. Про це стало відомо з публікації на ресурсі neowin.net.
OpenAI вдосконалила свої інструменти для транскрипції
Згідно з даними OpenAI, врахування контексту значно підвищує якість транскрибованого тексту. Компанія також звітує про зменшення кількості помилок порівняно з попередніми версіями моделей Whisper. Незалежні дослідження від Artificial Analysis підтвердили високу точність GPT-Transcribe. Вартість використання цієї моделі становить приблизно 4,5 долара (близько 175₴ за поточним курсом 2026 року) за 1000 хвилин обробки аудіо.
Alibaba представляє передові голосові моделі
Водночас китайський технологічний гігант Alibaba анонсував свої нові розробки: Qwen-Audio-3.0-Realtime Plus та Flash. Ці моделі реалізовані у форматі «мовлення — мовлення» і підтримують природні діалоги в реальному часі. Користувачі мають можливість перебивати штучний інтелект під час його відповіді, а також викликати певні функції чи створювати персоналізовані голосові клони. За результатами рейтингу Artificial Analysis, модель Qwen-Audio-3.0-Realtime Plus наразі демонструє вищу якість взаємодії «мовлення — мовлення», отримавши 84,1% проти 79,1% у GPT-Realtime-2.1 High від OpenAI. Проте, рішення від Alibaba поступається за швидкістю: його відповідь з’являється приблизно через чотири секунди, тоді як моделі OpenAI реагують менш ніж за півтори секунди. За матеріалами: iTechua # Чат бот # OpenAI # ChatGPT Місце для вашої реклами
Порада від Business News:
Оновлення та нові моделі від OpenAI та Alibaba значно підвищують ефективність роботи з аудіо- та мовною інформацією. Ці інструменти можуть бути корисними для журналістів, дослідників, розробників, а також для всіх, хто працює з великими обсягами голосових даних, потребує швидкої та точної транскрипції або хоче вдосконалити інтерактивність своїх голосових помічників.
Дізнатися більше на: news.finance.ua
