OpenAI та Alibaba вдосконалюють розпізнавання мовлення: нові AI-моделі вже тут

OpenAI та Alibaba представили нові AI-моделі для розпізнавання мовлення

OpenAI та Alibaba представили нові AI-моделі для розпізнавання мовлення Компанія OpenAI представила дві інноваційні моделі для перетворення мови на текст: GPT-Live-Transcribe, що забезпечує транскрипцію в реальному часі з мінімальною затримкою, та GPT-Transcribe, оптимізовану для пакетної обробки аудіофайлів. Обидві розробки вирізняються покращеним розумінням контексту, що гарантує вищу точність розпізнавання специфічної термінології, імен власних та багатомовності. Про це стало відомо з публікації на ресурсі neowin.net.

OpenAI вдосконалила свої інструменти для транскрипції

Згідно з даними OpenAI, врахування контексту значно підвищує якість транскрибованого тексту. Компанія також звітує про зменшення кількості помилок порівняно з попередніми версіями моделей Whisper. Незалежні дослідження від Artificial Analysis підтвердили високу точність GPT-Transcribe. Вартість використання цієї моделі становить приблизно 4,5 долара (близько 175₴ за поточним курсом 2026 року) за 1000 хвилин обробки аудіо.

Alibaba представляє передові голосові моделі

Водночас китайський технологічний гігант Alibaba анонсував свої нові розробки: Qwen-Audio-3.0-Realtime Plus та Flash. Ці моделі реалізовані у форматі «мовлення — мовлення» і підтримують природні діалоги в реальному часі. Користувачі мають можливість перебивати штучний інтелект під час його відповіді, а також викликати певні функції чи створювати персоналізовані голосові клони. За результатами рейтингу Artificial Analysis, модель Qwen-Audio-3.0-Realtime Plus наразі демонструє вищу якість взаємодії «мовлення — мовлення», отримавши 84,1% проти 79,1% у GPT-Realtime-2.1 High від OpenAI. Проте, рішення від Alibaba поступається за швидкістю: його відповідь з’являється приблизно через чотири секунди, тоді як моделі OpenAI реагують менш ніж за півтори секунди. За матеріалами: iTechua Чат бот OpenAI ChatGPT Місце для вашої реклами

Порада від Business News:

Оновлення та нові моделі від OpenAI та Alibaba значно підвищують ефективність роботи з аудіо- та мовною інформацією. Ці інструменти можуть бути корисними для журналістів, дослідників, розробників, а також для всіх, хто працює з великими обсягами голосових даних, потребує швидкої та точної транскрипції або хоче вдосконалити інтерактивність своїх голосових помічників.

Дізнатися більше на: news.finance.ua

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *