
OpenAI выпустила две новые модели для расшифровки аудио
GPT-Live-Transcribe создана для транскрибации в реальном времени с минимальной задержкой. GPT-Transcribe предназначена для готовых аудиофайлов и пакетной обработки.
Модели лучше распознают акценты, иностранные языки, короткие фразы, числа и профессиональные термины. Качество сохраняется даже при громком фоновом шуме.
Разработчики могут передавать модели описание записи, список важных слов, ожидаемые языки и предыдущие фрагменты разговора.
Контекст заметно повышает точность. У GPT-Live-Transcribe показатель понимания вырос с 38,5% до 44,6%, а у GPT-Transcribe с 41,6% до 45,2%.
На реальных записях GPT-Live-Transcribe снизила долю ошибок с 11,65% до 9,60% по сравнению с GPT-Realtime-Whisper-1.
GPT-Transcribe показала ещё более заметный прирост. На Common Voice ошибка составила 19,27% против 40,37% у Whisper-1. На реальных записях результат улучшился с 15,21% до 8,98%.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.