
xAI выпустила Grok Voice Think Fast 2.0
Это новая голосовая модель для разговоров в реальном времени. Она одновременно слушает, отвечает, рассуждает и вызывает внешние инструменты.
В тесте Artificial Analysis модель набрала 82,9 процента. У GPT Realtime 2.1 результат составил 79,1 процента, у Gemini 3.1 Flash только 69,5 процента.
Первый звук появляется через 0,7 секунды. Предыдущей версии требовалось 1,25 секунды, а Gemini 3.1 Flash почти 3 секунды.
Точность распознавания речи выросла в 1,4 раза. На коротких фразах на 24 языках модель оказалась в 1,5–2 раза точнее Deepgram Nova 3 и ElevenLabs Scribe v2. В шумной обстановке разрыв достигает 10 раз.
Grok теперь рассуждает прямо во время разговора и расходует на это на 60 процентов меньше токенов. Вызов нужного инструмента часто успевает начаться ещё до конца первой фразы агента.
Модель отвечает короткими предложениями, задаёт по одному вопросу и меньше льёт воду. Стоимость составляет 8 центов за минуту аудио. Русский поддерживает.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.