2026-07-23 16:06 · 🤖 AI World
Рынок открытых моделей распознавания речи перестал быть однородным: в середине 2026 года сразу четыре конкурента Whisper разделяет меньше одного процентного пункта WER. Что это меняет для команд, которые выбирают ASR для продукта, автоматизации или голосового агента.
2026-07-14 02:21 · 🤖 AI World
Разработчик взял пластиковую рыбу Big Mouth Billy Bass и за один уикенд сделал из неё голосового ИИ-ассистента — с двигающейся головой, открывающимся ртом и виляющим хвостом. Внутри: Raspberry Pi 5, Strands Agents BidiAgent и Amazon Nova 2 Sonic на Bedrock.
2026-06-04 22:01 · 🤖 AI World
NVIDIA открыла веса Nemotron 3.5 ASR — потоковой модели распознавания речи на 600M параметров, которая покрывает 40 языков одним чекпоинтом и добавляет пунктуацию прямо на выходе. Модель можно дообучить под любой язык, акцент или домен — включая русский и языки СНГ.
2026-05-12 20:02 · 🌐 СНГ (tech/AI)
Стартап Миры Мурати анонсировал полнодуплексную голосовую модель TML-Interaction-Small с задержкой отклика 0,40 секунды — примерно как у живого собеседника. Это принципиально иная архитектура диалога: ИИ не ждёт, пока вы закончите говорить.
2026-05-05 18:01 · 🌐 СНГ (tech/AI)
Команда СВОЙ Тех разобрала реальный путь от сценарных ботов к LLM-ассистентам — и он не похож на красивые слайды. Сначала скучная архитектура, потом осторожно модели.
2026-04-24 16:02 · 🌐 СНГ (tech/AI)
xAI открыла API-доступ к grok-voice-think-fast-1.0 — голосовой модели с полноценным дуплексным режимом. На бенчмарке τ-Voice Bench она набрала 67,3% против 35,3% у GPT-realtime-1.5 и 43,8% у Gemini — разрыв почти двукратный.