Бизнес

Нейросеть Сбера обошла модели OpenAI и Nvidia в распознавании русской речи

Модель Сбера стала лидером среди открытых моделей распознавания речи
1200 800 600 400 600 600 200 200 895 505

Российская нейросеть GigaAM v3 от Сбера показала лучший результат в сравнении открытых моделей распознавания речи на русском языке. Она обошла решения Nvidia, Alpha Cephei и OpenAI. Об этом свидетельствуют данные исследования MWS AI.

Отмечается, что компания представила открытый бенчмарк Reson OSD. Он предназначен для оценки качества распознавания русской речи. Такие модели переводят устную речь в текст. Технологию используют в голосовых помощниках, контакт-центрах, сервисах расшифровки аудио и голосовом поиске.

В первом сравнении участвовали открытые модели Сбера, Nvidia, Alpha Cephei и OpenAI. Так, GigaAM v3 допустила в среднем 7,4 ошибки на каждые 100 слов записи. Показатели Nvidia Parakeet и Nemotron оказались значительно выше — 15,8 и 25,5 ошибок соответственно.

Наибольший разрыв зафиксировали при работе с шумной речью. Отмечается, что GigaAM v3 ошибалась в 18% слов. У Nvidia Parakeet показатель составил 33%. В свою очередь, Whisper от OpenAI допустила ошибки в 62% слов.

Reson OSD включает более 12 тыс. аудиозаписей русской речи. Общая продолжительность записей составляет порядка 38 часов. В бенчмарк вошли обычные фразы, а также высказывания с числами и датами. Записи были сделаны в условиях тишины и шума.

Вместе с бенчмарком MWS AI представила Reson для детальной оценки качества распознавания. Инструмент сравнивает модели по единым правилам. Он показывает общий уровень ошибок, конкретные слова и типы ошибок, на которых модели чаще всего ошибаются. При этом итоги формируются в отчет, который можно открыть в браузере.

Отмечается, что инструмент бесплатно разместили на GitHub. В свою очередь, данные бенчмарка Reson OSD опубликовали на Hugging Face (признан в РФ иностранным агентом).