Российская нейросеть GigaAM v3 от Сбера показала лучший результат в сравнении открытых моделей распознавания речи на русском языке. Она обошла решения Nvidia, Alpha Cephei и OpenAI. Об этом свидетельствуют данные исследования MWS AI.
Отмечается, что компания представила открытый бенчмарк Reson OSD. Он предназначен для оценки качества распознавания русской речи. Такие модели переводят устную речь в текст. Технологию используют в голосовых помощниках, контакт-центрах, сервисах расшифровки аудио и голосовом поиске.
В первом сравнении участвовали открытые модели Сбера, Nvidia, Alpha Cephei и OpenAI. Так, GigaAM v3 допустила в среднем 7,4 ошибки на каждые 100 слов записи. Показатели Nvidia Parakeet и Nemotron оказались значительно выше — 15,8 и 25,5 ошибок соответственно.
Наибольший разрыв зафиксировали при работе с шумной речью. Отмечается, что GigaAM v3 ошибалась в 18% слов. У Nvidia Parakeet показатель составил 33%. В свою очередь, Whisper от OpenAI допустила ошибки в 62% слов.
Reson OSD включает более 12 тыс. аудиозаписей русской речи. Общая продолжительность записей составляет порядка 38 часов. В бенчмарк вошли обычные фразы, а также высказывания с числами и датами. Записи были сделаны в условиях тишины и шума.
Вместе с бенчмарком MWS AI представила Reson для детальной оценки качества распознавания. Инструмент сравнивает модели по единым правилам. Он показывает общий уровень ошибок, конкретные слова и типы ошибок, на которых модели чаще всего ошибаются. При этом итоги формируются в отчет, который можно открыть в браузере.
Отмечается, что инструмент бесплатно разместили на GitHub. В свою очередь, данные бенчмарка Reson OSD опубликовали на Hugging Face (признан в РФ иностранным агентом).