Сбер открыл модели GigaAM Multilingual и GigaChat Audio. Компания делает ставку на открытые технологии для работы с речью - Главные новости нейросетей

Сбер открыл модели GigaAM Multilingual и GigaChat Audio. Компания делает ставку на открытые технологии для работы с речью


Сбер открыл доступ сразу к двум новым моделям для работы с речью. Первая предназначена для многоязычного распознавания речи, вторая объединяет возможности языковой модели и анализа аудио: понимает длинные записи, ищет нужные фрагменты, составляет саммари и поддерживает голосовой диалог. Одновременно компания опубликовала открытые веса моделей и объявила, что обе научные работы приняты на конференцию Interspeech.

Сбер открыл модели GigaAM Multilingual и GigaChat Audio. Компания делает ставку на открытые технологии для работы с речью

Сбер развивает сразу два направления речевого ИИ

Новый релиз состоит из двух самостоятельных проектов.

GigaAM Multilingual отвечает за распознавание речи. Это открытая модель ASR (Automatic Speech Recognition), рассчитанная на многоязычные сценарии.

GigaChat Audio работает уровнем выше. Это большая языковая модель, способная понимать содержимое аудиозаписей, поддерживать голосовой диалог, переводить речь, определять эмоции и искать информацию внутри длинных записей. По сути, разработчики объединяют технологии распознавания речи и мультимодальной LLM в единую систему.

Такое разделение выглядит логичным. Большинство открытых проектов сегодня либо хорошо расшифровывают речь, либо умеют рассуждать о её содержимом. Сбер пытается закрыть оба сценария одновременно.

GigaAM Multilingual обучали на двух миллионах часов речи

Основой новой ASR-модели стал собственный аудиоэнкодер, который предварительно обучили примерно на 2 млн часов речи более чем на 70 языках. Особое внимание уделялось русскому языку и языкам стран СНГ.

После этого модель распознавания речи дополнительно обучили на 50 тыс. часов размеченных аудиозаписей из разных предметных областей.

По данным компании, даже компактная версия примерно на 240 млн параметров показывает результаты выше Whisper Large v3 и Omnilingual 1B на внутренних тестах. Независимых сравнений новой мультиязычной версии пока нет, поэтому эти результаты ещё предстоит подтвердить внешнему сообществу.

Отдельный интерес вызывает размер модели. Большинство современных открытых ASR-систем продолжают расти, тогда как Сбер делает ставку на более компактную архитектуру, которую проще запускать локально и адаптировать под новые языки.

GigaChat Audio рассчитан на длинные записи

Вторая модель ориентирована уже не на расшифровку текста, а на понимание аудио.

По данным разработчиков, GigaChat Audio способен работать с записями продолжительностью до двух часов. Модель умеет:

  • распознавать речь;
  • переводить аудио;
  • искать нужный момент в записи;
  • составлять краткое содержание с таймкодами;
  • классифицировать аудиофайлы;
  • определять эмоциональную окраску речи;
  • поддерживать голосовой диалог.

Для длинных записей заявлен показатель Intersection-over-Union 48,3 при локализации событий на аудио продолжительностью 20–60 минут. Эта метрика показывает, насколько точно модель находит нужный фрагмент записи, а не просто отвечает на вопросы по её содержимому.

Практический сценарий понятен: вместо ручного прослушивания часового совещания пользователь может попросить модель найти момент обсуждения бюджета или собрать краткое содержание встречи.

Русский язык остаётся главным преимуществом

Большинство открытых речевых моделей сегодня развиваются вокруг английского языка.

Сбер делает ставку на другую аудиторию. Компания заявляет, что GigaChat Audio получила 60,0 балла в бенчмарке RuBQ-Audio, тогда как Qwen3-Omni набрала 43,7. В задаче распознавания эмоций точность модели превышает 90 % на датасете Dusha. Эти цифры основаны на внутренних измерениях компании. Независимых публикаций с воспроизведением результатов пока нет.

Если показатели подтвердятся, преимущество новых моделей будет заключаться не столько в универсальности, сколько в качестве работы с русской речью и языками СНГ.

Код опубликован под лицензией MIT

Для разработчиков главный анонс связан вовсе не с бенчмарками.

Сбер опубликовал исходный код и веса моделей на GitHub и Hugging Face, используя лицензию MIT. Это одна из наиболее свободных лицензий в экосистеме open source: модели можно исследовать, модифицировать и использовать в собственных проектах с минимальными ограничениями.

Компания уже несколько месяцев последовательно переводит свои модели в открытый доступ. Ранее аналогичным образом были опубликованы открытые версии семейства GigaChat 3.1 и GigaAM v3. Новые мультиязычные модели продолжают эту стратегию.

Возможности уже появились в самом GigaChat

Одновременно с публикацией моделей Сбер объявил, что GigaChat Audio уже встроена в пользовательский сервис GigaChat.

Теперь пользователи могут отправлять голосовые сообщения и длинные аудиофайлы прямо в чат. Модель самостоятельно расшифрует запись, найдёт нужный эпизод, подготовит краткое содержание и ответит на вопросы по содержимому файла.

Это важное отличие релиза от большинства открытых моделей. Обычно подобные проекты публикуются исключительно для разработчиков. Здесь технология одновременно становится частью массового продукта.

Принятие работ на Interspeech повышает доверие к проекту

Ещё одна деталь релиза осталась почти незаметной на фоне технических характеристик.

Сбер сообщил, что статьи, посвящённые обеим моделям, приняты на Interspeech — одной из крупнейших международных конференций по речевым технологиям. Это не означает автоматического превосходства моделей над конкурентами, но говорит о том, что архитектура и результаты прошли научное рецензирование и будут представлены исследовательскому сообществу.

Для открытых моделей это зачастую важнее маркетинговых сравнений. После публикации статей и исходного кода независимые исследователи смогут воспроизвести эксперименты и проверить заявленные результаты.

Почему этот релиз заметен

За последние полгода Сбер последовательно открывает собственые модели — сначала семейство GigaChat, затем GigaAM v3, а теперь мультиязычные речевые решения.

Главный результат нынешнего релиза — не очередной рекорд в таблице бенчмарков. Гораздо важнее, что в открытом доступе появляется полноценный стек для работы с речью: от распознавания аудио до его анализа большой языковой моделью. Если независимые тесты подтвердят заявленное качество, российская экосистема open source получит один из самых сильных наборов речевых моделей для русского языка и языков СНГ.



Источник

Вам также может понравиться

Оставить комментарий

Главные новости нейросетей.