Корпоративная ИИ-компания Cohere представила свою первую голосовую модель: Transcribe — это модель автоматического распознавания речи с открытым исходным кодом, которую можно использовать для таких задач, как ведение заметок и анализ речи.
Относительно лёгкая — всего 2 миллиарда параметров — модель предназначена для использования на потребительских GPU для тех, кто хочет размещать её у себя. В настоящее время она поддерживает 14 языков: английский, французский, немецкий, итальянский, испанский, португальский, греческий, нидерландский, польский, китайский, японский, корейский, вьетнамский и арабский.
Cohere заявляет, что Transcribe превосходит такие модели, как Zoom Scribe v1, IBM Granite 4.0 1B, ElevenLabs Scribe v2 и Qwen3-ASR-1.7B Speech, в таблице лидеров Hugging Face Open ASR, достигая среднего показателя word error rate (WER) 5,42 — ниже, чем у любой другой модели в этом бенчмарке.
Компания утверждает, что Transcribe показала средний процент побед 61% по сравнению с другими моделями, когда человеческие оценщики проверяли её транскрипции по точности, связности и удобству использования. Однако модель уступила конкурентам, когда ей приходилось транскрибировать португальский, немецкий и испанский языки.
Cohere сообщает, что Transcribe может обработать 525 минут аудио за одну минуту, что является высоким показателем для её класса моделей.
Компания планирует интегрировать Transcribe в свою корпоративную платформу оркестрации агентов North и делает модель доступной бесплатно через свой API. Модель также будет доступна в Model Vault — управляемой платформе инференса Cohere.
Модели распознавания речи становятся всё более популярными по мере роста спроса на приложения для ведения заметок и диктовки, такие как Granola и Wispr Flow.
Ранее в этом году, как сообщалось, Cohere заявила инвесторам, что в 2025 году она получает $240 млн годовой повторяющейся выручки, а её CEO Эйдан Гомес заявил, что стартап может выйти на биржу «в ближайшее время».