Запуск слуховой базы полноканальной голосовой модели MiMo-V2.5-ASR от Xiaomi
Репортаж от Wedoany,7 июля китайская компания в сфере интеллектуальных терминалов и AI-технологий Xiaomi запустила слуховую базу полноканальной голосовой модели MiMo-V2.5-ASR. Цена API на внутреннем рынке Китая составляет 0,5 юаня/час, на зарубежном рынке — 0,074 доллара США/час. Модель уже открыта через API и поддерживает использование в рамках Token Plan, ориентирована на транскрипцию речи, голосовое взаимодействие, запись совещаний, обработку контента, многоязычное распознавание и применение в сложных акустических сценариях.
MiMo-V2.5-ASR позиционируется не как простой инструмент преобразования речи в текст, а как слуховая базовая модель в открытой платформе Xiaomi MiMo. После того как распознавание речи вошло в цепочку AI-приложений, разработчикам приходится иметь дело не только с чёткими записями на путунхуа, но и с реальными сценариями, включающими диалекты, двуязычное смешение, фоновый шум, многоголосые диалоги, удалённый захват звука, распознавание текста песен и профессиональных терминов. После того как Xiaomi превратила эту модель в API-сервис, разработчики могут интегрировать голосовые возможности в приложения, терминалы, офисные системы, контент-платформы и интеллектуальные устройства, оплачивая по длительности транскрипции аудио.
Распознавание в сложных сценариях является главной особенностью данного запуска. MiMo-V2.5-ASR охватывает китайские диалекты, такие как кантонский, у, южноминьский и сычуаньский, и способен выполнять распознавание в сценариях смешанного китайско-английского переключения без предварительной настройки языка. В сценариях распознавания песен модель обрабатывает тексты на китайском и английском, а также смешанное аудио с аккомпанементом и вокалом. В условиях сильного шума и удалённого захвата звука модель подчёркивает устойчивость распознавания. В сценариях многоголосых перекрёстных диалогов обеспечивается более точная транскрипция. В область распознавания также включены знания, связанные с классической поэзией, профессиональными терминами, именами людей и географическими названиями.
Встроенная функция пунктуации влияет на практический опыт использования. Многие продукты распознавания речи могут преобразовывать звук в текст, но полученные результаты часто требуют ручного добавления знаков препинания, разбивки на предложения и редактирования. MiMo-V2.5-ASR подчёркивает вывод пунктуации на основе сочетания ритма и семантики, делая транскрибированный контент более близким к готовому к использованию тексту. Сценарии, такие как протоколы совещаний, обработка интервью, записи занятий, голосовые заметки, субтитры для подкастов и контроль качества в службе поддержки, требуют более полной обработки разбивки на предложения и пунктуации, иначе затраты на последующее редактирование значительно возрастут.
Цена API на внутреннем рынке в 0,5 юаня/час также делает эту модель более доступной для массового тестирования в приложениях. Стоимость использования услуг распознавания речи напрямую влияет на готовность разработчиков интегрировать их в высокочастотные сценарии, особенно для транскрипции длинных аудио, обработки записей совещаний, контроля качества телефонных звонков, генерации субтитров для курсов и обработки аудиовизуального контента. При оплате по длительности транскрипции аудио предприятия и разработчики могут контролировать затраты в зависимости от реального объёма использования, а также легче оценивать окупаемость модели в различных бизнес-сценариях.
Голосовые модели становятся важной базовой возможностью для интеллектуальных терминалов и AI-приложений. Смартфоны, умные колонки, автомобильные системы, носимые устройства, офисное ПО, системы поддержки клиентов и инструменты для создания контента нуждаются в более стабильном слуховом входе. Ранее Xiaomi уже разместила на открытой платформе MiMo возможности, связанные с текстом, речью и мультимодальностью. После запуска MiMo-V2.5-ASR цепочка голосового ввода и понимания на платформе была дополнительно дополнена. С открытием API разработчики могут создавать приложения для таких сценариев, как распознавание диалектов, двуязычное взаимодействие, транскрипция в условиях сильного шума и запись многоголосых совещаний.
После запуска этой модели сценарии использования будут в первую очередь сосредоточены на транскрипции длинных аудио, голосовом вводе на мобильных устройствах, офисных совещаниях, субтитрах для контента, телефонных разговорах в службе поддержки и голосовом взаимодействии с интеллектуальными терминалами. Охват диалектов, смешанное китайско-английское переключение (Code-Switch), устойчивое распознавание в условиях сильного шума и встроенный вывод пунктуации будут напрямую определять пригодность модели в реальных сценариях. После перехода MiMo-V2.5-ASR от Xiaomi в стадию открытого API разработчики смогут провести тестирование интеграции через платформу и использовать соответствующие возможности распознавания речи с оплатой по длительности транскрипции.
Связанные продукты

Антенные системы и сопутствующая электронная продукция
Chengdu Zhongdian Jinjiang Information Industry Co., Ltd.
Контроллер системы обнаружения горючих газов 30
Jinan Benan Technology Development Co., Ltd.

Интеллектуальная система мониторинга конвейерных лент
LUO YANG WIRE ROPE INSPECTION TECHNOLOGY CO., LTD.

Автоматический патрульный робот/автоматический робот безопасности
FOTUN HONGKONG LIMITED

Интеллектуальный автоматический калибратор давления ConST811A
Beijing ConST Instruments Technology Inc.

Тропосферный ветровой профилемер P-диапазона TWP16
China Huayun Meteorological Technology Group Co., Ltd.

QPS-20A Резервированный переключатель питания
CHN ENERGY ZHISHEN CONTROL TECHNOLOGY CO., LTD.








