Запуск слуховой базы полноканальной голосовой модели MiMo-V2.5-ASR от Xiaomi

2026-07-07 17:49
В избр.

Репортаж от Wedoany,7 июля китайская компания в сфере интеллектуальных терминалов и AI-технологий Xiaomi запустила слуховую базу полноканальной голосовой модели MiMo-V2.5-ASR. Цена API на внутреннем рынке Китая составляет 0,5 юаня/час, на зарубежном рынке — 0,074 доллара США/час. Модель уже открыта через API и поддерживает использование в рамках Token Plan, ориентирована на транскрипцию речи, голосовое взаимодействие, запись совещаний, обработку контента, многоязычное распознавание и применение в сложных акустических сценариях.

MiMo-V2.5-ASR позиционируется не как простой инструмент преобразования речи в текст, а как слуховая базовая модель в открытой платформе Xiaomi MiMo. После того как распознавание речи вошло в цепочку AI-приложений, разработчикам приходится иметь дело не только с чёткими записями на путунхуа, но и с реальными сценариями, включающими диалекты, двуязычное смешение, фоновый шум, многоголосые диалоги, удалённый захват звука, распознавание текста песен и профессиональных терминов. После того как Xiaomi превратила эту модель в API-сервис, разработчики могут интегрировать голосовые возможности в приложения, терминалы, офисные системы, контент-платформы и интеллектуальные устройства, оплачивая по длительности транскрипции аудио.

Распознавание в сложных сценариях является главной особенностью данного запуска. MiMo-V2.5-ASR охватывает китайские диалекты, такие как кантонский, у, южноминьский и сычуаньский, и способен выполнять распознавание в сценариях смешанного китайско-английского переключения без предварительной настройки языка. В сценариях распознавания песен модель обрабатывает тексты на китайском и английском, а также смешанное аудио с аккомпанементом и вокалом. В условиях сильного шума и удалённого захвата звука модель подчёркивает устойчивость распознавания. В сценариях многоголосых перекрёстных диалогов обеспечивается более точная транскрипция. В область распознавания также включены знания, связанные с классической поэзией, профессиональными терминами, именами людей и географическими названиями.

Встроенная функция пунктуации влияет на практический опыт использования. Многие продукты распознавания речи могут преобразовывать звук в текст, но полученные результаты часто требуют ручного добавления знаков препинания, разбивки на предложения и редактирования. MiMo-V2.5-ASR подчёркивает вывод пунктуации на основе сочетания ритма и семантики, делая транскрибированный контент более близким к готовому к использованию тексту. Сценарии, такие как протоколы совещаний, обработка интервью, записи занятий, голосовые заметки, субтитры для подкастов и контроль качества в службе поддержки, требуют более полной обработки разбивки на предложения и пунктуации, иначе затраты на последующее редактирование значительно возрастут.

Цена API на внутреннем рынке в 0,5 юаня/час также делает эту модель более доступной для массового тестирования в приложениях. Стоимость использования услуг распознавания речи напрямую влияет на готовность разработчиков интегрировать их в высокочастотные сценарии, особенно для транскрипции длинных аудио, обработки записей совещаний, контроля качества телефонных звонков, генерации субтитров для курсов и обработки аудиовизуального контента. При оплате по длительности транскрипции аудио предприятия и разработчики могут контролировать затраты в зависимости от реального объёма использования, а также легче оценивать окупаемость модели в различных бизнес-сценариях.

Голосовые модели становятся важной базовой возможностью для интеллектуальных терминалов и AI-приложений. Смартфоны, умные колонки, автомобильные системы, носимые устройства, офисное ПО, системы поддержки клиентов и инструменты для создания контента нуждаются в более стабильном слуховом входе. Ранее Xiaomi уже разместила на открытой платформе MiMo возможности, связанные с текстом, речью и мультимодальностью. После запуска MiMo-V2.5-ASR цепочка голосового ввода и понимания на платформе была дополнительно дополнена. С открытием API разработчики могут создавать приложения для таких сценариев, как распознавание диалектов, двуязычное взаимодействие, транскрипция в условиях сильного шума и запись многоголосых совещаний.

После запуска этой модели сценарии использования будут в первую очередь сосредоточены на транскрипции длинных аудио, голосовом вводе на мобильных устройствах, офисных совещаниях, субтитрах для контента, телефонных разговорах в службе поддержки и голосовом взаимодействии с интеллектуальными терминалами. Охват диалектов, смешанное китайско-английское переключение (Code-Switch), устойчивое распознавание в условиях сильного шума и встроенный вывод пунктуации будут напрямую определять пригодность модели в реальных сценариях. После перехода MiMo-V2.5-ASR от Xiaomi в стадию открытого API разработчики смогут провести тестирование интеграции через платформу и использовать соответствующие возможности распознавания речи с оплатой по длительности транскрипции.

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com

Связанные продукты

Антенные системы и сопутствующая электронная продукция - Chengdu Zhongdian Jinjiang Information Industry Co., Ltd.
Контроллер системы обнаружения горючих газов 30 - Jinan Benan Technology Development Co., Ltd.
Одномодовое волокно G.652B - SHENZHEN SDG INFORMATION CO., LTD.
Интеллектуальная система мониторинга конвейерных лент - LUO YANG WIRE ROPE INSPECTION TECHNOLOGY CO., LTD.
Беспроводная локальная сеть | Точка доступа AirEngine 5776-56T - Huawei
Автоматический патрульный робот/автоматический робот безопасности - FOTUN HONGKONG LIMITED
Лазерный принтер TG1020AD - Xiamen Hanin Co., Ltd.
Интеллектуальный автоматический калибратор давления ConST811A - Beijing ConST Instruments Technology Inc.
Т профиль шкафа - Xinli Tongchuang Electronic Equipment Co., Ltd.
Тропосферный ветровой профилемер P-диапазона TWP16 - China Huayun Meteorological Technology Group Co., Ltd.
Беспилотный рефрижератор Neolix X6 - Neolix Beijing Technology Co., Ltd.
QPS-20A Резервированный переключатель питания - CHN ENERGY ZHISHEN CONTROL TECHNOLOGY CO., LTD.
Читайте также
Renesas Electronics открывает лабораторию физического ИИ и робототехники в Пекине, Китай
2026-08-28
Vodafone Business и Tech Mahindra объединяют усилия для содействия ИИ-трансформации в Великобритании
2026-08-28
Новый режим ИИ от Google в США добавил отслеживание рейсов и бронирование отелей, охватив более 180 стран
2026-08-28
Американская OpenAI запустила ChatGPT Work с возможностью автоматического входа в аккаунты
2026-08-28
В Индонезии запущена AI-инфраструктура RAIA Grid протяжённостью 86 тысяч километров
2026-08-28
AWS и NVIDIA планируют добавить 2 миллиона GPU в 2027–2028 годах
2026-08-28
Немецкая группа Schwarz планирует инвестировать до 5,6 млрд евро в строительство центра обработки данных
2026-08-28
OpenAI с 26 августа восстанавливает 5-часовое ограничение для ChatGPT Plus
2026-08-27
Саудовская HUMAIN сотрудничает с Microsoft, чтобы представить арабскую AI-модель на своей платформе
2026-08-27
Американская Google планирует привлечь технологию Mechanize и команду за 1,5 млрд долларов
2026-08-27