Alibaba выпускает Qwen3.8: программирование и офисная работа выходят на новый уровень, рассуждения быстрее и стабильнее
2026-08-03 13:49
В избр.

Репортаж от Wedoany,3 августа Alibaba официально выпустила новое поколение базовой большой модели Qwen3.8 с общим количеством параметров 2,4 триллиона, значительно улучшив возможности в программировании (Coding) и профессиональной офисной работе (Cowork). В опубликованном сегодня авторитетном стороннем рейтинге Arena модель Qwen от Alibaba уступает лишь серии Claude от Anthropic, а общая производительность находится в первом эшелоне мировых больших моделей. В настоящее время API Qwen3.8 уже доступен на платформе Qianwen AI и интегрирован в агентный продукт «Qianwen Office», запущенный Alibaba сегодня. Qwen3.8-Max, как ожидается, будет открыт на следующей неделе, также будет открыт Qwen3.8-27B.

С сегодняшнего дня разработчики по всему миру могут получить доступ к API Qwen3.8 через платформу Qianwen AI. В Китае цена составляет 12 юаней за миллион токенов на входе и 36 юаней на выходе, при попадании в неявный кэш — всего 1,5 юаня, а международные цены на вход и выход составляют лишь 40% и 24% от цен Opus5, обеспечивая сопоставимый интеллект с более высокой экономической эффективностью.

На этот раз выпущена флагманская модель Qwen3.8-Max — самая крупная и мощная в серии больших моделей Qianwen. Она поддерживает визуальное понимание, а длина контекста достигает 1 млн токенов. В архитектуре модели Qwen3.8 благодаря совместной оптимизации разреженной архитектуры MoE и механизма смешанного внимания впервые расширила общее количество параметров большой модели Qianwen до 2,4 трлн с активацией 95 млрд, что обеспечило более высокую эффективность рассуждений и более высокую скорость рассуждений, а также новый прорыв в общей производительности: в оценках программирующих агентов, таких как PaperBench для научного воспроизведения, Qwen3.8-Max значительно улучшила результат на 28,2 балла по сравнению с предыдущим поколением, достигнув рекордных 93,0 баллов; в оценках универсальных агентов, таких как WideSearch и Agent’s Last Exam, новая модель набрала 81,9 и 52,4 балла соответственно, заняв лидирующие позиции. Кроме того, Qwen3.8 набрала 82,8 балла в оценке следования инструкциям IF Bench, 92,6 балла в научных рассуждениях GPQA Diamond, заняв ведущие позиции по ряду универсальных способностей; в оценке визуальных рассуждений BabyVision Qwen3.8-Max без использования инструментов набрала 82,0 балла, что почти вдвое превышает результаты некоторых основных моделей, а в оценке OSWorld-Verified, проверяющей способность агента управлять компьютером, Qwen3.8-Max заняла первое место среди основных моделей с результатом 86,1 балла.

Способность к программированию (Coding) — одна из ключевых способностей передовых больших моделей, и Qwen3.8 достигла нового прорыва в автономном программировании. В авторитетном рейтинге CodeArena Qwen3.8 занимает четвёртое место в мире. Два года назад передовые модели могли хорошо писать функции и дополнять код, становясь надёжными помощниками программистов, а теперь Qwen3.8 может, начиная с пустой папки, самостоятельно завершить реальный проект, рассчитанный на десятки дней, без какого-либо вмешательства человека. Достаточно одной фразы «Создай самоэволюционирующийся агентный Harness», и Qwen3.8, словно опытный инженер, с нуля самостоятельно выстраивает фреймворк циклической инженерии (Loop Engineering), организуя агентов для автоматического получения и выполнения задач, а инженеры-люди могут через DingTalk выдвигать Qwen3.8 новые требования. После примерно 16 дней автономного программирования Qwen3.8 создала реально работающий самоэволюционирующийся агентный фреймворк уровня Hermes Agent под названием «oh-my-cli». В настоящее время проект полностью открыт, весь процесс публично сохранён в репозитории GitHub, доступном для всеобщего просмотра.

Qwen3.8 способна выполнять широкий спектр реальных профессиональных задач (Cowork). Сталкиваясь с совершенно разными профессиональными задачами, критериями оценки и вычислительными потребностями, Qwen3.8 благодаря расширенному совместному обучению с подкреплением (RL) в реальной среде и с использованием реальных вычислительных мощностей добилась реального улучшения производительности в сотнях ценных и часто выполняемых профессиональных задач, стабильно и надёжно обеспечивая результаты производственного уровня в основных агентных фреймворках: команда юристов, размечающая более тысячи релевантных пунктов в сотнях юридических документов, тратит на это неделю, а Qwen3.8 справляется за час; команда аналитиков баскетбольных данных, размечающая покадрово более 160 часов записей матчей, — Qwen3.8 за несколько десятков минут точно разбирает более 8400 атакующих и оборонительных раундов и выдаёт тактические профили игроков и отчёт для тренера; команда финансовых исследователей, которая, опираясь на многолетние профессиональные знания, собирает всестороннюю и актуальную информацию о рынке капитала для последовательного завершения исследования количественных стратегий, — Qwen3.8 самостоятельно задействует параллельных агентов и после нескольких часов непрерывной работы выдаёт полную стратегию ротации ETF, постоянно анализируя бэктесты, динамически корректируя и в итоге достигая масштабной прибыльности.

В длительных задачах Qwen3.8 демонстрирует системное автономное планирование и способность к полному циклу замкнутого адаптивного обучения. Будь то высокоточное проектирование цифровых чипов с жёсткими физическими ограничениями или высокодинамичное моделирование бизнес-операций с интенсивной конкуренцией, Qwen3.8 способна через адаптивный замкнутый цикл «выполнение — обратная связь — итерация» в ходе сверхдлинных взаимодействий из тысяч раундов осуществлять глубокую реструктуризацию алгоритмов и стратегий.

Помимо мощных текстовых способностей и способностей к рассуждению, Qwen3.8 также поднимает предел возможностей ИИ в визуальном понимании. В авторитетном рейтинге Vision Arena Qwen3.8-Max занимает второе место в мире. Qwen3.8 способна не только читать 200-страничные финансовые PDF-отчёты и понимать длинные видео продолжительностью более 100 часов, но и возвращать эти «увиденные» знания и информацию во весь рабочий процесс, помогая модели мыслить более всесторонне. В бенчмарке RecreationBench, созданном командой Qianwen для длительных задач «воссоздания приложений», модель, не имея исходного кода и доступа в интернет, понимает приложение только через взаимодействие и обратную связь, но при этом способна воссоздать всё приложение с нуля. Это показывает, что Qwen3.8 уже демонстрирует передовые гибридные мультимодальные агентные способности, поднимая визуальное программирование (Visual Coding) на новую высоту через повторяющийся цикл «итеративное программирование — интерактивная обратная связь».

Как сообщается, суперузел Alibaba Zhenwu M890 также успешно адаптирован для Qwen3.8. Благодаря сквозной оптимизации чипов, облачной платформы и большой модели Qianwen значительно повышается эффективность рассуждений и снижаются затраты на рассуждения, что в сценариях агентных рассуждений позволяет добиться повышения производительности до 1,5 раза.

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com
Связанные продукты
Последние новости
1
Австралийская компания Nelson Resources сообщает о содержании золота 1,95 г/т на участке Cinnamon в Неваде (США)
2
Австралийская Benz Mining сообщает о 95-метровом пересечении золотоносной зоны в Западной Австралии
3
Британская компания Tokamak Energy прошла приёмочные испытания гиротрона мощностью 1 МВт на установке ST40
4
Исследование Берлинского технического университета: замена водорода метанолом в качестве резерва увеличивает затраты лишь на 2,4%
5
Lenzing планирует закрыть завод в Гримсби к концу 2027 года и перестроить текстильный бизнес
6
FedEx расширяет развертывание автономной системы загрузки прицепов
7
Площадь посевов сорго в штате Токантинс (Бразилия) в следующем сезоне может достичь 200 тысяч гектаров
8
Исследование: к 2050 году трансформация глобального рациона может сократить выбросы в сельском хозяйстве на 85%
9
Европейская комиссия представила новые меры в поддержку фермеров на фоне роста цен на удобрения
10
Китайская команда Цзянсуского университета завершила ключевую проверку системы автоматической дозаправки БПЛА
Связанные рекомендации
FedEx расширяет развертывание автономной системы загрузки прицепов
2026-08-03
AZIO AI и AT&T подписали соглашение о прокладке оптоволокна для дата-центра мощностью 500 МВт в Техасе, США
2026-08-03
Министерство телекоммуникаций Индии направило Vodafone Idea уведомление о неустойке в размере 26,83 крор рупий
2026-08-03
Индийская STL 1 августа получила многолетний контракт на поставку оптоволоконных кабелей на сумму 9,6 млрд рупий
2026-08-03
Официальная версия API DeepSeek-V4-Flash запущена на Суперкомпьютерном интернете! Мгновенный вызов в один клик
2026-08-03
Саудовская компания Arriyadh Roaster внедряет платформу Plex Smart Manufacturing от Rockwell
2026-08-03
Проект трансграничного подводного кабеля по дну Каспийского моря планируется завершить и ввести в эксплуатацию к концу 2026 года
2026-08-03
Американская Marathon Petroleum внедряет ИИ-видеоохрану, экономя 400 000 долларов в год
2026-08-03
Falcon H1 из ОАЭ возглавил рейтинг суверенных ИИ-моделей, модель SK Telecom из Южной Кореи получила признание
2026-08-03
Филиппинское исследование: автоматизация бизнес-лицензирования повысила налоговые поступления городов на 18,16 процентных пункта
2026-08-03