Южнокорейская компания Upstage выпустила модель-агент с 250 миллиардами параметров

2026-07-23 16:43
В избр.

Репортаж от Wedoany,23 числа южнокорейская компания Upstage опубликовала собственную большую языковую модель (LLM) с открытым весом «Solar Open 2», разработанную в рамках государственного проекта «Независимая базовая модель ИИ». Модель размещена на глобальной платформе с открытым исходным кодом Hugging Face, одновременно опубликован технический отчет, содержащий архитектуру и методы обучения.

В отличие от предыдущей версии «Solar Open 1», Solar Open 2 специально спроектирована для использования в качестве агента. Она способна не только на простые ответы на вопросы, но и на многократные рассуждения и вызовы инструментов для повторной обработки задач до их завершения. Модель использует структуру смеси экспертов (MoE) с общим количеством 250 миллиардов параметров, но при фактической работе активирует только 15 миллиардов параметров. Выбирая только необходимые части для вычислений, она повышает эффективность в задачах агента, потребляющих большое количество токенов. По сравнению с предыдущей версией, имевшей 102 миллиарда параметров, объем вырос в 2,5 раза, количество слоев осталось неизменным — 48.

Solar Open 2 поддерживает обработку длинного контекста до 1 миллиона токенов, что критически важно для задач агента, требующих постоянного запоминания истории задач и обработки большого объема документов. Для достижения этой возможности Upstage разделила 48 слоев на группы по 4 слоя, смешанно развернув один «Softmax Attention» с высокой точностью, но большими вычислительными затратами, и три «линейных Attention» с низкими вычислительными затратами, но сжатием информации памяти. То есть только четверть всех слоев использует метод Softmax. Кроме того, модель полностью отказалась от отдельного устройства позиционного кодирования, передавая информацию о порядке слов только через структуру памяти линейного Attention, и добавила расширенную технологию, позволяющую самостоятельно возвращаться и исправлять ошибочно сохраненную информацию.

Upstage заявляет, что объем обучающих данных, необходимый для достижения той же производительности, может быть сокращен до 3 раз по сравнению с предыдущим методом. После применения квантизации для работы модели достаточно всего двух чипов NVIDIA H200智能芯片, что снижает затраты на внедрение в собственную инфраструктуру для предприятий. Внедренная технология больше не требует обучения модели с сотнями миллиардов параметров с нуля каждый раз. Вместо этого из весов предыдущей версии «Solar Open 1» выбираются только части, совпадающие с новой структурой, для повторного использования. Наследуются только структурно идентичные части, такие как словарь, выходной слой и слой нормализации. Вновь созданные части и часть, где количество экспертов увеличено со 128 до 320, обучаются заново. Повторно используемые веса составляют всего 2,3% от общего объема, но эксперименты показывают, что этот метод может сократить объем обучения, необходимый для достижения той же производительности, примерно в 1,7 раза. Обучающие данные были сокращены с исходных 20 триллионов токенов до 10 триллионов токенов путем фильтрации по качеству. Соотношение реальных и синтезированных данных составляет 4:6, доля математики и кода увеличена до более чем 15% каждая.

В тестах производительности Solar Open 2 превзошла такие основные модели с открытым весом, как DeepSeek «V4 Flash», Mistral «Medium 3.5» и Cohere «Command A+», в области общих знаний (MMLU-Pro), программирования (LiveCodeBench), следования инструкциям и вызова инструментов, а также в комплексной оценке агентов. По сравнению с предыдущей версией, баллы по основным бенчмаркам, таким как знания, научные рассуждения, математика и программирование, выросли более чем на 20 пунктов. Что касается корейского языка, модель показала более высокий средний балл по корейским бенчмаркам, чем закрытые API, такие как OpenAI «GPT-5.4 Mini» и Anthropic «Claude Haiku 4.5». В частности, в бенчмарке «Ko-GDPval» она набрала 86,8 балла, приблизившись к производительности DeepSeek «V4 Pro» (86,9 балла), которая в 6 раз больше. Upstage объясняет это собственным токенизатором, специально разработанным для корейского языка, который может представлять одно и то же корейское предложение с гораздо меньшим количеством токенов, чем другие глобальные модели, что дает преимущества в стоимости и скорости в задачах агента, где история задач постоянно накапливается. В оценках «SWE-Bench» и «TerminalBench», которые оценивают выполнение задач в реальных репозиториях программного обеспечения или терминальных средах, модель уступила конкурентам, таким как DeepSeek «V4 Flash» и Mimou «V2.5». Upstage заявила, что инженерные способности на уровне репозитория/терминала и точность числовых значений в офисных продуктах являются направлениями для будущего улучшения.

Upstage полностью публикует веса Solar Open 2 на основе «Upstage Solar License (на базе Apache 2.0)», разрешая коммерческое использование и свободную разработку производных моделей. В будущем модель будет применяться на портале Daum, приобретенном в мае этого года, расширяя функционал от поиска/суммирования до интерактивных агентских сервисов. Через платформу ИИ-агентов Timely, приобретенную в июне этого года, модель будет поддерживать внедрение агентов в местные органы власти и государственные образовательные учреждения по всей стране. Upstage планирует расширить сервисы на базе Solar Open 2 на все отрасли промышленности, включая финансы, юриспруденцию, медицину, государственный сектор, оборону, производство, потребление, робототехнику и образование, а также приступить к созданию «полноценного суверенного ИИ» в сочетании с отечественными нейронными процессорами (NPU). Кроме того, модель будет зарегистрирована на глобальных платформах, таких как «OpenRouter» и «Hermes Agent», для расширения экосистемы зарубежных разработчиков.

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com

Связанные продукты

Промышленная кольцевая сеть Ethernet для горнодобывающей промышленности (10 Гбит/с / 1 Гбит/с) - Chongqing Mas Sci&Tech Co., Ltd.
Интеллектуальный автоматический калибратор давления ConST811A - Beijing ConST Instruments Technology Inc.
Тропосферный ветровой профилемер P-диапазона TWP16 - China Huayun Meteorological Technology Group Co., Ltd.
Автоматический патрульный робот/автоматический робот безопасности - FOTUN HONGKONG LIMITED
Решения для систем безопасности SIS - Beijing Consen Automation Technology Co., Ltd.
Антенные системы и сопутствующая электронная продукция - Chengdu Zhongdian Jinjiang Information Industry Co., Ltd.
Контроллер системы обнаружения горючих газов 30 - Jinan Benan Technology Development Co., Ltd.
Т профиль шкафа - Xinli Tongchuang Electronic Equipment Co., Ltd.
Интеллектуальная система мониторинга конвейерных лент - LUO YANG WIRE ROPE INSPECTION TECHNOLOGY CO., LTD.
Беспроводная локальная сеть | Точка доступа AirEngine 5776-56T - Huawei
WiFi-локальный переходник - CREATEC
Беспилотный рефрижератор Neolix X6 - Neolix Beijing Technology Co., Ltd.
Читайте также
Спрос на токены в Китае демонстрирует взрывной рост: ожидается, что к 2026 году потребление достигнет 1 квинтиллиона
2026-09-13
Anthropic планирует привлечь до 100 млрд долларов в ходе IPO в США
2026-09-12
Rapidus представила концепцию лунного завода по производству полупроводников к 2040 году
2026-09-12
ОАЭ планируют инвестировать в Германию 40 млрд евро, включая центры обработки данных мощностью около 1 ГВт
2026-09-11
Компания Analog Devices из США подписала соглашение о приобретении Alif Semiconductor за 1,35 млрд долларов
2026-09-11
Перу и США подписали меморандум о взаимопонимании по сотрудничеству в области искусственного интеллекта
2026-09-11
Американская Palantir и нидерландская Nebius заключили партнёрство в области суверенной инфраструктуры ИИ
2026-09-10
Официальный выпуск модели DeepSeek V4.1 Flash: полное превосходство над V4 Pro, нативное мультимодальное визуальное понимание, снижение цен на API
2026-09-10
Amazon USA и Wiwynn расширяют серверную производственную базу стоимостью 1,6 млрд долларов
2026-09-10
Индонезийская Zankore получила финансирование в размере 3,1 млрд долларов США на строительство 100-МВт платформы ИИ-вычислений NVIDIA
2026-09-10