Шанхайская лаборатория искусственного интеллекта представила фреймворк Self-Harness: производительность агентов повысилась на 60%

2026-06-23 10:39
В избр.

Репортаж от Wedoany,Исследователи из Шанхайской лаборатории искусственного интеллекта (Shanghai Artificial Intelligence Laboratory) предложили новую парадигму под названием «Self-Harness», которая позволяет агентам на основе больших языковых моделей (LLM) систематически улучшать собственные правила работы, не полагаясь на инженеров-людей или более мощные внешние модели.

Производительность агентов на основе LLM зависит не только от базовой модели, но и от их фреймворка, который включает системные подсказки, инструменты, память, правила проверки, стратегии выполнения, логику оркестрации и процедуры восстановления после сбоев. Типичные сбои агентов часто возникают из-за фреймворка, а не самой модели. Например, агент может сообщить об успешном выполнении, не проверив ответ модели, или многократно повторять неудачные операции. SWE-agent, Claude Code, Codex и OpenHands являются популярными примерами фреймворков.

Ханфан Чжан, первый автор статьи о Self-Harness, отметил, что настоящим узким местом ручной инженерии фреймворков является зависимость от ситуативной отладки, а не от систематической обратной связи. Многие правки основаны на интуиции или небольшом количестве неудачных случаев, что затрудняет адаптацию к быстро развивающимся LLM. Парадигма Self-Harness позволяет агентам на основе LLM достигать самоэволюции через трехэтапный итеративный цикл.

Цикл начинается с этапа выявления слабых мест: агент выполняет задачи, генерируя траектории выполнения, классифицирует неудачные траектории и обнаруживает специфические для модели паттерны сбоев. Затем следует этап предложения изменений фреймворка: агент, используя роль «предлагающего», генерирует набор разнообразных и минимальных модификаций фреймворка, каждая из которых нацелена на конкретный механизм сбоя. Наконец, этап проверки предложений: система оценивает кандидатные изменения с помощью регрессионного тестирования, принимая их только в том случае, если правка не приводит к снижению производительности на сохраненных задачах. Если несколько кандидатов проходят тестирование, они объединяются в следующую версию фреймворка.

Исследователи оценили Self-Harness на бенчмарке Terminal-Bench-2.0, который тестирует выполнение на основе инструментов, включая управление артефактами, использование команд, проверку поведения и восстановление после ошибок выполнения. Они применили Self-Harness к моделям MiniMax M2.5, Qwen3.5-35B-A3B и GLM-5. Количественные результаты показали, что агенты повысили производительность за счет автоматического редактирования фреймворка, при этом относительное улучшение для разных моделей на сохраненных задачах составило от 33% до 60%.

self-harness

Эксперименты показали, что Self-Harness вносит целенаправленные изменения, отражающие повторяющиеся проблемы каждой модели в процессе выполнения. Например, MiniMax M2.5 в базовом фреймворке бесконечно исследовала конфигурации наборов данных до истечения времени ожидания; система исправила это, добавив правило «прерывания цикла» (остановка после 50 вызовов инструментов и перенаправление метода), а также требование как можно раньше создавать начальную версию. Qwen-3.5 после ошибки перезаписи файла повторяла ту же команду; система ввела строгую дисциплину повторных попыток (запрет на полное повторение команд) и механизм немедленного воссоздания потерянных артефактов после файловых ошибок. GLM-5 с трудом сохраняла изменения окружения между разными командами; ее самогенерируемый фреймворк ввел правила персистентности переменной PATH, ограничения внешних вычислений и исправления любых неудачных проверок целостности перед завершением выполнения.

результаты self-harness

Чжан отметил, что автоматизированная инженерия фреймворков требует вычислительных затрат на повторную генерацию, параллельную оценку и регрессионное тестирование. Система также зависит от точности конвейера оценки, полагаясь в экспериментах на строгие, детерминированные верификаторы. Он считает, что оптимальными целями развертывания являются такие области, как кодирование, автоматизация внутренних рабочих процессов и конвейеры данных DevOps, где сбои измеримы, а пробы и ошибки относительно безопасны. Области с субъективной оценкой и высокими затратами, такие как медицинские решения, критически важная инфраструктура безопасности или юридические решения, следует избегать полной автоматизации. По мере усиления базовых моделей фреймворки будут расширяться, подключая более богатые внешние среды. Роль инженеров сместится от ручного исправления отдельных подсказок или вызовов инструментов к проектированию систем обратной связи, которые делают возможным улучшение агентов.

Данный материал скомпилирован платформой Wedoany. При цитировании материалов, созданных с помощью искусственного интеллекта (ИИ), необходимо обязательно указывать источник — «Wedoany». В случае выявления нарушения прав или иных проблем просим своевременно информировать нас. Сайт оперативно внесёт изменения или удалит материал.Электронная почта: news@wedoany.com

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com

Связанные продукты

Автоматический патрульный робот/автоматический робот безопасности - FOTUN HONGKONG LIMITED
Тропосферный ветровой профилемер P-диапазона TWP16 - China Huayun Meteorological Technology Group Co., Ltd.
Одномодовое волокно G.652B - SHENZHEN SDG INFORMATION CO., LTD.
Интеллектуальная система мониторинга конвейерных лент - LUO YANG WIRE ROPE INSPECTION TECHNOLOGY CO., LTD.
Лазерный принтер TG1020AD - Xiamen Hanin Co., Ltd.
6422 Оптический рефлектометр (OTDR) - Ceyear Technologies Co., Ltd.
Решение для защиты офиса от утечки данных - Sangfor Technologies Inc.
Интеллектуальный автоматический калибратор давления ConST811A - Beijing ConST Instruments Technology Inc.
Антенные системы и сопутствующая электронная продукция - Chengdu Zhongdian Jinjiang Information Industry Co., Ltd.
Промышленная кольцевая сеть Ethernet для горнодобывающей промышленности (10 Гбит/с / 1 Гбит/с) - Chongqing Mas Sci&Tech Co., Ltd.
Беспилотный рефрижератор Neolix X6 - Neolix Beijing Technology Co., Ltd.
QPS-20A Резервированный переключатель питания - CHN ENERGY ZHISHEN CONTROL TECHNOLOGY CO., LTD.
Читайте также
Американское подразделение Skanska получило контракт на строительство центров обработки данных стоимостью 1,2 млрд долларов США
2026-08-20
Unitree выпускает бионическую 7-осевую ловкую механическую руку по цене от 9900 юаней
2026-08-20
В первом полугодии этого года объем поставок человекоподобных роботов в Китае превысил 40 тысяч единиц, а доля в мире выросла до 97%
2026-08-20
Eco Wave Power и FAU из США обсуждают синергию ИИ и волновой энергии
2026-08-19
Google заплатил 10 миллионов долларов за данные авиакомпании Spirit Airlines
2026-08-19
Сингапурская Trident и американская DIG создают совместное предприятие в сфере ИИ
2026-08-19
Alibaba Cloud запускает третий центр обработки данных в Южной Корее
2026-08-18
Великобритания увеличивает финансирование программы CAM Pathfinder: общий объем составит 150 миллионов фунтов стерлингов, программа продлена до 2030 года
2026-08-18
Nvidia предоставляет гарантии на сумму до 105 млрд долларов США для американских центров обработки данных ИИ
2026-08-18
На основе инвестиций в 11 миллиардов фунтов стерлингов Vodafone Business и Tata Consultancy сотрудничают для трансформации британских предприятий
2026-08-17