Репортаж от Wedoany,Компания iFlytek 19 июля официально представила Spark Token Factory, предназначенный для повышения эффективности применения больших языковых моделей (LLM) на предприятиях и уровня управления ими, а также для создания фундаментальной инфраструктуры для больших моделей будущего.
В процессе масштабного внедрения ИИ на предприятиях возникает ряд проблем операционного управления. Количество типов моделей постоянно растет, стоимость их вызова неуклонно повышается, требования к стабильности системы ужесточаются, а развитие таких возможностей, как кросс-модельное управление, контроль затрат, обеспечение безопасности и мониторинг работы, относительно отстает. Предприятиям часто требуется одновременно подключать несколько модельных сервисов для поддержки различных бизнес-сценариев: помощников по коду, интеллектуальных служб поддержки, систем вопросов-ответов на основе знаний, генерации контента, обработки документов и других. Сложность разных задач существенно различается, однако на практике для их обработки часто используется единая модель, что приводит к низкой эффективности использования ресурсов и постоянному росту затрат на токены. Параллельная работа нескольких моделей также предъявляет более высокие требования к стабильности системы, безопасности и операционному управлению. Строительство корпоративного ИИ постепенно переходит от этапа «создания модельных возможностей» к этапу «создания ИИ-инфраструктуры», где фокус смещается с возможностей самих моделей на то, как интегрировать эти возможности в бизнес-процессы, обеспечивая стабильную работу, унифицированное управление и непрерывную оптимизацию.
Spark Token Factory позиционируется как корпоративная интеллектуальная платформа маршрутизации ИИ-моделей, предоставляющая такие ключевые возможности, как унифицированное подключение моделей, интеллектуальная маршрутизация и диспетчеризация, оптимизация затрат на токены, а также обеспечение безопасности и соответствия нормативным требованиям. Платформа формирует полный замкнутый цикл, охватывающий «подключение — управление — мониторинг — эксплуатацию», создавая для предприятий единый шлюз для сервисов больших моделей и обеспечивая управляемость, контролируемость и отслеживаемость ресурсов больших моделей.

Функция интеллектуальной маршрутизации определяет сложность задачи на основе многомерных характеристик, таких как длина Prompt, предустановленные правила, пользовательские правила, количество диалоговых раундов, привязка к сессии и другие, осуществляя уровневое интеллектуальное управление запросами от L1 до L3. Платформа комплексно учитывает пять факторов: качество, стоимость, задержку, доступность и уровень безопасности, чтобы подобрать подходящий модельный ресурс. Простые задачи направляются на более экономичные модели, а сложные — в первую очередь на модели с более высокими возможностями. Средняя задержка принятия решения может быть ограничена 100 миллисекундами. Благодаря возможностям интеллектуальной маршрутизации платформа эффективно снижает нагрузку на вызовы крупноразмерных моделей, открывая для предприятий больше возможностей для оптимизации затрат.

В сценариях локального развертывания с использованием отечественного оборудования Spark Token Factory выполняет сквозную инженерную оптимизацию популярных моделей с открытым исходным кодом с учетом характеристик аппаратного обеспечения Ascend. На стороне видеопамяти применяются различные методы сжатия моделей и оптимизации точности, позволяющие снизить использование видеопамяти при сохранении контролируемой точности. На стороне вычислений и коммуникаций объединяются ключевые вычислительные операторы, а многокарточная коммуникация оптимизируется путем перепланировки для достижения параллелизма вычислений и коммуникаций. На стороне кэширования и диспетчеризации используется межузловое распределенное управление KV-кэшем и многоуровневая диспетчеризация хранилища, внедряется контекстно-зависимая маршрутизация кэша и стратегии рекомбинации и повторного использования контекста. На стороне декодирования внедряется механизм ускорения параллельного декодирования, ориентированный на оборудование Ascend. Фактические тестовые данные показывают, что при одинаковых аппаратных условиях по сравнению с фреймворком с открытым исходным кодом vLLM-Ascend эффективность вывода увеличивается примерно в 5 раз, а задержка первого токена снижается на 30%–40%.

В аспекте безопасности Spark Token Factory использует архитектуру разделения властей на три ветви: управление не имеет доступа к данным, операции не имеют доступа к правам, аудит не имеет доступа к бизнесу. Эти три ветви независимы и взаимно контролируют друг друга. Платформа автоматически генерирует неизменяемые сквозные записи аудита для всех ключевых операций, охватывающие шесть категорий: доступ к данным, изменение прав, вызов моделей, экспорт данных, что соответствует требованиям стандартов информационной безопасности. Защита конфиденциальной информации охватывает персональные данные и коммерческие данные, осуществляется их уровневая маршрутизация, гарантирующая, что конфиденциальные данные не покидают установленную область.

Spark Token Factory предоставляет возможность сквозного аудита журналов по всей цепочке, обеспечивая полную запись процесса от поступления запроса на платформу до возврата конечного результата. Благодаря отслеживанию журналов, записи решений по маршрутизации, статистике потребления токенов и анализу причин затрат предприятия получают информацию о состоянии выполнения и потреблении ресурсов для каждого вызова модели. В сочетании с управлением бюджетом, анализом ROI и визуализированными отчетами это обеспечивает поддержку данными для последующей оптимизации эксплуатации и планирования ресурсов. Выпуск Spark Token Factory дополнил возможности iFlytek в области корпоративной ИИ-инфраструктуры, а также знаменует собой переход корпоративных приложений больших моделей от точечных экспериментов к новому этапу масштабной эксплуатации.










