WEKA (США) подтвердила длинноконтекстные рассуждения в Oracle Cloud, пропускная способность увеличена в 10 раз
2026-06-10 11:30
В избр.

Репортаж от Wedoany,Американская компания WEKA, специализирующаяся на инфраструктуре данных и памяти для ИИ, 9 июня 2026 года объявила о завершении производственных эталонных тестов своей платформы NeuralMesh в сочетании с Augmented Memory Grid на облачной инфраструктуре Oracle Cloud Infrastructure (OCI). Результаты показали, что без увеличения количества GPU и узлов кластера данное решение позволяет увеличить количество одновременных пользователей в сценариях длинноконтекстных рассуждений примерно в 10 раз, пропускную способность токенов — примерно в 10 раз, а количество токенов, генерируемых на один GPU, — примерно в 7 раз. Тестирование проводилось на кластере из 9 узлов OCI Bare Metal H100, объектом проверки было окно контекста размером 100 000 токенов.

Данное тестирование было сосредоточено на корпоративных длинноконтекстных рассуждениях. WEKA сообщила, что после внедрения NeuralMesh с Augmented Memory Grid количество одновременных пользователей увеличилось с примерно 600 человек в конфигурации только с DRAM до более чем 5 000 человек. Что касается пропускной способности токенов, данное решение достигло примерно 2 миллионов токенов в секунду, в то время как базовый уровень только с DRAM составлял менее 200 000 токенов в секунду. В ходе часового теста с 2 400 пользователями Augmented Memory Grid обслужила около 5 миллиардов токенов, а базовый уровень только с DRAM — около 700 миллионов токенов.

Тестовая среда состояла из 9 узлов OCI Bare Metal H100, каждый узел оснащен 8 GPU H100, всего 72 GPU. Согласно техническому блогу Oracle, каждый узел также оснащен 16 твердотельными накопителями Gen4 NVMe и двумя сетевыми картами 200Gb RDMA. Augmented Memory Grid расширила доступный объем кэша NVMe до 287 ТиБ, в то время как в базовой среде доступная DRAM составляла около 8,64 ТиБ. Для каждого смоделированного пользователя было установлено 100 000 токенов на ввод и 100 токенов на вывод, чтобы имитировать нагрузку на кэш при работе с длинными документами, многораундовыми сессиями и задачами агентов.

Ключевым моментом в таких тестах является не только количество GPU. В процессе выполнения длинноконтекстных рассуждений постоянно генерируется KV-кэш. Когда окно контекста расширяется до уровня 100 000 токенов, объем кэша и коэффициент попадания в кэш влияют на пропускную способность, задержку и эффективность использования GPU. В конфигурации только с DRAM после насыщения кэша легко возникают вытеснение кэша и повторные вычисления предварительного заполнения. Для таких приложений, как поиск, реферирование, помощь в написании кода и многораундовые агенты, это приводит к более высоким затратам на обслуживание и менее стабильному времени отклика.

Подход Augmented Memory Grid заключается в отделении KV-кэша от локальной видеопамяти GPU и DRAM и его размещении в высокопроизводительном кластерном хранилище токенов. В описании продукта на странице OCI компания WEKA поясняет, что данное решение основано на NeuralMesh и NeuralMesh Axon и использует RDMA и GPUDirect Storage для непрерывной передачи данных key-value кэша между памятью GPU и флэш-памятью, расширяя уровень кэша за счет инфраструктуры OCI Bare Metal GPU без добавления физической DRAM.

Согласно техническому блогу Oracle, данное тестирование перешло от ранней проверки TTFT к проверке производственных нагрузок, охватывающей плотность одновременных подключений, непрерывную пропускную способность, сохраняемость кэша и стабильность обслуживания при высоких нагрузках. В блоге также показано, что в тесте сравнивались стандартный базовый уровень обслуживания vLLM на HBM+DRAM и схема расширения кэша с внедрением Augmented Memory Grid. Результаты показали, что при достижении предела DRAM-кэша время отклика базового уровня колебалось, в то время как схема расширения кэша поддерживала более стабильный уровень обслуживания при более высокой степени параллелизма.

WEKA заявила, что NeuralMesh with Augmented Memory Grid уже доступна клиентам и размещена на Oracle Cloud Marketplace, причем OCI является ее первым облачным партнером. Для клиентов, развертывающих корпоративные ИИ-приложения, этот результат указывает на практическую проблему: в условиях быстрого роста спроса на длинноконтекстные рассуждения расширение вычислительных мощностей — не единственный вариант; расширение кэша, пути передачи данных и планирование кластера также влияют на стоимость одного токена и емкость онлайн-сервиса.

Данный материал скомпилирован платформой Wedoany. При цитировании материалов, созданных с помощью искусственного интеллекта (ИИ), необходимо обязательно указывать источник — «Wedoany». В случае выявления нарушения прав или иных проблем просим своевременно информировать нас. Сайт оперативно внесёт изменения или удалит материал.Электронная почта: news@wedoany.com

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com
Связанные продукты
Последние новости
1
Официальная версия API DeepSeek-V4-Flash сегодня запущена в открытое бета-тестирование
2
Британская Davies Crane Hire пополняет парк кранами Grove грузоподъёмностью 300 и 250 тонн
3
Google из США представила модель гуманоидного робота Gemini Robotics 2
4
Пробный запуск проекта расширения мощности на 20 миллионов тонн в год на месторождении Серра-Сул компании Vale в Бразилии
5
Испания: Adif получила разрешение на тендер по электрификационному оборудованию на сумму 13,78 млн евро
6
Китайская компания Lusi Shares инвестирует 19,52 млн юаней в проект по производству 6000 тонн влажного корма для домашних животных
7
Выручка Huntsman из США во 2-м квартале составила 1,663 млрд долларов, слияние с Olin продвигается
8
Японская JERA сообщает о операционной прибыли в 174,4 млрд иен за первый квартал 2026 финансового года
9
2026年7月阳光电源在塞拉利昂投运35MWh光储项目
10
NLC India получила письмо о намерениях на реализацию солнечного проекта мощностью 900 МВт в Гуджарате
Связанные рекомендации
Официальная версия API DeepSeek-V4-Flash сегодня запущена в открытое бета-тестирование
2026-07-31
Google из США представила модель гуманоидного робота Gemini Robotics 2
2026-07-31
Индийская HFCL получила заказ на оптоволоконные кабели на сумму 46,13 млн долларов США с поставкой до 2027 года
2026-07-31
Министерство энергетики США и альянс инвестируют 100 миллиардов долларов в строительство центров обработки данных и энергетической инфраструктуры
2026-07-31
Silvaco и NVIDIA объединяют усилия для продвижения цифровых двойников в полупроводниковой отрасли
2026-07-31
Google обновляет Gemini для macOS, добавляя системную голосовую диктовку и восприятие экрана
2026-07-31
Версия 1.131 Visual Studio Code от Microsoft добавила функции диктовки и субагентов
2026-07-31
Corning из США нацеливается на рынок CPO объемом 10 миллиардов долларов
2026-07-31
Канадская TELUS планирует развернуть 100% Open RAN к 2029 году
2026-07-31
Акции Oracle взлетели более чем на 8%! Расширение сотрудничества с Google Cloud: модели Gemini будут полностью интегрированы в корпоративные приложения Fusion и NetSuite
2026-07-31