NVIDIA ускоряет DiffusionGemma в 4 раза
2026-06-11 10:25
В избр.

Репортаж от Wedoany,Google DeepMind выпустила экспериментальную открытую модель DiffusionGemma, предназначенную для сверхбыстрой генерации текста. NVIDIA оптимизировала эту модель для более быстрой работы на графических процессорах NVIDIA GeForce RTX, платформе NVIDIA RTX PRO и системе NVIDIA DGX Spark, охватывая широкий спектр сред — от локальных ПК до облачных решений.

В отличие от традиционного поочередного генерирования слов, DiffusionGemma способна параллельно создавать несколько слов, выводя целые текстовые блоки. Модель построена на основе Gemma 4 — гибридной экспертной модели с 26 миллиардами параметров, активирующей лишь 3,8 миллиарда параметров на каждом шаге, и сочетает диффузионную головку с архитектурой Google Gemma 4. По производительности DiffusionGemma на локальном оборудовании обеспечивает до 4-кратного ускорения генерации текста по сравнению с эквивалентными авторегрессионными моделями. Как открытая модель, DiffusionGemma распространяется под либеральной лицензией Apache 2.0 с открытыми весами и полностью работает локально на RTX и DGX Spark без необходимости облачных зависимостей, получая немедленную поддержку в Hugging Face Transformers, vLLM и Unsloth. Кроме того, пользователи могут бесплатно протестировать DiffusionGemma через API, размещенный NVIDIA на build.nvidia.com.

Большинство широко используемых в настоящее время больших языковых моделей (LLM) применяют авторегрессионный метод генерации, при котором каждый токен создается последовательно, а каждое новое слово зависит от предыдущего. DiffusionGemma, основанная на гибридной экспертной архитектуре Gemma 4 26B, генерирует текст подобно тому, как диффузионные модели создают изображения: начиная с шума, она за один раз уточняет целый текстовый блок. На каждом шаге модель параллельно устраняет шум до 256 токенов. Для чувствительных к задержкам однопользовательских задач, таких как интерактивные чаты, циклы агентов или ассистенты на устройствах, такая параллельность позволяет скорости отклика соответствовать требованиям разработки и итераций.

Традиционные LLM при генерации одного токена за раз часто ограничены пропускной способностью памяти, и значительная часть вычислительной мощности остается неиспользованной. DiffusionGemma, напротив, обрабатывает полные блоки токенов параллельно через Transformer, и ее вычислительно интенсивная рабочая нагрузка идеально подходит для преимуществ графических процессоров NVIDIA. Данные показывают, что DiffusionGemma достигает 1000 токенов/сек на одном NVIDIA H100 Tensor Core GPU, 150 токенов/сек на NVIDIA DGX Spark и обеспечивает самую быструю локальную инференцию на NVIDIA DGX Station, работая примерно в 4 раза быстрее эквивалентной авторегрессионной модели в тех же однопользовательских сценариях.

Это преимущество в производительности распространяется на всю линейку продуктов NVIDIA, включая локальный настольный персональный AI-суперкомпьютер DGX Spark на базе NVIDIA GB10 Grace Blackwell Superchip с 128 ГБ унифицированной памяти; рабочую станцию RTX PRO 6000, предоставляющую разработчикам достаточно локального пространства; DGX Station с быстрой скоростью инференции до 800 токенов/сек и 748 ГБ когерентной памяти; а также графические процессоры GeForce RTX, которые вскоре получат поддержку llama.cpp.

Использование Hugging Face Transformers — самый быстрый способ запустить DiffusionGemma на GeForce RTX 5090 или DGX Spark. Для инференции с более высокой пропускной способностью vLLM предлагает немедленную поддержку. Пользователи могут донастроить модель для конкретных задач или областей с помощью Unsloth и фреймворка NVIDIA NeMo. Более подробные технические сведения можно найти в техническом блоге NVIDIA и официальном объявлении Google DeepMind.

Данный материал скомпилирован платформой Wedoany. При цитировании материалов, созданных с помощью искусственного интеллекта (ИИ), необходимо обязательно указывать источник — «Wedoany». В случае выявления нарушения прав или иных проблем просим своевременно информировать нас. Сайт оперативно внесёт изменения или удалит материал.Электронная почта: news@wedoany.com

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com
Связанные продукты
Последние новости
1
Выручка Huntsman из США во 2-м квартале составила 1,663 млрд долларов, слияние с Olin продвигается
2
Японская JERA сообщает о операционной прибыли в 174,4 млрд иен за первый квартал 2026 финансового года
3
2026年7月阳光电源在塞拉利昂投运35MWh光储项目
4
NLC India получила письмо о намерениях на реализацию солнечного проекта мощностью 900 МВт в Гуджарате
5
Tata Power запускает в Индии проект ВИЭ мощностью 800 МВт
6
Турция добавила 2,1 ГВт солнечной энергии в первом полугодии 2026 года
7
Первый этап индонезийского проекта солнечной энергетики мощностью 100 ГВт одобрен, скоро закладка первого камня
8
Clariant расширяет дистрибуцию добавок для нефтепромысловых работ в трех странах Западной Африки в партнерстве с Gapuma
9
Braskem и Lallemand запускают платформу по производству биологического ацетона в США
10
Продажи Wacker Chemie во 2-м квартале 2026 года составили 1,52 млрд евро, рост на 7% в годовом исчислении
Связанные рекомендации
Индийская HFCL получила заказ на оптоволоконные кабели на сумму 46,13 млн долларов США с поставкой до 2027 года
2026-07-31
Министерство энергетики США и альянс инвестируют 100 миллиардов долларов в строительство центров обработки данных и энергетической инфраструктуры
2026-07-31
Silvaco и NVIDIA объединяют усилия для продвижения цифровых двойников в полупроводниковой отрасли
2026-07-31
Google обновляет Gemini для macOS, добавляя системную голосовую диктовку и восприятие экрана
2026-07-31
Версия 1.131 Visual Studio Code от Microsoft добавила функции диктовки и субагентов
2026-07-31
Corning из США нацеливается на рынок CPO объемом 10 миллиардов долларов
2026-07-31
Канадская TELUS планирует развернуть 100% Open RAN к 2029 году
2026-07-31
Акции Oracle взлетели более чем на 8%! Расширение сотрудничества с Google Cloud: модели Gemini будут полностью интегрированы в корпоративные приложения Fusion и NetSuite
2026-07-31
Новый шаг ByteDance! Doubao, Feishu и Volcano Engine будут реорганизованы и объединены
2026-07-30
Intel открывает технологию процессоров Atom для стартапа Rosaic Labs
2026-07-30