Репортаж от Wedoany,19–20 июля 2026 года китайский производитель GPU Тяньшу Чжисинь официально представил новое флагманское решение общего назначения — Тяньгай 300, в рамках Всемирной конференции по искусственному интеллекту (WAIC 2026).

Будучи первым продуктом на базе новой собственной архитектуры Тяньшу Чжисинь, Тяньгай 300 прошёл комплексную модернизацию в области архитектуры чипа, ключевых операторов, масштабирования системы и программной экосистемы. Его цель — соответствовать и превзойти производительность основных решений на архитектуре Hopper (решения Hopper), обеспечивая вычислительную поддержку для масштабного применения ИИ.

Тяньгай 300 основан на универсальной вычислительной архитектуре SIMT, поддерживает различные типы вычислений, включая скалярные, векторные и тензорные, и оптимизирован для ключевых технологий, таких как Attention, MoE, разделение AF, разделение PD и крупномасштабное расширение системы. При сложных рабочих нагрузках продукт обеспечивает баланс между вычислительной эффективностью, задержкой выполнения и совокупной стоимостью владения (TCO), удовлетворяя комплексные требования к универсальности, производительности и стоимости для масштабного применения ИИ.
Шань Тяньи, руководитель направления ИИ и ускоренных вычислений Тяньшу Чжисинь, отметил, что искусственный интеллект переходит от «информационного интеллекта», понимающего и генерирующего информацию, к «интеллекту действий», способному планировать и выполнять задачи, и далее к «исследовательскому интеллекту», моделирующему и прогнозирующему неизвестное. Различные требования этих трёх типов интеллекта к вычислениям стали основной линией проектирования Тяньгай 300.
Для информационного интеллекта Тяньгай 300 оптимизирует Attention и MoE. В вычислениях Attention за счёт повышения параллельной эффективности матричных и векторных вычислений сокращается время ожидания чтения/записи данных, достигая эффективности Attention более 90% при различной точности, что превосходит решение Hopper. В сценариях с длиной контекста 64k эффективность Attention на 10% выше, чем у решения Hopper. В части MoE, благодаря совместной оптимизации алгоритмов и аппаратного обеспечения, вычислительная эффективность в сценарии DeepSeek V4 MoE превышает 70%, а общая эффективность обучения и соотношение цена/производительность превосходят решение Hopper; в сценариях вывода средняя эффективность на 10% выше, чем у решения Hopper.
Для интеллекта действий Тяньгай 300 усиливает возможности разделения PD, проводя дифференцированную оптимизацию этапов Prefill и Decode. В тестах на основных моделях, таких как Qwen, GLM, Kimi, DeepSeek, задержка первого слова снижена примерно на 20% по сравнению с решением Hopper. За счёт уменьшения накладных расходов протокола и оптимизации путей связи средняя задержка связи продукта снижена примерно на 13%. В тестах Decode на модели GLM 5.2 эффективность повышена на 10% по сравнению с решением Hopper.
Для исследовательского интеллекта Тяньгай 300 поддерживает скалярные, векторные и тензорные вычисления, охватывая различные форматы точности, такие как FP4, FP8, и инструкции MMA, DPX, FMA, адаптируясь к задачам, включая решение матриц, динамическое программирование, разреженные вычисления и цифровые двойники. В мировой модели Cosmos3 эффективность вывода на 10% выше, чем у решения Hopper.
Инновации в базовой архитектуре, обеспечивающие производительность Тяньгай 300, включают: ixSMEX, повышающий коэффициент повторного использования данных для уменьшения повторных обращений к памяти; ixDPX, сжимающий вычисления, требующие шести инструкций в динамическом программировании, в одну; и ixTrans, снижающий конфликты памяти и накладные расходы видеопамяти. Начиная с 2018 года Тяньшу Чжисинь постоянно совершенствует программный стек, разработав почти сотню библиотек ускорения и сформировав инструментарий, охватывающий связь, компиляцию, драйверы, квантизацию и анализ производительности. Тяньгай 300 поддерживает основные мировые фреймворки больших моделей и ключевые компоненты ускорения. В настоящее время продукт готов к масштабному применению и проходит глубокую адаптацию с китайскими облачными провайдерами, производителями серверов, экосистемой взаимосвязей и суперузловыми системами, поддерживая масштабное развертывание от отдельных машин до крупных кластеров.










