Китайская компания JD.com открыла исходный код фреймворка JoyAI-Echo для генерации длинных аудио- и видеоматериалов
2026-06-04 09:29
В избр.

Репортаж от Wedoany,3 июня компания JD.com представила фреймворк JoyAI-Echo для генерации длинных аудио- и видеоматериалов, код и веса которого полностью открыты. Этот фреймворк ориентирован на сценарии создания длинных аудио- и видеороликов. Он включает интеллектуального «помощника режиссёра» Director Agent и оснащён кроссмодальной аудиовизуальной памятью, которая позволяет непрерывно сохранять и вызывать внешние характеристики персонажей и тембр голоса говорящего в процессе генерации нескольких кадров.

JoyAI-Echo решает давнюю проблему стабильности при создании длинных видеороликов. Современные модели генерации видео уже демонстрируют высокую производительность в коротких фрагментах, однокадровых сценах и сценариях с одним персонажем. Однако при переходе к многосценарному повествованию, последовательному появлению персонажей, диалогам и генерации длительного контента модели часто сталкиваются с такими проблемами, как дрейф внешности персонажа, несоответствие тембра голоса, логическая разрозненность кадров и низкая скорость генерации. JoyAI-Echo использует кроссмодальную аудиовизуальную память для записи идентичности персонажа, визуального образа и звукового контекста, что позволяет последующим кадрам продолжать использовать предыдущую информацию. Director Agent берёт на себя функции разбора сценария, персонажей и кадров, позволяя пользователям выдвигать творческие запросы и вносить изменения с помощью естественного языка, тем самым снижая затраты на многократный перезапуск всего контента в процессе создания длинных видео.

Согласно репозиторию JD.com с открытым исходным кодом, JoyAI-Echo поддерживает генерацию многосценарных аудио- и видеоматериалов длительностью в минуты, позволяет создавать связные истории с помощью одного JSON-подсказки и использует метод дистилляции DMD для ускорения генерации за счёт сокращения количества шагов вывода.

Значение этого фреймворка заключается в том, что он переводит генерацию длинных аудио- и видеоматериалов из разряда «однократного результата» в «творческий процесс с возможностью непрерывного редактирования». В таких сценариях, как предварительная визуализация фильмов, создание брендовых видеороликов, контент с цифровыми аватарами, создание виртуальных историй и короткие сериалы для прямых трансляций, создателям требуется не просто сгенерировать один кадр, а обеспечить единый образ, единый голос и единый стиль повествования персонажа на протяжении нескольких сюжетных линий. JoyAI-Echo объединяет аудио, видео, память персонажей, планирование кадров и диалоговое редактирование в едином фреймворке, что способствует снижению технического порога для создания длинного контента. После полного открытия исходного кода и весов разработчики смогут проводить вторичную разработку, оценку моделей и адаптацию под вертикальные сценарии на основе этого фреймворка, что будет способствовать дальнейшему расширению экосистемы генерации длинных аудио- и видеоматериалов в Китае.

Дальнейшие переменные будут сосредоточены на адаптации в сообществе с открытым исходным кодом, фактической стоимости развёртывания, согласованности длинных видео, интерактивном опыте редактирования и скорости внедрения в коммерческие сценарии. По мере перехода генерации AI-видео от коротких демонстраций к более сложным этапам производства контента, память персонажей, согласованность голоса, непрерывность кадров и возможность редактирования станут важными показателями конкуренции фреймворков. Открытие исходного кода JoyAI-Echo предоставит воспроизводимый и расширяемый технологический вход в область генерации длинных аудио- и видеоматериалов.

Данный материал скомпилирован платформой Wedoany. При цитировании материалов, созданных с помощью искусственного интеллекта (ИИ), необходимо обязательно указывать источник — «Wedoany». В случае выявления нарушения прав или иных проблем просим своевременно информировать нас. Сайт оперативно внесёт изменения или удалит материал.Электронная почта: news@wedoany.com

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com
Связанные продукты
Последние новости
1
Урожайность озимой пшеницы в Хохольском районе в середине июля достигла 80 центнеров с гектара
2
Австралийская Silver Mines завершила ТЭО проекта Bowdens, запасы серебра выросли на 30% до 93,5 млн унций
3
Австралийский совет моды запускает исследование целесообразности создания «Умной швейной фабрики»
4
Aluminum Dynamics инвестирует 200 миллионов долларов в строительство центра алюминиевых слябов в Миссисипи
5
В Китае завершена прокладка контактной сети на всей линии высокоскоростной железной дороги Наньчан-Цзюцзян
6
Последний отчет по руднику Guanaco компании Austral Gold в Чили: срок эксплуатации 14 лет, NPV 192 млн долларов США
7
Панама планирует создать государственную горнодобывающую компанию совместно с канадской First Quantum для возобновления работы медного рудника Кобре
8
Чили планирует инвестировать 100 миллиардов долларов в медную промышленность в течение следующих десяти лет
9
Канадская компания Purecore завершила первый этап разведки на проекте критических минералов Bankier
10
Морской ветропарк мощностью 315 МВт в Ога–Катагами–Акита, Япония, получил сертификацию
Связанные рекомендации
Американская торговая платформа Xometry модернизирует ИИ: точность прогнозирования стоимости ЧПУ повышена примерно на 15%
2026-07-23
Китайская компания Tuosida совместно с Feijiekesi представила промышленную физическую модель мира Fysiverse
2026-07-23
Южная Корея запускает проект AI-RAN стоимостью 172 млрд вон для тестирования промышленных AI-приложений
2026-07-23
Китайская компания Questyle Audio выпустила Bluetooth-передатчик QCC Dongle Pro2 с поддержкой технологии Snapdragon Sound
2026-07-23
Furukawa Electric и Vecima объединяются для запуска продуктов 10G-EPON в Японии в 2027 году
2026-07-23
Южнокорейская компания Upstage выпустила модель-агент с 250 миллиардами параметров
2026-07-23
Южнокорейская компания OpenLabs представила агентный движок для разработки ИИ Nuvida
2026-07-23
Корейская компания Rebellion успешно запустила ИИ-модель SK Telecom с 500 миллиардами параметров
2026-07-23
Amazon Leo инвестирует 10 миллиардов долларов в развертывание 400 спутников для ускорения выхода на индийский рынок
2026-07-23
Компания Oracle выпустила открытое, бесплатное, кроссплатформенное программное обеспечение для виртуализации VirtualBox 7.2.14
2026-07-23