
從跑通到出片JoyAI-Echo 分鐘級長視頻生成完整上手指南【免費下載鏈接】JoyAI-EchoJoyAI-Echo這是一個獨立的、僅用于推理的版本旨在實現(xiàn)分鐘級多鏡頭音視頻生成。它采用了經(jīng)過蒸餾的DMD生成器、配對的跨模態(tài)記憶以及故事級別的一致性。其性能的核心在于一個跨模態(tài)視聽記憶庫能夠在長達五分鐘的視頻中保持角色外觀和語音音色的一致性。同時一個訓練后處理流程將基于記憶的強化學習與分布匹配蒸餾相結(jié)合實現(xiàn)了7.5倍的速度提升顯著增強了視覺質(zhì)量和對齊效果。項目地址: https://ai.gitcode.com/jd-opensource/JoyAI-EchoJoyAI-Echo 是一款分鐘級多鏡頭音視頻生成工具給它一份鏡頭腳本它能產(chǎn)出帶同步音頻的長視頻故事最長 5 分鐘角色外觀和音色在鏡頭切換之間保持穩(wěn)定推理速度比原始多步管線快約 7.5 倍單張 48GB 顯存的顯卡就能跑默認配置。官方 GSB 用戶測試里對比同場景競品的偏好度為音頻質(zhì)量 81.7%、提示遵循 80.6%、視覺美觀 63.6%、角色一致性 59.4%長視頻場景的優(yōu)勢比較明確。機器能不能跑顯存、依賴和權(quán)重先核對默認配置是 1280×736 分辨率、每鏡頭 241 幀、25fps峰值顯存約 46–50GB所以單張 H100/A10080GB或任何 48GB 以上的卡都能直接跑。顯卡更小也不是不能用把幀數(shù)和分辨率降下來即可命令見后文。核對項要求GPU 顯存峰值 46–50GB單卡 48GB 起即可軟件棧Python 3.11 PyTorch 2.8 CUDA 12.8另需 FFmpeg權(quán)重文件主權(quán)重 echo-longvideo-release.safetensors 與文本編碼器 gemma-3-12b/軟件棧對應倉庫里的 environment.yml 和 requirements.txt照著裝即可。權(quán)重需要單獨獲取后放到推理目錄下的 checkpoints/布局固定為checkpoints/ ├── echo-longvideo-release.safetensors └── gemma-3-12b/另外注意許可邊界該項目基于 LTX-2遵循 LTX-2 Community License限定學術研究與非商業(yè)用途商用需另行聯(lián)系版權(quán)方。第一次推理怎么跑通代碼和推理腳本從倉庫獲取git clone https://gitcode.com/jd-opensource/JoyAI-Echo cd JoyAI-Echo環(huán)境用 uv 兩步搞定也支持 conda按 environment.yml 創(chuàng)建uv venv --python 3.11 .venv source .venv/bin/activate uv pip install --extra-index-url https://download.pytorch.org/whl/cu128 -r requirements.txt權(quán)重就位后直接運行python inference.py結(jié)果輸出在 inference_result/outputs/提示文件名/inference_時間戳/ 下視頻和音頻在同一目錄。第一次建議就用默認配置跑一個單鏡頭確認畫面、音頻、輸出路徑都沒問題再去做多鏡頭。提示詞怎么寫每個鏡頭包含六個部分提示詞文件放在 prompts/ 目錄下內(nèi)容是單個 JSON 對象prompts 字段是一個字符串列表每個字符串就是一個完整鏡頭寫一個字符串出單鏡頭寫多個就是多鏡頭故事。新鏡頭會自動參考前面鏡頭的視覺與語音記憶故事級一致性由跨模態(tài)記憶庫維持。每個鏡頭內(nèi)部按固定順序?qū)懥糠秩绷四牟糠稚蓵r哪部分就容易失控部分寫什么角色與主體畫面中所有人的外觀年齡、體型、發(fā)型、五官、服裝有臺詞的還要寫音色動作與臺詞角色做什么、說什么風格整體視覺與情緒基調(diào)如寫實電影感、冷調(diào)日光鏡頭運動景別與運鏡如面部穩(wěn)定特寫、腰部以上中景背景主體身后的場景與細節(jié)音效與 BGM場景聲音和背景音樂或明確寫無背景音樂官方特別強調(diào)一點提示詞先過增強器再推理。多鏡頭用 prompts/long_story_writer_system_prompt.md單鏡頭用 prompts/short_story_writer_system_prompt.md把簡短想法擴寫成規(guī)范的鏡頭描述——不擴寫直接喂模型效果明顯偏弱。效果不達預期時怎么調(diào)癥狀調(diào)整角色外觀或音色前后鏡頭漂移每個鏡頭用同一套描述詞寫角色服裝、發(fā)型、音色別換說法畫面和文字描述對不上先用增強器把提示詞擴寫成完整鏡頭描述再推理顯存不夠或生成太慢降幀數(shù)和分辨率python inference.py --num-frames 121 --video-height 480 --video-width 832多鏡頭銜接生硬在相鄰鏡頭提示詞里補過渡描述保持場景與時間線連貫先用單鏡頭、低分辨率把整條流程跑通確認畫面和聲音都正常后再回到默認 1280×736、241 幀出正式片子提示詞記得先過增強器再交給模型。【免費下載鏈接】JoyAI-EchoJoyAI-Echo這是一個獨立的、僅用于推理的版本旨在實現(xiàn)分鐘級多鏡頭音視頻生成。它采用了經(jīng)過蒸餾的DMD生成器、配對的跨模態(tài)記憶以及故事級別的一致性。其性能的核心在于一個跨模態(tài)視聽記憶庫能夠在長達五分鐘的視頻中保持角色外觀和語音音色的一致性。同時一個訓練后處理流程將基于記憶的強化學習與分布匹配蒸餾相結(jié)合實現(xiàn)了7.5倍的速度提升顯著增強了視覺質(zhì)量和對齊效果。項目地址: https://ai.gitcode.com/jd-opensource/JoyAI-Echo創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考