VQOS / article
圖生影片智慧型代理最佳化:先將「聽話」寫成可檢查的問題
研究把提示詞與參數搜尋放進回饋循環。製作方仍應定義動作、限制重試成本,並用人工審核確認機器評分沒有漏項。
修訂說明:Translated from the published original; independently checked for meaning, facts and completeness.
2026年9月30日根據存留中文稿與核查資料重建修訂;並非舊稿逐字恢復。
研究把生成改成回饋循環
原始論文提出先用多模態模型根據語意與瑕疵問題改進提示詞,再用貝氏最佳化搜尋隨機種子與CFG等參數。它研究的是圖生影片遵循要求,不保證所有商業介面都開放同樣參數。本文沒有複現,作者偏好實驗不轉換成專案成功率。
把動作要求拆成問題
VQOS建議分別寫主體、動作、方向、順序和禁止變化。例如「右手拿起杯子,杯子始終留在畫面內,鏡頭不切換」。再列檢查項:是否用對手、杯子是否消失、動作完成了嗎?這是虛構任務說明,不是已執行測試。
參考圖能證明外觀,但不能自行規定未來動作。衝突的畫面和文字應先解決。
最佳化有預算,也有停止條件
規定最多重試次數或總預算,記錄每次修改及其原因。不要同時改變提示詞、素材與所有參數後,只憑最終片猜哪項有效。看似高評分的候選若仍違反關鍵要求,應停止擴大生成,回到任務定義或換方法。
最終審核不交給一個分數
連續看動作、遮擋、產品細節和背景,再核對文字與聲音。機器檢查的問題可能缺少品牌、真實尺寸或安全表達,審核人應補充實際專案條件。
查看VQOS製作服務,在製作需求約定試製、重試費用與驗收問題。研究中的閉環思想可用於改善工作方式,不是無人審片或穩定交付的保證。
繼續閱讀
查看全部文章 ↗Wan 3 與 Wan 2.7:AI 影片專案製作買家的技術與成本決策指南
基於 fal 發布的文檔數據,深度解析 Alibaba 的 Wan 3.0 Prime 與 Wan 2.7 模型在架構、參數支援、定價及生產約束上的核心差異。
AI 動畫製作決策:從 Hakoniwa 與 Comfy Agent 的短片案例看工作流權衡
分析 AI 動畫短片《YUI》的製作實踐,探討製片人與創意買家在評估 AI 視訊工具、模型對比及工時規劃時需要注意的實際邊界。
別把AI檢測分數當判決書:影片專案需要哪些來源證據
AI檢測結果可以提示複核,不能單獨證明作者、授權或責任。來源憑證與專案記錄提供不同證據,也有完整性與身分歸屬邊界。