跳转主内容
VQOS
工作台发布需求

VQOS / article

图生视频智能体优化:先把“听话”写成可检查的问题

研究把提示词与参数搜索放进反馈循环。制作方仍应定义动作、限制重试成本,并用人工审核确认机器评分没有漏项。

作者:VQOS 编辑部已核实发布:更新:

修订说明:2026-09-30T15:36:32Z|核查后重建修订;核对两阶段优化方法,区分论文偏好指标与项目成功率,补充预算及人工审核。 不以来源日期冒充文章发布日期;首次恢复/发布日期由实际发布记录设置,修改时间使用实际执行时间。

原始资料
2026年9月30日根据存留中文稿与核查资料重建修订;并非旧稿逐字恢复。

研究把生成改成反馈循环

原始论文提出先用多模态模型根据语义与瑕疵问题改进提示词,再用贝叶斯优化搜索随机种子与CFG等参数。它研究的是图生视频遵循要求,不保证所有商业接口都开放同样参数。本文没有复现,作者偏好实验不转换成项目成功率。

把动作要求拆成问题

VQOS建议分别写主体、动作、方向、顺序和禁止变化。例如“右手拿起杯子,杯子始终留在画面内,镜头不切换”。再列检查项:是否用对手、杯子是否消失、动作完成了吗?这是虚构任务说明,不是已执行测试。

参考图能证明外观,但不能自行规定未来动作。冲突的画面和文字应先解决。

优化有预算,也有停止条件

规定最多重试次数或总预算,记录每次修改及其原因。不要同时改变提示词、素材与所有参数后,只凭最终片猜哪项有效。看似高评分的候选若仍违反关键要求,应停止扩大生成,回到任务定义或换方法。

最终审核不交给一个分数

连续看动作、遮挡、产品细节和背景,再核对文字与声音。机器检查的问题可能缺少品牌、真实尺寸或安全表达,审核人应补充实际项目条件。

查看VQOS制作服务,在制作需求约定试制、重试费用与验收问题。研究中的闭环思想可用于改善工作方式,不是无人审片或稳定交付的保证。