刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」
8月24日,阿里的Wan 3.0视频生成模型在千问创作PC端和千问App正式上线。同期出现在千问创作里的还有Agent Teams创作模式:用户提一个想法,一组分别扮演编剧、导演、美术、分镜师、配乐师的Agent自动组队,接力把它做成影视作品。
承载这两者的「千问创作」是千问近期上线的AI创作平台。它的定位是面向专业创作者的创意平台:Wan 3.0及其满血的Prime版在这里全网首发,Prime版生成更快、效果也更进一步;视频模型外,平台还汇集了Qwen-Image-3.0等阿里顶尖模型,视听两端的素材都能就地解决。产品侧则提供画布工作流与多种专业Agent,AI短剧、漫剧、营销广告、图像设计可以在同一个工作台里一站式完成。
对专业内容生产来说,眼下卡住效率的环节,已经不是单条视频的质量了,卡脖子的是搬运。做过AI短剧的人大概都熟悉这套流程:一部三分钟的短剧拆成三四十个镜头,剧本在聊天窗口里写,角色四视图在生图工具里抽卡,分镜表落在表格里,再逐条把镜头描述翻译成提示词喂进视频模型;回来发现某个镜头中角色换了张脸,就得回上游改参考图,把下游重跑一遍。生成不难,难的是让几十次生成之间保持连续性。
Wan 3.0这一代的升级方向,目标就是要让生成结果可以直接使用。首先是时长,单段最长30秒,意味着一次人物出场、一轮完整冲突或一段产品演示可以放在同一个镜头序列里生成,而不必用多个10秒片段来回拼接,把接缝的数量降下来。其次是参考的丰富度,除文本、图片、音频、视频四种基础模态外,还支持doc、xls、ppt、pdf、md等文档格式输入,也支持网页链接。第三是一致性与镜头语言,Wan 3.0在角色长相、场景布局、服装道具、声音和画面风格等维度支持像素级控制,可复刻参考资产,并能驾驭推、拉、摇、移等镜头运动。
Agent Teams要解决的是前面那个搬运问题。它的交互起点只需一句自然语言。用户提出创作想法,系统自主拆解任务,把不同环节分派给承担导演、编剧、视觉设计、分镜师等角色的子Agent,围绕剧情、人物、视觉风格和镜头表达展开协作。千问创作的「人才市场」已经预置了59个Agent,包含不同风格的导演、美术、编剧、歌手等,用户也可以根据需求自行创建新的Agent。
我们给出的需求非常简单:一段「华强买瓜」的文字剧本,外加一句提示词「将这个剧本做成视频,视频风格参考《JoJo的奇妙冒险》」。没有分镜,没有角色设定,没有画幅要求。千问创作Agent Teams接手后的第一件事是派出创作助手,先做了一轮任务分析,然后抛出了一个问题:视频要什么画幅比例?确认之后,创作助手把任务做了更细一层的拆解,并给出一份组队方案。
接下来是各司其职的接力。第一棒是导演,它把原始剧本拆成11个剧情点,并写出了一份完整的讲戏本。然后是插画师开工,产出角色与场景的视觉资产。有了角色素材,轮到视频师逐镜头生成JoJo风格的片段。12条片段全部生成完成后,剪辑师上场,把它们拼接成了一段完整影片。
这套流程确实能把一个只有剧本和一句话的需求,推到一部结构完整、风格统一的成片,中间不需要在多个软件之间来回搬运资产。但它不是「一键成片」,从「能跑通」到「能交付」,仍然隔着人的验证和多轮优化。
为什么偏偏是视频这个场景,让多Agent协作看起来跑得通?因为任务本身已有成熟的分工协作范式。视频制作也正好满足这个条件:编剧、导演、美术、摄影、剪辑、配音,每个工种的职责边界、交付物格式、上下游接口,在电影工业里被打磨了一个世纪。Agent的分工不需要重新设计,照抄剧组编制就行。
把「专业」拆开看,专业成片至少包含三层:技术可用性、叙事完整性、商业可交付性。第一层模型已经基本解决,第二层是Agent Teams这类产品正在解决的地方,第三层是反复修改、精确对齐需求、在有限预算内控制废片率,目前仍然高度依赖人。
过去两年,AI视频的竞争叙事一直围绕模型指标展开:谁的时长更长,谁的一致性更好,谁的单秒更便宜。但当单条视频的质量逐渐逼近可用线,差距会转移到流程的组织方式上去。把编剧、导演、美术打包成一支可以被一句话调度的队伍,是对这个问题的一种回答。
想上手的话,直接前往千问创作PC端c.qianwen.com即可开始;也可以用千问App远程操控,创作资产与项目在多设备间互通,随时接着上一次的进度往下做。