近日,Google 推出了生成式视频模型 Gemini Omni 1.1 Flash,并重点升级了“长视频制作能力”。这意味着创作者不再局限于一次性产出短片,而是可以像剪辑一样,把画面分段往后接着长出来:模型在延伸影片时,可参考前面最多 10 秒内容,每次向后继续生成约 10 秒,累积最长可到 40 秒。相比旧版本只能参考末尾最后 1 秒的方式,新能力更有利于维持人物、场景与叙事的前后连贯。
更关键的是,新模型加入“首尾影格控制”。用户只需指定视频开头与结尾的两帧(首尾影格),其余中间画面由模型自动补齐,并形成连续影像。对需要镜头节奏、转场效果或重复播放短片的团队来说,这相当于多了一层“画面级导演能力”,不必只靠文字描述来推断镜头走向。
为了提升迭代效率,Gemini Omni 1.1 Flash 还提供了 360p 快速草稿模式。Google 表示,相比 720p,360p 的生成速度最高可快 60%,成本大约只有三分之一。开发者可以先用低分辨率快速跑通创意与版本,再在确认方向后切换到更高规格输出;同时,模型也可以输出 1080p 或最高 4K,属于先生成再通过后续处理提升清晰度,而非强制从一开始就直接硬做 4K。
此外,模型支持使用最长 3 秒的影片作为参考素材。它会根据参考片段中的动作与画面内容生成新视频。例如:你给出一张人物图片,再配一段舞蹈参考视频,就可以要求生成的角色模仿参考中的动作,让角色一致性更容易落地。
目前,Gemini Omni 1.1 Flash 已通过 Gemini API 提供,也可在 Google AI Studio 使用;在订阅体系中,Flow 会向部分用户提供这种新版模型,Gemini 应用也补上了影片场景延伸功能。对想把生成式视频做成“可控工作流”的开发者而言,这次升级更像是在把生成能力从“会做”推向“好做、好剪、可复用”。