Gemini Omni 隐藏功能揭秘:你可能不知道的用法
上周我在剪一支产品宣传片,拍了段手部特写展示新品,但画面实在太单调。我想让手里的产品悬浮起来,周围环绕一些动态粒子,但我的 After Effects 技术仅限于加个字幕。找外包?预算不够。自己硬啃 AE?时间不允许。
就在我准备放弃特效妥协交片时,我注意到了 Google 刚推出的 Gemini Omni Flash。官方说法是"结合逻辑推理与创作能力,以任何输入素材创造任意形式的内容"。听起来又是那种公关话术,但"通过对话编辑视频"这个点让我决定试一把。
结果?它不仅救了我的片子,还让我发现了一些官方文档里没细说的隐藏玩法。
第一步:从随手拍开始"世界替换"
最让我震惊的第一个隐藏功能,是 Omni 对空间的理解能力。
我上传了那段无聊的手持产品视频,然后输入:
Make the background a futuristic neon-lit cyberpunk street at night,
with rain reflections on the ground.
我本以为它只会简单地把背景抠掉换个静态图,但它生成的是一段完整的动态视频——雨滴打在地面上有水花溅起,霓虹灯的光晕随镜头微动产生真实的折射变化,而我的手和产品完全保留了原始的物理运动轨迹,没有任何抠图痕迹。
这就是 Omni 的核心能力之一:改变眼前的世界。它不是在做绿幕替换,而是在理解你视频的 3D 空间结构后,重新渲染整个场景。
更进阶的玩法是针对特定物体微调。官方给了一个绝佳例子:
Make the sculpture out of bubbles.
视频里的雕塑会变成由气泡组成的版本,气泡的表面会有真实的虹彩反射,甚至会随着环境光线微微晃动——但视频里其他所有东西完全不变。
第二步:重新想象动作与情节(这才是真正的杀手锏)
替换背景已经够酷了,但真正让我觉得"这工具要改变工作流"的,是它对动作和情节的改写能力。
我试了把那段手部视频做更激进的处理:
When the person touches the mirror, make the mirror ripple beautifully
like liquid, and the person's arm turns into reflective mirror material.
我原本的素材里根本没有镜子。但 Omni 理解了我的意图,它在画面中合理的位置生成了一面镜子,当手触碰时,镜面产生了液态般的涟漪效果,同时手臂逐渐变成了镜面材质,反射着周围的环境。
这种"理解意图并补全物理逻辑"的能力,是传统视频编辑工具绝对做不到的。
然后我试了一个更疯狂的递归提示:
Dim the lights in the room. Put a black and white checkerboard room
inside a glass sphere that floats tracking above the hand, inside it
contains a recursive representation of the same hand holding the sphere,
creating an infinite recursive of rooms. Camera slowly gets closer into
the sphere, creating a video loop.
说实话,我打这段 prompt 的时候自己都觉得是不是要求太过分了。但 Omni 真的生成了一个手持玻璃球的画面,球内是黑白棋盘格房间,房间里有一只更小的手拿着更小的球,层层嵌套,镜头缓缓推入形成无限循环。虽然最内层的递归细节有些模糊,但整体效果已经远超我的预期。
第三个隐藏玩法:音乐驱动的场景联动
这个用法我在任何评测里都没见过有人提,但它是目前最让我兴奋的。
我有一段晚上从山顶俯瞰城市的延时摄影,城市一片漆黑。我上传了视频和一段节奏感很强的电子音乐,然后输入:
The lights of the apartments start turning on in sync with the music.
Omni 分析了音频的节拍,然后让城市建筑里的灯光随着鼓点逐个亮起。亮灯的顺序甚至有逻辑——低楼层先亮,高楼层后亮,像是有人在跟着音乐逐层开灯。这种跨模态的音视频联动,是目前其他视频生成工具做不到的。
我踩过的坑
用了几天,也发现了一些限制:
- 角色一致性在长视频中会衰减。超过 10 秒的视频,人物面部细节可能会漂移。解决办法是分段生成,每段保持在 5-8 秒。
- 复杂物理交互偶尔翻车。比如要求"水杯倒下水流出来",水的流体模拟有时不够真实。Omni 对刚体物理理解很好,但流体和软体还是弱项。
- Prompt 太抽象会得到意外结果。有次我写"让画面充满忧伤的氛围",它直接把画面调成了黑白并加了雨。后来我学会描述具体视觉变化而非抽象情绪,结果可控性大幅提升。
- 迭代修改是链式的。每次指令都基于上一步的结果,这意味着如果你在第 3 步发现第 1 步就有问题,可能需要从头开始。建议先在脑中规划好修改顺序。
实用技巧总结
- 从具体到抽象:先确定场景和物体,再调整氛围和风格。顺序反了容易失控。
- 善用"保持...不变"的约束:比如
Keep the person's face unchanged, but change their outfit to a spacesuit,明确告诉模型什么不要动。 - 用参考图辅助:如果你想要特定风格,先上传一张参考图,再附上视频,比纯文字描述效果好得多。
- 音频不只是背景:把音频当作输入指令的一部分,让视频元素与声音节奏联动,这是 Omni 独有的优势。
诚实的评价
Gemini Omni Flash 目前还不是万能的。它生成的视频分辨率和帧率还达不到院线级标准,复杂场景偶尔会有穿帮。但作为创意原型工具和社交媒体内容制作,它已经足够强大。
最让我看好的是它的交互范式——像聊天一样编辑视频。这把视频创作的门槛从"掌握专业软件"降到了"能清楚描述你想要什么"。目前它已在 Gemini 应用、Google Flow 和 YouTube Shorts 中上线。
如果你还在用传统方式一帧帧抠特效,至少该花一个下午试试 Omni。它未必能替代你的最终交付流程,但绝对能改变你构思和迭代的方式。