如何用 Gemini 3.5系列 / Gemini Omni 提升效率

productivity入门8 分钟阅读2026/7/22

上个月,我正在为团队的新功能上线剪辑一个产品演示视频。录屏内容还算过得去,但背景是个乱糟糟的家庭办公室,光线平平无奇,而且我特别想在点击鼠标时,在光标旁边加一个微妙的动态图表。在 After Effects 里跟关键帧死磕了两个小时后,我放弃了。这视频注定只能平庸地交差了。

那种挫败感让我忍不住去折腾新东西。我之前总听人提起 Google 的新模型 Gemini——特别是 Gemini Omni 和 Gemini 3.5 Flash——我就想,它们到底能不能帮着干点正事,而不只是生成些华而不实的演示视频?把这两个模型整合到我日常工作流里试了几周后,我确实发现了一些能大幅提升生产力的用法,碰到了一些小毛病,也彻底搞清楚了它们各自到底擅长什么。

下面就是我平时的使用心得。

了解这两个模型

首先,得快速区分一下,因为一开始我也被搞懵了。这俩完全不是同一种工具。

Gemini Omni 是个多模态创作引擎。你给它喂图像、音频、视频和文本,它就能生成或编辑视频。最杀手锏的功能是“对话式编辑”——你跟它说,它就改视频,而且这些修改会层层叠加,还不会破坏场景的一致性。

Gemini 3.5 Flash 则是个干硬活的“智能体”。它专为复杂的多步骤任务而生——写代码、做调研、浏览器自动化,还有那种需要模型跨工具进行推理、规划和执行的长线工作流。

我做视觉内容时用 Omni;做开发、调研或自动化时用 3.5 Flash。它俩搭配起来出奇地好用。

上手 Gemini Omni

我先从 Omni 试起,因为那个视频剪辑的痛点还历历在目。你可以通过 Google AI Studio 或者使用 Interactions API 的 Gemini API 来访问它。

工作流很简单,但得稍微转个弯才能适应:你上传一个视频(或者用文本提示词从零开始),然后你就……直接跟它对话。

这是我第一次尝试的操作。我上传了那段背景杂乱的办公室录屏,输入:

把背景换成干净、现代的办公室,光线要暖一点。我和屏幕录制的内容保持原样。

大概处理了 90 秒,结果真让我惊呆了。背景被换成了一个整洁的办公环境,我脸上的光线也跟着新场景做了调整,而屏幕内容完好无损。虽然不是完美无瑕——我转头的时候,头发边缘会有轻微的抖动——但对于完全没碰关键帧的初剪来说,已经相当惊艳了。

它真正的威力在于迭代编辑。每条指令都建立在上一条的基础上,而且模型能记住上下文。换完背景后,我又加了一句:

现在加个微光图表,在 0:34 我点按钮的时候出现在光标旁边。

成了。一个柔和的动态标注准时弹了出来。动画的物理效果感觉很自然,而且角色的一致性——我的外貌、桌子、屏幕——在这两次编辑中都保持得很好。

我现在常用的 Omni 实用工作流

1. 社交内容的风格转换。 我拿原始素材让 Omni 重新渲染风格。“把这做成复古 8 毫米胶片质感”或者“只对背景应用水彩插画风格”。以前这得花我一个小时调色和加叠加层,现在一句话搞定。

2. 夸大特定动作。 我有个演示视频,里面我点了一下按钮,但在屏幕上几乎看不出来点击的动作。我输入提示词:“让 1:12 处的鼠标点击动作更夸张一点,加个明显的按压动画。” Omni 只放大了那个瞬间,其他地方完全没动。

3. 重构物体。 Google 发布会上的一个演示让我印象深刻:把雕塑变成泡泡。我也试了类似的操作——让 Omni 把我的马克杯变成一盆小绿植。模型处理了几何形状的改变、光影的交互,甚至还加上了植物叶片的微妙阴影。虽然我不会在正式汇报里用这个,但用来做创意原型和头脑风暴视觉概念,简直太棒了。

4. 调用外部背景知识。 Omni 能应用真实世界的知识。我上传了一段步行游览的视频,让它“在街面上加上 20 世纪 20 年代巴黎那种符合史实的招牌”。它不只是把字贴在墙上——它让招牌有了年代感,选了合适的字体,甚至还加了风化破损的痕迹。虽然不完美,但作为设计师去精修的起点,已经非常惊艳了。

上手 Gemini 3.5 Flash

Omni 搞定视觉工作,而 3.5 Flash 成了我处理任何需要多步骤、用工具或实际执行任务时的首选。

我通过 Google AI Studio 里的 Gemini API 来访问它。设置很简单:

import google.generativeai as genai

genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel("gemini-3.5-flash")

3.5 Flash 不同于早期模型的地方在于它的智能体能力。它可以在浏览器、移动端和桌面环境中观察、推理和采取行动。这不只是聊天——这是一个真能干活的模型。

3.5 Flash 带来的真实生产力提升

1. 多步骤调研与综合。 有个项目我需要对比三个竞品 API。以前我得手动去读每个文档,这次我直接让 3.5 Flash 去浏览每个 API 的文档,提取相关的端点,对比价格体系,最后输出一张结构化的对比表。它搞定了整个工作流——浏览页面、提取数据、权衡利弊、排版输出——只用了大概两分钟。

2. 结合上下文的代码生成。 我让 3.5 Flash 写个 Python 脚本,从我们内部 API 拉数据,转换格式后写入 Google Sheet。最让我惊艳的不是代码一次跑通——而是它先问了我几个澄清问题。“你们 API 的认证方式是什么?”“脚本需要处理分页吗?”“日期格式用哪种?”这种交互式的细化,省去了通常让代码生成变得很折磨人的来回扯皮。

3. 长线任务执行。 我给了它一个麻烦活:“过一遍这个 GitHub 仓库,找出所有 TODO 注释,根据周围代码的上下文按严重程度分类,然后在我们的项目追踪工具里给每个 TODO 建个 issue。”这需要读代码、懂上下文、做判断,还要跨工具操作。3.5 Flash 处理了大概 40 个 TODO,直到触发了追踪工具 API 的频率限制。但这还是帮我省了两个小时。

4. 重复性任务的浏览器自动化。 我得验证表格里 50 多个 URL 是不是还能访问,内容对不对。3.5 Flash 依次打开每个 URL,检查 HTTP 状态,扫描我指定的特定文本片段,最后标出了 3 个死链和 2 个内容过期的页面。原本能让人崩溃的一下午,现在十分钟搞定。

组合使用两个模型

当你把它们串联起来,真正的魔法就发生了。这是我最近开始用的工作流:

  1. 我用 3.5 Flash 调研一个主题,写脚本,生成视频的结构化大纲。
  2. 我录个粗版——直接对着镜头说,不加修饰。
  3. 我把录像喂给 Omni,用对话式编辑清理背景,根据脚本在特定时间点加上视觉叠加层,调整风格。

以前需要一整天的制作周期,现在大概一小时搞定。

实话实说的局限性

这两个模型都不完美,它们短板在哪得说清楚。

Omni 处理长视频时一致性会崩。 超过大概 60 秒的视频就开始出现偏移。人物面部可能会有轻微变形,复杂的场景编辑有时会在边缘产生瑕疵。我把 Omni 当作短视频内容和快速原型的工具,而不是用来做最终成片。

3.5 Flash 有时会过于自信。 它有时会带着错误的假设去执行多步骤工作流,而且你直到第 8 步才会发现。我已经学乖了,在让它自主跑重要任务前,一定会先审查它的计划。

API 费用积少成多。 用 Omni 生成视频可不便宜,尤其是迭代编辑。有天下午我瞎折腾,一下午就烧了大概 40 美元的 API 额度。做好预算规划吧。

延迟是客观存在的。 Omni 处理视频需要时间。哪怕简单的编辑也可能要 30 到 90 秒。这不是个实时工具。我会批量处理编辑——先把所有指令写好,然后让它处理,我同时去干别的。

这两个模型都不能替代专业技能。 Omni 生成的视频很惊艳,但熟练的剪辑师做出来的最终交付物还是更好。3.5 Flash 能写出能跑的代码,但需要人工审查。这些工具放大了你的能力——但它们没法替代你判断什么是“好”的眼光。

实用小贴士

  • 先在 AI Studio 里用 Omni,别急着上 API。可视化界面能让你更容易搞懂对话式编辑是怎么运作的。
  • 在 Omni 里剪视频时,时间戳要给得具体。 “把 0:15 到 0:45 的背景换掉”比“把中间的背景换掉”效果好得多。
  • 把 3.5 Flash 的复杂任务拆成几个阶段。 别写一个巨大的提示词,要跟模型互动——让它出计划,你确认,然后再执行。
  • Omni 的视频要尽量短。 15 到 30 秒的片段效果最好。如果需要更长的内容,用传统剪辑软件把它们拼起来。
  • 发挥 3.5 Flash 的工具使用能力。 别只让它写文本——把浏览器、API 和文件系统的权限给它。那才是智能体功能真正大放异彩的地方。

Gemini Omni 和 3.5 Flash 都已经成了我工具箱里的常驻选手。Omni 把视频剪辑从让我头疼的苦差事,变成了我真正愿意去捣鼓原型的环节。而 3.5 Flash 帮我搞定了那种以前能耗掉我整个下午的多步骤死板活儿。它们不是魔法,但确实好用——比起我今年试过的大多数工具,这评价可高多了。

相关 Agent

C

Claude

Anthropic开发的智能助手

了解更多 →