Omni官方使用说明 & 4个有趣玩法
重庆/UI设计师/45天前/2244浏览
版权
Omni官方使用说明 & 4个有趣玩法
因文件大小限制无法上传完整视频,需要的小伙伴可以去小红书搜索:AI设计师lena
Gemini Omni 是近期最值得关注的视频模型之一。这期整理官方使用文档和5个它擅长的案例,附上提示词,带你解锁那些真正值得玩的用法。
注意:部分功能可能因地区或套餐不同暂时无法使用。
一、官方使用说明
https://deepmind.google/models/gemini-omni/prompt-guide/
镜头构图与运动
你的场景应该给人什么感觉?是真实感,还是电影感?是贴近现实,还是宏大壮观?告诉 Gemini Omni 你想创造的效果,然后让模型自己去补全细节。
风格
灯光
地点
图中示例提示词:
一个广角跟踪镜头轻柔地掠过宁静的湖面,展现出一个巨大的、具有反射效果的、类似铬金属质感的豆形物体,正毫不费力地悬浮在空中。它缓慢旋转,映照出雄伟悬崖的扭曲倒影;湖面下方清澈的蔚蓝水中,还半浸着一个较小但相似的物体。明亮的太阳从这个漂浮异物的后方升起,用清澈而空灵的日光笼罩整个场景,并呈现出鲜明的蓝绿色调,营造出电影感十足、令人敬畏的氛围。宏大而异世界感的管弦乐配乐进一步强化了这片外星景观的辽阔与神秘,同时悬浮物体还发出若有若无的低沉嗡鸣声。
风格
你的场景应该给人什么感觉?是真实感,还是电影感?是贴近现实,还是宏大壮观?告诉 Gemini Omni 你想创造的效果,然后让模型自己去补全细节。
图中示例提示词里,对应“风格”的部分是:
营造出电影感十足、令人敬畏的氛围,并由宏大、异世界感的管弦乐配乐烘托,进一步强调这片外星景观的辽阔与神秘。
灯光
你的场景应该如何被照亮?光源来自哪里?是太阳、路灯,还是画面外的光源?这种光会制造什么效果?灯光是清晰锐利的、温暖的,还是空灵梦幻的?
图中示例提示词中,对应“灯光”的部分是:
明亮的太阳从这个漂浮异物的后方升起,用清澈而空灵的日光笼罩整个场景,并呈现出鲜明的蓝色与绿色调。
地点
你的场景发生在哪里?告诉 Gemini Omni 你想象中的环境,比如“一个有着清澈蔚蓝水面的外星景观”。但你不需要描述每一个微小细节,因为 Omni 会根据你的整体意图去补全画面。
图中示例提示词里,对应“地点”的部分是:
宁静的湖面、雄伟的悬崖、清澈的蔚蓝水面,以及带有神秘感的外星景观。
动作
你的场景里正在发生什么?有哪些角色和物体?它们是如何移动和互动的?
图中示例提示词里,对应“动作”的部分是:
一个巨大的、具有反射效果的、类似铬金属质感的豆形物体,正毫不费力地悬浮在空中,并缓慢旋转;湖水下方还有一个较小但相似的物体半浸在清澈的蓝色水中。
更直白地说,
动作不是只写“有人在跑”“物体在动”
,而是要写清楚:
这个东西在做什么、怎么动、和周围环境有什么关系。比如这里就是:
金属豆形物体悬浮、缓慢旋转、反射悬崖,另一个类似物体半沉在湖里。
通过自然对话进行编辑
把 Gemini Omni 想象成视频版的 Nano Banana——你可以在创作过程中的任何一步,用自然语言继续构建和微调你的作品。
迭代式编辑
向 Gemini Omni 提出一个具体修改,比如更换背景,或者添加新的字幕,而不需要重新写一整段完整的场景提示词。
Omni 会在多轮修改中保留你的视频内容:保留有效的部分,同时让你专注修改不满意的地方。
下方三个示例:
输入视频
提示词:把蝴蝶改成蜜蜂。
提示词:把蜜蜂改成一小群萤火虫。
编辑你的镜头运作方式
通过自然对话,改变镜头角度、视角和镜头运动方式。
左侧:
输入视频
右侧提示词:
把镜头角度改成从小提琴手肩膀后方拍摄。
也就是:不需要重新生成整个视频,只要告诉 Omni 你想改镜头,比如“改成过肩视角”“换成俯拍”“镜头慢慢推近”“镜头绕着人物旋转”,它会尽量保留原视频内容,只调整摄影机的观看方式。
改变动作
让 Gemini Omni 改变场景里的运动和动画方式。
你也可以让它同步两个不同输入,比如让一栋建筑的灯光,随着音乐节拍亮起。
左侧:
输入视频
右侧提示词:
公寓里的灯光开始随着音乐节奏依次亮起。
也就是说,这一部分讲的是:
你不只是能改画面里的物体,还能改“它们怎么动”。比如灯光怎么闪、人物怎么走、物体怎么飘、动作是否跟音乐同步。
应用真实世界知识
利用 Gemini Omni 对历史、科学和文化的理解,生成看起来真实、感受也真实的结果。你不需要过度解释,只需要提出你的需求。
世界理解能力
使用 Veo 时,你需要给出非常精确的指令,才能得到最好的结果。
但使用 Gemini Omni 时,你不必把提示词写得那么死。你只需要告诉 Omni 你想创作什么,然后让模型的推理能力和世界知识,把细节自然补全出来。
底部提示词示例:
提示词:解释普通计算和量子计算之间的区别……
文字渲染
选择你的文字类型、位置、动画方式和曝光效果。
Gemini Omni 不只是能更准确地渲染文字,还能让文字和画面内容同步出现。
底部提示词示例:
提示词:逐词显示,每次屏幕上只出现一个词:did, you, know, that, this, model, can, do, pretty, good, text!? 每个词都用不同的动画风格出现,并且节奏完美贴合音乐,像一支高能混剪短片。
说人话就是:
它不仅能把文字做清楚,还能控制文字怎么进场、放在哪里、怎么动、跟音乐节奏怎么配合。
引用复杂动作
当你引用一个复杂动作时,Gemini Omni 能理解你的意图,也能理解这个动作应该如何应用到整个视频中。你不需要逐帧描述每一个细节。
底部提示词示例:
提示词:在保持其他内容不变的情况下编辑这个视频。添加从滑板后方冒出来的动画运动特效。
说人话就是:
你不用把“第几帧出现烟雾、第几帧变成彩色轨迹、第几帧跟随滑板移动”全部写清楚。你只要说“从滑板后面加动画运动特效”,Omni 会自己理解这是一个连续动作,并把特效跟滑板运动绑定起来。
指挥你的镜头
让 Gemini Omni 按照具体的摄影指导来拍摄。 如果你想要一个连续镜头,可以直接写:
“一个连续镜头”
或
“一镜到底”
。 也可以尝试指定具体机位,比如:
“静态镜头”
、
“锁定机位”
、
“固定镜头”
。
你还可以尝试不同的镜头运动,比如:
“向前推进”
、
“快速推近”
、
“滑动变焦 / 希区柯克变焦”
。 如果你想要某种特定的摄影设备质感,也可以直接说,比如:
“自然的手机变焦”
、
“电影摄影机质感”
、
“网络摄像头风格”
。
左侧:
输入视频
右侧提示词:
改变镜头角度,先特写他的鞋子,然后快速上摇到中景,最后再拉宽画面。
说人话就是:
这一页讲的是,你可以像导演一样指挥镜头。不只是说“拍一个男孩”,而是告诉它:镜头从哪里开始、怎么移动、是固定拍还是推近、是手机感还是电影感。这样生成的视频会更像“被拍出来的”,而不是简单的 AI 画面在动。
Reference anything
Reference and combine more ingredients to maintain control and consistency over your scene
引用任何素材
引用并组合更多素材元素,来保持对场景的控制力和一致性。
组合任何输入
你可以引用任何类型的媒体素材,把多个元素组合在一起,创建你的场景。 这些素材可以包括:
图片、视频、文字和音频
。
左侧素材包括:
输入视频
输入图片
输入音频
提示词
说人话就是:
Omni 不只是吃一段文字提示词。你可以把视频、图片、音乐、文字一起丢给它,让它综合理解:视频给动作,图片给主体或风格,音频给节奏,文字告诉它最终要怎么组合。
应用新的风格
想在保留原始动作和细节的同时,重新想象一个场景的视觉效果吗? 你可以让 Gemini Omni 给视频套用一种新的风格,比如:
动漫风、黏土动画风、水彩风
。
左侧:
输入视频
右侧提示词:
根据参考视频创建一个四阶段的风格变化序列。第一阶段从鲜艳的彩色蜡笔美学开始,画面具有浓郁的蜡质笔触、粗糙纹理,以及俏皮的手绘角色设计,背景是颗粒感很强的纸张质感。随后自然过渡到带纹理纸张上的石墨铅笔素描风格,使用交叉排线、不同粗细的线条,以及 12fps 的“线条抖动”效果,强调手绘感。接着变形成超写实的 3D 半透明玻璃风格,具有复杂的光线折射、焦散光纹,以及极简影棚环境中的柔和内部发光效果。最后以触感强烈的 Risograph 孔版印刷风格收尾,使用有限的三色配色、颗粒状半色调纹理,以及故意错位的套印效果,营造复古、机械印刷感。
说人话就是: 这页讲的是,
Omni 可以保留原视频里的动作和结构,只替换视觉风格
。比如宇航员还是原来的动作,但画面可以从蜡笔画变成铅笔稿,再变成玻璃 3D,最后变成复古印刷海报。
二、有趣玩法
1-1 视频编辑功能
Omni能改的东西非常多,比如:
背景、天气、文字、剧情、材质、物体、风格、构图、视角……几乎你能想到的视频元素,它都可以通过自然语言去修改。
而且它不只是“笼统地改”,还可以更精准地控制视频变化:比如第几秒开始换天气、第几秒加入字幕、第几秒替换物体、第几秒切换风格。
1-2 运动轨迹 & 多语言
这个无人机沿着指定轨迹飞城市的案例最近很火。有意思的是,我的标注其实挺随意的,就是第一次的尝试,但 Omni 还是能看懂我要什么,并遵循了这个飞行路线。这个理解能力,确实有点东西。提示词就写的按标注飞行,最后去掉线条。
这个多语言案例其实有点难度。
首先,我特意选了一张不太“规整”的图:人物错落排列,比例不统一,站位也没有明显规律,运动轨迹本身不算简单。
其次,还要求 Omni 根据服饰自行判断国籍,再用对应国家的母语说“你好”。这一步就不只是画面生成了,而是涉及识别、推理和通识理解。
第三,右二原本设定的是巴西风格,但原图是用 GPT Image2 生成的,巴西服饰特征画得不够明显,导致 Omni 有几次把她识别成了泰国人。而一旦它判断成泰国人,生成的视频里会进一步强化泰国特征,人物和原图已经出现了明显差异。
所以这个案例有意思的地方不只是“多语言”,而是它暴露出 Omni 的一套工作逻辑:它会先理解人物身份,再根据自己的判断补全文化特征。判断对了,效果就还好,但是判断错了,它会把错误继续强化。
生视频的提示词和运动轨迹我也调整过一次,像这种需要理解和推断的任务,Gemini 直出的效果比 Flow 要好,但这还不能下绝对结论,可能也有偶然因素,需要更多案例验证。
1-3 科普视频
很简单的提示词,做一XX的科普视频或者做一个解释XX的视频。
值得注意的是,后面2条是在同一条视频的编辑里生成的,海啸这条是接在世界杯后面生成的,所以风格自动和上一条保持一致,连解说员都没有变。如果你需要在统一视觉风格下批量生成系列解说视频,这个方法值得试试。
好啦,本期内容到这里结束拉,谢谢观看,下期再见
84
举报
声明
34
分享
相关推荐
评论你的想法~
表情
喜欢TA的作品吗?喜欢就快来夸夸TA吧!
你可能喜欢
相关收藏夹
登录注册
84登录即可同步推荐记录哦
34登录即可加入我的收藏
评论登录即可评论想法
分享分享













































































































