Runway Gen 4.5还是有点东西的。
当我第一眼看到那段视频——一个女人在夕阳下转头,头发随风动,光打在颧骨上——愣了大概三秒。
说实话,我以为是实拍素材。不是那种"哦还行,凑合能用",是那种"等等,这真的是 AI 生成的?"
让我们把Runway Gen4.5好好“把玩”一下。

Runway 自己做了个测试——1000 人,真实视频和 AI 视频混着看,同等分辨率、同等时长, 10 秒内判断真伪。
结果:57.1% 的人分不清楚。
你可以说这是 Runway 自己的数据,有利益驱动,打个折扣。打完折扣,也就是说,哪怕你保守估计,也有将近一半的人被骗了。
这个数字比什么技术参数都更直接。
它告诉你的不是"物理渲染精度提升了多少",而是:这东西,已经能过人眼这关了。
连 Runway 内部员工——天天盯着这些视频、天天调模型的人——也有人没分清。
这不是某种营销话术。这是一个信号,说明 AI 视频生成的技术拐点,可能就在这两个月里悄悄过去了。
我花了几天时间测试,重点对比了 Gen 4 和 Gen 4.5 ,顺便横向拿了 Kling 2.6 和 Google Veo 3.1 做对比。几个感受最深的地方:
物理感。这是变化最大的一块。以前生成的视频,总有种"飘"——头发漂得太轻,液体流得不对,人走路重心不稳。 Gen 4.5 这次把这个东西做对了很多。我测试了一段"咖啡杯被风吹倒、液体溢出"的场景,液体的流动轨迹、溅起来的弧线、桌面的浸湿渐变,差不多是我见过 AI 视频里处理得最自然的一次。
不是完美,但是到了"拍摄条件不好、实拍素材也就这样"的级别。
镜头控制。 Gen 4.5 对镜头语言的理解明显上了一台阶。你写"推镜+人物转头",它真的会在推进过程里做出焦距微变和景深渐浅的效果,不只是人往前走然后镜头跟着动。
Runway CEO 发了一个 2 分多钟的短片——多个场景切换,不同角色出现,叙事连贯。这在以前的 AI 视频里几乎是不可能做到的。你试试问 Sora 2 给你生成一段有完整故事的两分钟视频,看看角色一致性能撑多久。
细节不崩。这条说起来有点抽象,但做视频的人懂——AI 视频最容易崩在"运动中的细节"。人物快速移动时脸糊,手指在特写镜头里变形,衣服纹理在运动中乱跑。 Gen 4.5 在这方面做了专项加强。官方演示里有一段人物在章鱼背上飞行的画面,光是那个面部细节在高速运动中保持稳定这件事,就已经超出我的预期了。
角色一致性还是差了点。跟 Kling 2.6 比, Gen 4.5 在多镜头长序列里维持角色外观的能力还是弱一截。你生成一个人物,换个场景、换个角度,面部特征会有微妙漂移——不是崩坏,但仔细看得出来。
如果你做的是品牌代言、 IP 衍生这类对角色一致性要求高的内容,现在拿 Gen 4.5 做还需要大量手工挑选镜头,不能完全信任模型自己保持一致。
没有原生音频。 Veo 3.1 和 Sora 2 都已经可以原生生成音效和对话了——视频里的脚步声、环境音、人物说话的唇形同步。 Gen 4.5 这里是一个空白。你生成的视频是哑的,后期要自己配音配效果。
对很多人来说这是个大问题。你做了一段很不错的视频,加音频的时候发现音画难对齐,感觉就像做了一桌好菜结果没有餐具。
长视频依然要靠剪辑。 Gen 4.5 单次生成最长 10 秒,要做更长的内容必须分段生成再剪接。跨片段的一致性你需要自己把控——光线、角色、场景细节,每个片段都可能产生偏差,拼接的时候如果不仔细对,观众肯定看得出来。
对普通用户来说,这道门槛不低。
直接说结论,不绕弯子:
看特效、运动模拟、物理感 → Gen 4.5 目前最强。
看角色一致性、背景稳定 → Kling 2.6 更可靠,目前综合排行第一。
看对话场景、音画同步 → Veo 3.1 , Google 在这块下了功夫。
看整体视觉质量分档 → 最新的 Artificial Analysis 榜单( 2025 年 12 月数据), Gen 4.5 以 1247 Elo 分排名第一,超过了 Veo 3.1 和 Sora 2 。但这是综合分,具体细分场景各有差异。
说白了就是:没有一个模型是"全场景最优解",你得根据自己的需求选工具。 Gen 4.5 的优势是视觉质量上限高,特别适合对物理真实感要求高的内容;缺点是在需要长序列一致性和原生音频的场景里还差一口气。
聊完评测,说说实际怎么上手。
最快入手路径:图生视频
上传一张高质量的参考图(建议 1080p 以上,主体和背景分开清晰),然后写运动提示词——重点描述摄像机运动方向和主体动作,别堆形容词。
好提示词示例:Camera slowly pushes in on a woman turning her head, shallow depth of field, golden hour light
差提示词:美丽的女人在漂亮的光线下非常自然地转头
参数方面:宽高比 16:9 ,时长选 10 秒,运动强度设中等。
过高会导致变形,是我测出来的教训,直接选高的话你前三次生成大概都是废片。
进阶:分镜头策略
不要指望用一段提示词生成完整叙事。
正确的做法是:把场景拆成建立镜头(交代环境)+ 动作镜头(主体动作)+ 特写镜头(细节/情绪),分别生成,然后在剪辑软件里拼。这样每段控制在 5-10 秒,一致性最好把握,效果也最可控。
4K 升频
Gen 4.5 默认输出 720p ,付费计划( Pro 起)内置 4K 超分工具。我测了几段,升频后的效果比我预期好,没有出现太多边缘模糊或颜色失真的问题——当然,如果你原始生成的质量就不行,升频救不了根。
定价参考(官网价格,不含税):

AI 视频这条线,走到现在,已经超出"玩具"的范畴了。
Gen 4.5 之后,说 AI 视频还是看看就好、别指望实用,这种态度有点站不住脚了。
不是说它现在完美。它现在依然不完美,角色一致性、原生音频、长视频生产流程,都还有距离。
但那 57% 的数据放在那里,视觉质量这条线,已经过了"肉眼无法稳定分辨"的阈值。
接下来的问题不是"AI 能不能做视频",而是"用什么工作流做、做什么场景的内容、配合什么工具降成本"。
这才是值得认真研究的方向。
你用过 Gen 4.5 吗?测完最大的感受是什么,留言聊聊。