导语:八月份以来,视频模型真的卷到起飞,热度在海内外居高不下。从真实度、演员演技到运镜、多宫格参考还原,这批新一代模型各有各的强项。我烧了无数积分实测后认为:不差钱、对高品质和长叙事是刚需的,无脑选Seedance 2.5;需要控制成本和速度的,选Seedance 2.0 fast;看重本地部署的,开源H3是首选。
从八月份以来,视频模型真的卷到起飞,而且据我观察,热度在海内外各个平台都居高不下,主要还是新模型真的太强了,让人上瘾。我自己在酷酷烧了n多积分之后,觉得是时候来聊聊对现在视频模型的一些想法了。
先说Seedance 2.5,简单讲,这就是当下最牛逼的视频模型,没有之一。这个真实性大到整个叙事的节奏流畅度,小到人物的一颦一笑,都会让人看的时候不禁错愕,"这特么是AI?"。它非常像自己平时举个手机追着对象拍的那种感觉——画面中人物的表情、动作、甚至肤质都跟真实用手机拍摄的感觉一样。而且支持30秒直出之后,整个叙事的空间被大大加强,节奏不会像只能出15秒时让人觉得很紧凑、很多东西没讲完就被切掉,反而觉得自然很多。
还有一个case也能说明它在真实性上的巨大突破——整个就是AI演员演技大赏。特别是其中有一段明显的哽咽,把那种无奈、不舍、痛心、犹豫,离别时的万般情绪都演绎得淋漓尽致。再仔细看人物的肤质,包括脖子上的皮肤细节,比之前所有模型都要好,完全没有那种很假的塑料感。之前拿别的模型做短剧、视频,先抛开抽卡成功率的抽卡,从观赏性或者说美的角度来说根本没办法细品,会觉得人物肤质、表情怎么这么假;但Seedance 2.5带来的感受是,我终于可以慢慢细品它做出来的片子了,它好像真的懂审美、懂拍摄了。
为什么说它懂审美、懂拍摄了?拿我之前跑的一个case举例——虽然也被搬运了很多次,但大家可能没注意最厉害的地方。大部分人会惊叹真实性很牛逼,但它给我最大震撼的是视频中的第19秒和第20秒:有一个丝滑且明显的焦点切换,这种切换如果不是老法师根本感受不出来有多丝滑,甚至很多相机的自动对焦都做不到这么丝滑。所以,真实性的飞跃其实来自各个方面的小细节的把控。也可以说,这一代Seedance 2.5真的具备影视级水准。影视级既代表专业——写提示词时得更精准、考虑更全面,比如分镜是否合理、人物动作、拍摄角度、服饰等等,就像自己是真正导演一样;同时,影视级也代表成本的提升——稍稍一个细节没考虑到位,就要面临重新抽卡带来的成本提升。
那大部分朋友可能本身用不到这么专业级的东西,就好像拍照一样,相机是专业干活用的,手机也有手机的优势。所以我又给大家带来几款相对平价模型的横向对比,让大家知道在自己的使用场景里可以怎么选。我这里把Wan 3.0和Grok Imagine切换着用——也不知道是不是算力问题,Wan 3.0生成速度有时候会慢一些,等不到Wan就切到Grok上。
第一个case是我自己最爱看的打戏。提示词很简单,就两句话:让图1中的人物与图2来一场武林高手般的对决,参考经典武打动作戏,最后由指定一方获胜。这场对比里,Grok不知道为什么直接抽风了,根本没吃进去我给的人物参考图,基本可以忽略;H3生成里一眼能看到一个bug,就是人物躲闪时直接翻了一圈、肢体非常不协调;真正做到一眼看过去没bug、还完全遵循提示词"武林高手般的对决"的只有Seedance 2.0 fast,最后甚至把人打吐血了——看来Seedance武侠剧没少看。
第二个case也是我最爱测的演技大赏时刻,灵感来源于抖音上很火的"你开枪啊,我教过你怎么开枪的"。意外发现Grok的画面质感是最好的,但从演技上说,Seedance 2.0 fast表现最好,只有它刻画出了人物想要开枪扣动扳机的那个动作,H3和Grok都没有。H3在人物还原上也出现失真,注意看脖子细节,AI感很重。而把这个case放到Seedance 2.5里跑,那种纠结、发抖、紧张、伤心、不舍,全在短短30秒里展现全了——感受一下什么叫演技上的猎杀时刻。
第三个case换Wan 3.0上场,给模型一张4x4的多人舞蹈参考图,看它能不能根据16宫格参考图生成舞蹈。对比结果是:H3问题最严重,左侧女生的头发颜色都变了;Wan 3.0不愧是新模型,对多宫格参考图的还原做得非常不错;但Seedance 2.0 fast在镜头表现力、运镜上更出色,它真的理解这是一个女团MV场景,开头的运镜最还原。另外还做了一个边走路边换装的测试,适合电商场景——Seedance 2.0 fast表现最好,无论换装节奏还是对提示词的遵循都不错。提示词里我要求人物靠近镜头之后甩头发来切镜头换服装,H3做是做到了,但做得粗浅,没等完全靠近镜头就甩头切换,甩头姿势也不具美感;Wan 3.0则没很好遵循提示词,最后的文字没展现,我要求最后换回第一套服装也没有做到。
我还做了个皮克斯动画风格的case:Seedance 2.0 fast真不错,把追逐的紧张刺激感表现出来了,最后两个人物还有互动交流;H3开头有个bug,人物往反方向跑了;Grok主要是前半段欠缺紧张刺激感,其他中规中矩。最后一个是TVC广告测试:H3在人物跑步看表以及天台看表时,手臂位置都出bug了,出现肢体不协调;而Seedance 2.0 fast明显自然很多,而且生成速度是真的快,又快又好。
最后写点总结。如果你问我怎么选模型:不差钱,又对高品质、真实感、长叙事是刚需,那无脑选Seedance 2.5。如果要考虑成本、速度以及不错的质量,我会推荐Seedance 2.0 fast——我自己跑的这些case基本都是一把直出,稳定性和速度都非常不错,而且现在因为有了Seedance 2.5在前面,它的价格也在比较合理的范围,基本是8毛-9毛/秒的成本。如果你看重本地部署,我推荐H3,毕竟是开源模型。但开源模型并不是说就不要成本了,部署的GPU机器、维护等等都是需要考虑的成本。
AI发展到当下这个阶段,不管是通用模型还是视频生成领域,一味追求最好的模型可能不再是我们的目标了。相反,能根据自身需求找到最合适的模型,在质量与成本上达到一个理想的平衡,才是我们应该做的事情。
免责声明:本文内容整理自公开报道,AI 产品动态与进展以官方发布为准,仅供参考,不构成任何投资建议。
发表评论 取消回复