Echo's blog
Echo's blog
· 1 min read · 资讯

AI视频全面成熟:Seedance 2.0领衔,6大工具深度横评

两年前,AI 生成的视频还是那种几秒钟的模糊片段——一个”不存在的女人”在诡异的灯光下走来走去,手指数量永远对不上。到了今年,字节跳动的 Seedance 2.0 已经能生成几分钟的长视频,画面连贯、叙事完整、物理世界的还原度好到让人分不清是实拍还是生成。

36 氪花了两个星期,实测了国内外几十款 AI 视频生成工具,最后筛出六款主流选手,做了一份横评。结论很直接:Seedance 2.0 是当前最好的 AI 视频模型,没有之一。

从’能用’到’导演思维’#

插图

Seedance 2.0 最大的突破,不是像素更多了或者帧率更高了,而是它开始有”导演思维”了。

之前的 AI 视频工具,本质上是在”拼图”——你给一段描述,它在数据库里找最接近的画面元素拼起来。帧与帧之间的因果关系是缺失的,所以经常出现”上一秒人在走路,下一秒人的腿没了”这种诡异画面。

Seedance 2.0 支持图、文、音、视四维输入。你可以传一段视频作为参考,再传一张照片作为角色,配上一段描述文字,它能把这些全部融合起来,生成一段逻辑连贯的画面。分镜切换也是自动完成的——需要特写的时候推近,需要交代环境的时候拉远,需要节奏感的时候快切。

这已经不是”工具”了,这是一个坐在你电脑里的导演。

主体迁移:争议最大的功能#

插图

Seedance 2.0 有个功能引起了不小的风波——主体迁移。简单说,你可以把自己的照片”迁移”到另一个视频里的角色身上,角色怎么做动作、怎么做表情,你都跟着做。

你不用穿动捕服,不用站在绿幕前。一张照片,一段参考视频,完事。

团队拿《爱乐之城》的舞蹈片段做测试,让用户的照骗替换掉原片主角的脸。动作的还原度、背景的一致性都高得离谱。但这也正是它引发争议的地方——这种精度一旦被滥用,深度伪造的门槛降到了零。

字节跳动显然知道这个问题。高精度的真人主体迁移有严格的身份验证限制,豆包等大流量入口也只能上阉割版。

国产工具的差异化路线#

插图

Seedance 2.0 占据顶端,但其他国产工具也在自己的赛道上跑出了节奏。

快手的可灵 3.0 没走”全功能通吃”的路线,而是在复杂肢体动作和物理互动上做到了极致。经典的”史密斯吃面”测试——考验 AI 对筷子夹面、面条下垂、咀嚼动作的理解——可灵 3.0 接近满分。它也是最懂中文用户需求的那个,对中文生活化场景的理解远超国外竞品。

阿里云的通义万相走的是完全不同的路。它不跟 Seedance 比画面质量,而是主打”开源可私有化部署”。企业对数据安全有要求?模型直接部署到你自己的服务器上,所有素材不上云端。这对于广告公司、影视制作公司这种对数据保密度极高的场景来说,吸引力巨大。

AI 视频面临的新问题#

插图

一个不太被提及但很重要的问题:算力消耗。Seedance 2.0 的效果这么好,代价是极其恐怖的算力需求。字节跳动自己都不得不在豆包等大流量入口上阉割功能——不是不想给你用,是真的撑不住。

另一个问题是审查。高质量的视频生成意味着高质量的内容风险。国内的合规要求非常严格,任何涉及到真人肖像的生成功能都绑着一整套繁琐的实名验证流程。

但无论如何,AI 视频已经完成了从”玩具”到”工具”的跨越。2024 年你在手机上看到的那些”变脸”短视频还是图一乐,2026 年你看到的很多广告片、预告片、短视频内容,背后可能已经是一段 prompt 了。

来源:36 氪 | Hacker News

Related Posts

Comments

Copied
Copied to clipboard