国产AI视频模型又卷起来了:Seedance 2.5和MiniMax H3谁更值得用
国产AI视频模型又卷起来了:Seedance 2.5和MiniMax H3谁更值得用

国产AI视频模型又卷起来了:Seedance 2.5和MiniMax H3谁更值得用

阅读预计 4 分钟

视频领域好久没这么热闹了。

7月最后一个工作日,Seedance 2.5和MiniMax H3 齐刷刷上线。

Seedance 2.5

首先是,预热了一个多月的Seedance 2.5终于要上线了,已经在即梦和豆包专业版里全量。

(我在即梦网页端已经看到了,记得先登录)

API 服务还没有正式上线,也没有公开可调用的模型ID,预计一周后开放。

但是模型价格信息已经更新到火山方舟平台了,相比上代SD2.0,Seedance 2.5的 API 价格涨了五成。

涨价的同时砍了分辨率上限,这个模型的算力成本显然高得多。2.5目前 API 最高只支持720P,还不支持4K视频。

2.5升级了什么?

架构上,Seedance 2.5延续上代统一的多模态音视频联合生成路线,重点突破长叙事、多模态参考、编辑能力。

第一,30秒长叙事

单次生成的视频时长从15秒直接拉到30秒,且支持多轮延长,续写时人物、场景、风格、声音保持一致。

30秒内,模型可以组织多个有逻辑关联的镜头,按「铺垫—推进—转折—收尾」完成一段完整叙事。官方演示中,一位歌手从后台一镜到底登台演出,全程无剪切。

T2V prompt:一镜到底手持稳定器跟拍,镜头从红色厚重幕布缝隙缓缓推进,进入暖色后台化妆间。年轻女歌手背对镜头整理耳机,工作人员提醒她准备登台。她回头看向镜头,开始唱起 City Pop。镜头后退跟拍,歌手穿过幕布进后台通道,与舞伴自然互动,一位工作人员把麦克风递给她。随后歌手与舞伴登上舞台,镜头绕至背面,红黑舞美、LED 屏、追光、烟雾与反光地板逐渐展开。镜头最终拉远至体育馆全景,呈现满场观众、灯牌、荧光棒与欢呼声,营造年轻自由的演唱会高潮氛围。

第二,多模态参考&精准编辑

现在,单次最多可输入30张图片+10段视频+10段音频,且支持精准时间戳控制和定向编辑。

改哪一秒、改哪个人,可以指哪打哪。

R2V prompt:编辑 @视频 1,保持人物、动作及画风不变,仅调整运镜。15 秒分段运镜设计:0–4 秒,微型 FPV 贴锅穿行,跟随弹起的吐司后横甩至咖啡;4–7 秒,推近并沿锅边横移,跟随煎蛋翻起落回;7–11 秒,急速升至顶视角,匀速下压扫过餐盘和钥匙;11–15 秒,手持近镜跟随双手快速横甩,最后推近早餐,再拉回双人中景。全程连贯稳定。

第三,连贯性和质感

模型优化了镜头衔接和场景过渡,画质、音质、运动质量都有提升,并有效弱化了视频生成中常见的「油腻感」。

用户可以生产数分钟、视听语言统一的高质量连贯内容——精彩故事,一次呈现。

大家可以官方这个长达3分钟的视频,一时真以为迪士尼新作。

MiniMax H3

昨天更早一些,MiniMax 也发布了最新的视频生成模型 H3。

一款通用全模态生成模型,对标Seedance 2.0。

主打拥有对文本、图片、视频、音频的统一理解能力,最高 2K 分辨率,单次生成时长为4~15秒。

普通用户目前可以直接在海螺AI网页端和App里使用了。

而且H3已经开放API,国内外同步上线。

价格是最大优势:

  • 2K:0.8元/秒
  • 768P:0.5元/秒

一条 15 秒 2K 视频的 API 标价为 1.95 美元。相比10元/秒的Seedance,H3只需要0.8元/秒。

除了价格优势,我们接下来说说产品亮点!

第一,最多 12 个素材共同控制一条视频

H3 一次请求最多可以输入 9 张图片、3 段视频、3 段音频。

在做电影作品时,角色、人物、动作、运镜和声音不用全部塞进提示词。

可以把人物图锁定,用视频确定动作节奏,再用音频给出配乐或声音参考。

不用靠猜文字就能轻松生成电影级别的视频。

场景:一名中年男子站在开阔沙漠的土路中央,用手枪指着拍摄他的人。他发出指令,对方叫出了他的名字,他警告对方不要再说一遍。但枪声并未响起。

第二, 文字、品牌元素和动作迁移更适合商业内容

AI视频制作一直很火,可是一旦AI进入商业制作后,包装、Logo、文字和人物只要在运动中变形,样片就很难直接用。

这次H3 专门加强了文字与品牌元素的渲染,实现了动态文字漂移、商品包装变化和品牌元素跨帧不失真。

H3 还支持视频到视频的动作迁移。

像舞蹈、游戏角色动作和复杂运镜可以直接借用现成的动作,省去了在提示词里描述的麻烦。

来自官方case演示:

Artificial Analysis的视频竞技场中,视频编辑榜单,H3暂列第1。

虽然第一名和第二名只差9分,几乎没有实质差距,但也侧面证明视频编辑是当前H3最突出的优势。

(与H3同场比较的还是Seedance 2.0,不是最新的2.5)

这个能力尤其适合广告、电商、短剧,加上绝对的价格优势,在商业场景批量可控生产镜头,H3很有竞争力,是当前最值得关注的生产型、编辑型的模型。

而且,MiniMax官方宣布即将对H3开源,开放模型权重。

只看官方规格,Seedance 2.5 和 MiniMax H3 侧重各有不同。

在广告、动作迁移、已有视频修改、角色替换等任务上,H3会更突出,在长镜头叙事、海量素材控制上,Seedance 2.5更出色。