视频领域好久没这么热闹了。
7月最后一个工作日, 2.5和 H3 齐刷刷上线。


2.5
最开始的是, 经过一个多月预热时段的2.5, 最终要实现上线这一状况了, 其上线行为已经在既有的梦以及豆包专业版本里, 达成了全面覆盖的情形。
(我在即梦网页端已经看到了,记得先登录)

API服务尚未正式上线, 也未曾有公开可调用的模型ID, 预计一周之后开放。
然模型价格信息已更新至火山方舟平台, 相较于上代SD2.0, 2.5的API价格上涨幅度达五成。

在涨价之际把分辨率上限进行了削减, 此模型的算力成本明显高很多。2.5当下API最高仅支持720P, 并且不支持4K视频。
2.5升级了什么?
在架构方面, 2.5持续沿着上一代那种统一的多模态音视频联合生成路径前行, 着重在于对长叙事方面进行突破性进展, 对多模态参考予以重点突破, 对编辑能力达成重点突破。
第一,30秒长叙事
视频单次生成的时长, 从原本15秒直接提升到30秒, 并且它还支持多轮延长续写, 在续写过程中, 人物、场景、风格以及声音都要保持一致。
从后台开始, 一位歌手一镜到底登台参与演出, 全程处于没有剪切的状态, 在30里面, 模型能够组织出来好多有着逻辑关联的镜头, 按照「铺垫—推进—转折—善后」去完成一段完整的叙事。官方演示里是这样呈现的。
以下是改写后的内容: 手持稳定器进行跟拍, 呈现一镜到底的效果, 镜头先是从红色厚重幕布的缝隙那里, 缓缓地推进, 进而进入到有着暖色的后台化妆间区域, 年轻的女歌手背对着镜头在整理耳机, 这时有工作人员提醒她要准备登台了, 她转过头来望向镜头, 接着就开始唱起了City Pop, 镜头向后退进行跟拍, 歌手穿过幕布进入到后台通道, 还与舞伴很自然地互动着, 有一位工作人员把麦克风递给了她, 随后歌手和舞伴登上舞台, 镜头绕至背面, 红黑舞美、LED屏、追光、烟雾以及反光地板逐渐展现出来。最后的镜头, 朝着远处拉伸, 一直到啦体育馆的全景, 满满都是观众, 还有灯牌以及荧光棒, 伴随着欢呼声, 一起营造出了那种年轻又自由的演唱会高潮氛围。
第二,多模态参考&精准编辑
当下, 单次能够输入的图片数量上限是30张, 视频数量上限是10段, 音频数量上限也是10段, 并且它还支持精确的时间戳控制以及定向编辑。
改哪一秒、改哪个人,可以指哪打哪。
编辑视频 1, 保持人物不变、动作也不变、风格也不变, 只调整运镜, 这是 R2V 的要求。15 秒分段运镜设计如下: 0 到 4 秒, 微型 FPV 贴着锅穿行, 跟着弹起的吐司然后横甩到咖啡那里;4 到 7 秒, 推近并且沿着锅边横向移动, 跟着煎蛋翻再落回;7 到 11 秒, 快速升到顶视角, 匀速向下压扫过餐盘和钥匙;11 到 15 秒, 手持近镜跟着双手快速横甩, 最后推近早餐, 再拉回双人中景。全程连贯稳定。
第三,连贯性和质感
模型对镜头衔接予以了优化, 对场景过渡也进行了优化, 画质得到了提升, 音质获得了提升, 运动质量获得了提升, 并且有效地弱化了视频生成过程中常见的那种“油腻感”。
能够生产出那种, 时长为数分钟的, 视听语言保持统一的, 高质量、连贯的内容, 也就是精彩故事, 并一次进行呈现的是用户。
能看官方这个时长为 3 分钟的视频, 当时真当作迪士尼新出作品了。大家都可以这么做。
H3
昨天更早一些, 也发布了最新的视频生成模型 H3。
一款通用全模态生成模型,对标 2.0。
专注于具备针对文本、图片、视频以及音频的统一理解本领, 最高可达2K分辨率, 单次生成的用时是4至15秒。
普通用户目前可以直接在海螺AI网页端和App里使用了。

而且H3已经开放API,国内外同步上线。
价格是最大优势:
以每秒十元标价的时长单位相比较, 一条15秒的2K视频, 其API给出的标价是美元一点九五, 与之相较,名为H3的产品, 它每秒的使用费用仅需0.8元。

除了价格优势,我们接下来说说产品亮点!
第一,最多 12 个素材共同控制一条视频
H3, 一次请求, 顶多能够输入, 9 张图片, 还有 3 段视频, 以及 3 段音频。
从事电影作品创作之际, 并非要把角色, 以及人物, 还有动作, 连同运镜与声音, 统统都塞入提示词里。
能够把有关人物的图进行锁定, 借助视频去确定动作方面的节奏, 接着运用音频给出配乐或者声音的参考。
不用靠猜文字就能轻松生成电影级别的视频。
一处场景是, 有名中年男人站立于开阔沙漠的土路正中央, 他手持手枪指向那个拍摄他的人, 他发出了指令, 对方喊出了他的名字, 他警诫对方不许再重复说一遍, 然而枪声并没有响起来。
第二, 文字、品牌元素和动作迁移更适合商业内容
AI视频制作持续保持着热度, 然而, 当AI涉足商业制作领域之后, 倘若包装、Logo、文字、人物在运动过程中出现变形的状况, 样片便很难直接投入使用。
此次H3, 特别强化了文字以及品牌元素的渲染, 达成了动态文字漂移, 达成了商品包装变化, 达成了品牌元素跨帧且不失真。
H3 还支持视频到视频的动作迁移。
比如舞蹈, 那种动作, 游戏角色所展现的动作, 还有复杂运镜, 这些都能够直接去借用已经存在的动作, 如此一来, 就省去了放在提示词里面去进行描述的那种麻烦。
WorkBuddy侧边栏里能改的真 Office:它给的不是
AI虽能生成漂亮文本,但输出格式需手动调整,难以直接使用。多...(120 )人阅读时间:2026-08-03
国产AI视频模型又卷起来了:Seedance 2.5和Min
Seedance 2.5和MiniMax H3于7月底上线,...(157 )人阅读时间:2026-08-03
贝索斯用AI寻找下一块硅
亚马逊创始人贝索斯投资AI材料公司CuspAI,助力人类寻找...(181 )人阅读时间:2026-08-03
AI时代,效率正在消灭学徒期
AI接管初级工作看似高效,实则削弱了人才培养机制。初级工作虽...(67 )人阅读时间:2026-08-03