三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

徐工、小鹏、穹彻智能,为什么都选择Seedance 2.5?

时间:2026-08-01人气: 作者: 佚名

Force在今年6月的火山引擎原动力大会之上, 视频生成模型2.5首次进行亮相。预告功能充分勾起了用户的好奇心, 各个AI视频平台均打出了“2.5即将进行接入”的预告。

在7月31日的时候, 2.5正式被发布出来, 当下已经在字节旗下的诸如豆包、即梦、扣子、小云雀等产品上线了, 并且会在最近的时间段, 经由火山引擎朝着企业用户开放。

相较年初发布的 2.0, 2.5在四大核心能力上实现突破:

单次生成视频的时长被提升到了30秒, 并且提供了高保真时序延长的能力, 能在更长的时长之内维持人物、场景与镜头的一致性;能够支持最多有50个多模态参考素材, 同时还新增了白模、绿幕参考的能力, 使得复杂项目与工业化创作变得更加可控;增添了视频局部编辑的权利, 支持在保持整体画面节奏的情况下, 针对背景、商品、人物之类的局部元素开展精准化修改;而同时原生支持10余种不同的语言, 并且强化了复杂指令调控, 是能够适配多语言、多版本的工业化生产需求的。

2.5 所具备的这一特质, 进一步强化了对真实世界进行理解以及加以呈现的能力, 而正是这样一个尤为显著的特性, 使得它将原有服务场景的边界予以了拓展。

内容创作方向方面, 视频生成开始从片段级输出阶段, 朝着更为完整的创作流程转变。该转变中, 视频生成已然从仅仅可以生成, 进而是跨越到能够再修改、能重复产生新东西以及可供传达运送等需求的另一全新阶段且这东西还可用。

另一方面, 2.5正在加速往智能驾驶领域渗透, 它也在加速往具身智能领域渗透,它还在加速往实体制造领域渗透, 它同样在加速往教育领域渗透, 它也在加速往电商出海等领域渗透, 这是通过与真实世界的持续交互达成的。

2.该模型开放当日, 徐工集团与小鹏汽车、灵初智能、微分智飞、穹彻智能等多家企业被证实达成合作, 会率先引入此模型能力。当下, 这些达成合作的企业针对系列模型开展了场景落地探索。

30秒直出,已摸到商用TVC的门槛

2.5上线的第一时间,我们就上手进行了评测。

为2.5设置了这两道题目, 一道是生成一条时长为30秒的品牌TVC, 另一道则是针对这条TVC进行美国市场本地化的处理举措。为此虚构了一个高端手机品牌名为“星辰X1”, 之后还为其准备了14张参考素材, 包括7个角度的产品图片, 3份人物肖像图形, 3种场景设定画面, 以及1个Logo标志。

它是一条分镜脚本, 精确到了秒: 开场是从0到6秒, 手机会悬浮起来进行旋转, 屏幕随之点亮, 然后围绕着推进;接下来在6到12秒, 是夜景拍摄, 围绕来跟焦手机屏幕;再接着12到18秒是日出拍摄, 采取逆光且为剪影效果;等到18到24秒是进行成片展示的, 有着照片漂浮并展开的画面;最后24到30秒是结尾部分, 产品会进行旋转, 然后入画。镜头的运动方式、光影的具体来源、过渡的效果全部被写入其中了。

从最终成片效果来看, 2.5整体水平已接近商用产品片水准。

于镜头语言方面, 开场的产品光效, 屏幕内的转场, 照片从显示器飞出的那种运镜, 其衔接流畅且富有想象力, 这绝非单纯的场景切换, 而是已然具备了一些镜头设计的意识。然而, 也存在小问题, 在全片转场均采用淡入淡出的情形下, 有两处切换略显僵硬。鉴于30秒内要达成4个场景的叙事推进, 两处硬切对整体观感所造成的干扰实则颇为有限。

光影属于全片最为突出之处, 对于产品进行扫光时符合物理反射方面的规律, 处于逆光剪影状态下曝光过程自然不存在跳变情况。在夜景场景里, 霓虹灯光于手机背面玻璃之上的反射效果, 以及车流光轨在屏幕当中的呈现情况, 皆是可以经受住逐帧精细化观看的。

人物动作的静态持机表现自然可信, 发丝飘动也很自然, 但是手持运镜由于匀速显得稍微机械化了些。触屏滑动时, 指尖没有完全触碰屏幕, 动态手部仍有 AI 痕迹。当然, 手指与手机屏幕间的毫米级交互, 本就是视频生成领域公认的技术难点, 能处理到这个程度已经算是向前迈进了一大步。

接下来, 是二点五新增的视频局部编辑能力, 让其把视频里的中国元素给替换掉, 对这条视频做美国本土化处理。

给出的具体编辑指令清晰明了, 其中指示手机外观、镜头运动轨迹、场景变换的时间节点、光影呈现效果以及整体时长, 这些方面全部要保持100%不发生改变。并且人物将替换成章显于外且头发泛金黄属性的欧美摄影师身份, 场景会置换为纽约曼哈顿区域的夜晚景观、历经岁月沧桑变迁的大峡谷以及沾染浓厚工业风格的Loft空间, 同时要将其内容转变为英文形式。

技术执行几乎是一帧一帧地和原版完成对齐, 其结构、运镜以及转场时机跟原版的重叠程度非常高。在人物替换之后, 三个场景里面部的一致性表现良好, 动作节奏同快门时机相匹配, 不存在崩坏的情况。

场景的替换显著地融入了美国元素, 比如说张家界云海日出被置换成了科罗拉多大峡谷日落, 而且光影层次甚至于比原版还要更优;办公室场景被换成了有着红砖墙的布鲁克林 Loft, 且对应着美国本土的风格;英文的字体、位次以及淡入时机和原版保持一致, 品牌星标以及“星辰”中文小字也被保留下来了。

有一种细节是值得去提及的, 在6秒至11秒时长的夜景部分中, 天际线一直呈现的是上海外滩的模样。人物、日出以及工作室都被精准地替换成为了美国的版本, 然而唯有城市夜景尚未触发替换编辑操作。这恰恰能够表明局部编辑工作所面临的核心挑战不是替换自身的能力强弱, 在于对编辑范围该如何进行识别, 当中的模型需要更加清晰明确地去理解“什么样的事物是属于应当被去替换的范畴”。一旦这种用于范围进行控制的能力发展成熟起来, 那么局部编辑所具备的实用性将会在原有基础上拔高到一个新的层次之中。

从内容走向生产

经过两次测试, 得出的结果较为明晰, 此次2.5所实现的全新跨越, 已然从“能够运行成功”步入了“可以进行交付”的探讨范畴。

虽然, 2.5并非是那种能够完全直接输出的工具, 在细节方面仍旧存有必须在后期进行修补的情形, 然而, 它已然跨越了那条最为关键的分界线哟: 从“可行”迈向“可用”。对于任何一个属于行业范畴的工具来讲, 从0到1这个过程, 向来远比从好进而转变至更好难得非常多。

在往昔的两年时间当中, 视频生成模型所呈现出的演进轨迹, 极易被化约为一条技术参数构成的曲线, 其背后存在着更长的时长, 有着更高的分辨率, 还有着更为逼真的画质。只是, 2.5在产业层面的延展走向, 指向的是一个更深层次的转变变化。

人物、场景、镜头在30秒内保持一致性, 遵循重力、碰撞、摩擦力等物理规律, 通过基于少量先验数据泛化大规模场景的能力, 这些加起来, 意味着视频生成模型正在重建接近真实物理世界的动态环境。

这样的“重建”, 不是那种抽象的概念, 于实际的具身智能训练场景里, 是格外直观的。

以透明以及反射物体学习作为举例, 当机器人去抓取透明玻璃杯或者反射金属器物的时候, 光线会产生折射和扭曲, 而且背景影像会投射在物体表面, 传统视觉模型很容易就会被干扰。然而系列模型只要输入一段机器人在厨房台面前进行操作的视频, 就能够在维持原始运动轨迹、镜头角度以及机械臂位姿全部都不变的情况下, 把玻璃罐中的液体改成橙汁, 将台面换成棕色木纹, 把整体环境光调亮。

于这一过程里, 光线怎样穿透液体, 怎样在木质表面进行漫反射, 玻璃杯壁如何产生折射,模型都会自动开展物理一致性计算。此案例能很好地表明借助视频生成模型, 机器人能够在生成的多样化场景之中反复训练, 从而学会应对不同光照以及材质条件下的操作挑战。

来自香港科技大学计算机科学与工程系的副教授王帅作出评价, 那以2.5为代表的新一代视频模型极具特点, 这种模型不只是能够生成图像帧, 它更在于学习“世界的转变方式”。可以举例来说, 像一个物体被推动之后会怎样运动, 人物的动作跟环境之间怎样进行互动, 在镜头切换的时候空间关系怎样维持一致, 这些情形均要求模型拥有更强的有关时空理解的能力以及物理一致性建模的能力。

在视频生成模型拥有更为卓绝的物理规律理解能力之际, 其应用边界将会进一步拓展。它不仅能够服务于内容产业, 而且还兴许会成为后续具身智能、机器人仿真、自动驾驶场景生成、工业设计验证等领域的关键基础能力。这是鉴于这些场景均要求模型去领会“一个动作将会引发怎样的后果”, 以及“一个场景将会怎样演变”。

从这个视角去瞧, 2.5所表征的并非仅仅是视频生成质量的提高, 更是生成式AI朝着真实产业生产流程深度融合的一个关键信号。

视频生成价值向实体延伸

查看 2.5 合作企业名单, 证实了上述的判断。从徐工集团、小鹏汽车再到穹彻智能、微分智飞, 无一家属于传统意义上的内容公司, 它们分布于中国制造、汽车、具身智能、自动驾驶等实体经济的关键领域。

行业彼此不一样, 然而需求高度相契合。每一家都得在真实的生产流程里, 高效地去生成数据, 仿真场景, 演示流程以及交付知识。而这些, 恰好就是视频生成模型此时正在提供的新能力。

制造行业有着颇为显著的高复杂度特征, 还有着高安全要求的特性以及高知识密度的特质, 从大型设备进行交付举动, 再到开展安装调试工作, 而后到产线实施作业行为, 后续到售后展开维修活动, 都高度依靠着重经验型知识的传递行为。传统方式借助实拍手段或者3D动画制作培训视频, 成本高昂, 周期漫长, 并且很难应对产品迭代情况与工艺变更状况。

徐工集团先前已把2.0用于工业操作培训, 用于工序SOP, 用于安全培训等视频生成, 极大降低传统实拍的制作成本, 极大降低3D动画的制作成本, 面对产品迭代, 可依照需求快速更新视频内容, 面对工艺变更, 可依照需求快速更新视频内容, 不需要重新组织拍摄, 不需要重新建模。

徐工、小鹏、穹彻智能,为什么都选择Seedance 2.5?(图1)

具身智能模型的训练, 长久以来被困在数据瓶颈之中。实体机器人逐个去采集数据, 其速度缓慢, 成本高昂, 场景覆盖的范围有限, 并且复杂的操作还极易致使设备出现损坏。然而传统仿真合成数据却需要众多人力来开展精细化场景建模, 光照、纹理、物理规律都得一个一个地嵌入进去。

视频生成模型给出了第三条路径, 凭借其更为强大的泛化能力, 只要参照少量高质量的先验数据, 便能够自动地生成多样化的训练数据, 进而成为具身智能训练数据的有效补充。

穹彻智能依托视频生成进行了具身智能大模型训练数据的扩充, 并非依靠实体机器人逐个采集, 进而获取适配不同机型的操作数据来达成, 提升了模型于多种机器人上的适配能量以及通用性。

深入实施微分智飞, 于飞行具身范畴展开深度探寻, 会融入至飞行机器人应用之中, 塑造出一套标准化且具备高难度特性的数据集生成流程, 该流程会精准模拟诸如障碍物闪避、室内当中自主进行寻路这项任务、智能类目标锁定以及复杂的涉及镜头运动等一系列真实存在的难题, 进而产出质量颇高的训练数据。

于智能驾驶范畴之内, 诸多头部企业正就基于模型去生成训练数据展开探寻操作。暴雨天气状况下, 大雾弥漫那般的情景, 降雪纷纷扬扬之际, 光线反射产生的情形, 这些极限工况于真实道路采集之时是极难碰到一回的;行人忽然横穿马路这种状况, 前车紧急切出等情况实例, 在数据池当中更是稀少罕见的。

在自动驾驶这一领域当中, 存在着这样一些场景, 他们处于边缘地带, 难以进行大量的采集工作, 然而, 恰恰就是这些场景, 对自动驾驶系统的安全上限起到了决定性的作用, 它还给我们提供了一条全新的路径, 这条路径是这样的, 以成规模的方式去合成极端场景数据, 如此一来, 模型训练便不会再受到真实世界采集密度以及偶发概率的限制了。

在量产车的另一端, 存在着这样一种情况, 从设计师绘制出第一张草图开始, 一直到上市之前所制作的宣传片, 它们同样都在扮演着加速器的角色。

此前, 小鹏汽车已把2.0集成到企业内部的一站式AIGC平台-X, 该平台能辅助汽车产品设计, 能对创意灵感进行快速验证, 还能用于营销宣传物料等环节的视频创作。在概念设计阶段, 它能实现快速可视化, 到了量产车型阶段, 它可用于宣传视频制作, 视频生成正融入汽车产品从定义到上市的全流程。

未来, 2、5在实体经济里的价值, 远远不只是降低成本、提高效率, 更在于它实实在在正催生出一种全新的研发跟生产范式, 使得先进行模拟, 而后验证, 再去实施这样的流程变成可能, 把许多原本仅仅能够于物理世界进行试错的环节, 转移到低成本、高保真的数字世界。

当视频生成从生成视频开始, 进而生成数据、生成场景、生成交付时, 它正在将“生产力”三个字原本的内涵予以重新定义。并且, 当视频生成模型的价值, 朝着实体产业逐步延伸开来的时候, 2.5这个版本的发布, 仅仅只是一个起始点而已, 并不是最终的终点。