周五的上午, 彼时彼时彼刻, 我仍在满心感慨着, 开源样式的视频模型, 终于已然追到了2.0大约八成的水准。然而在那之后, 及至下午时分, 2.5版本发布了。
该怎么去讲述呢, 在这半年期间, 大家应该都是有所体会的, 2.0已然变成了在全球范畴之内处于Top 1位置的视频模型, 而这一情况已然是没有什么可争论的了。
这一次, 2.5 又把第一名和第二名之间的差距拉大了。
以往, 我们于探讨LLM之际, 时常会讲, 以及 的模型, 大约比别的模型领先3个月。
视频模型此刻所处的这个领域, 看起来, 2.5 对于第二名而言领先幅度起码是 6 个月, 对于第三名来讲领先幅度至少也要 6 个月吧。
并且, 这一回, 令我感触最为突出的一点在于, 豆包专业版已然着手, 将应用与模型之间, 构建起极为良好的配合。
于豆包专业版里, 运用视频创作的 Agent, 我们仅仅只需凭借自然语言去描述自身的需求。
代理商能够协助完成创意拆解, 进行分镜设计而后调用模型创生宣传片、广告片等具备生产力场景的视频内容, 没错有标点。
大家瞧这个截图, 这意味着, 借助2.5与豆包应用的共同协作, 提示词的门槛已然不存在了。
这回视频的生成, 核心用户自专业创作者起, 彻彻底底过渡往普通用户方向了。

我感觉,至此,AI 视频的下半场来了。
#01
2.5 的提升
话无需多讲, 在周六那天, 我跟团队实施了一整天的测试, 测试对象是2.5, 其中最为主要的感受在于, 这一回所实现提升的方面涵盖了画质, 还有可控性以及时长这些内容。
之前有一段时间大家会说可灵的画质是比 2.0 好的。
然而, 当2.5问世之后再去进行对比, 就会发觉, 在画面质量这一方面, 在分镜控制这一方面, 以及在对提示词的理解这一方面, 2.5理应都是处于全面领先的状态了。
而且 2.5 单段生成从 15 秒提升到了 30 秒。

下面,这是我一次直出的短片,提示词类似上周五文章中的:
回想童年时盛夏的午后, 老旧的院子始终被暖黄色的色调所笼罩, 那个毫无忧虑的小男孩在整个院子里欢快地奔跑, 尝试去追赶半空中被风刮起的一只透明的塑料袋, 在木门框的旁边, 满心慈爱之情的奶奶迎着温暖的光线站立着, 慈祥温柔地呼喊他去吃西红柿拌面。
突然间产生了时空的跨越幅度, 以前那个追逐塑料袋的小男孩, 现在已然变成了满身疲惫的成年人, 他静静站立在当年相同的那个位置, 然而木门前已经没有了任何一人, 院子也已经变得荒芜了呢。
这时, 一阵同样寒冷刺骨的风刮来, 撩起了他的衣角。最终, 字幕慢慢地浮现: “我们于时间之中碰见始终最爱我们的人。之后, 也于时间里边跟他们道别。”。
大家重新瞧这次呈现的 2.5 的成效, 显著地更具写实感了, 画面质量以及人物的表现将会更加真切。
同样,我把之前 2.0 的片子也放出来:
再次尝试去做一个跟电影《呼啸山庄》女主回头看的那种画面相类似的, 这次存在提示词我进行了精准的把控。
一位女性骑着一匹迈着迟缓步伐前行的马儿, 穿过了那透着寒冷阴森的荒原, 此马匹始终没有进入画面之中, 然而骑乘的感觉却贯穿了整部影片: 肩膀、脖颈以及镜头伴随着马的步伐有着轻微的起伏变动, 远处的荒原朝着左侧一一掠过。仅仅留存下了强劲的风、衣物相互摩擦发出的声响、沉闷的马蹄声音以及轻微的呼吸声。
有着被磨损的骑装款式且是暗砖红高领样式、搭配着灰白衬衣的她, 左耳戴着一枚小小的金色耳环。她那深棕的卷发被风给吹散了, 湿润着的发丝不断地扫过脸庞。呈现出真实的皮肤纹理, 在阴天的自然光之下, 有着低饱和的灰蓝、泥土褐以及暗砖红, 具备寒冷粗粝的电影质感。
0秒至2秒的时段里, 她是朝着画面右侧行进的状态, 观众所看到的主要是她的后脑部分, 还有左侧颈部, 以及耳环, 另外还有少量的侧脸部分。她的鼻尖方向是朝右的, 绝对不是正对着镜头的情形。
两秒到六秒的时段内, 她感觉到身后或许存在他人, 于是开始慢慢地回头。眼睛先是往左侧寻觅, 紧接着头部转动, 随后鼻尖转动, 再接着下颌转动, 而后颈部转动, 这些动作要持续不断地推进, 绝不能突然转换样式。脸渐渐从侧面转为三分之四角度的模样。
6秒到8秒, 回眸已完成。她轻微地朝着画面左侧方向去, 望向远处一望无际的荒原, 但就是不看向镜头。她的眼神里带着寻找的意思以及些许期待, 有短暂的吸气动作, 紧接着嘴唇先是微微分开, 之后又合拢起来。
8秒到12秒的这段时间里, 远处不存在任何一个人。她持续进行寻找, 那份期待逐渐地消退, 转而变为失望、疲惫以及不愿接受现实的迟疑。瞳孔向下移动至下方, 下颌微微地降低下去, 呼吸变得深沉起来。发丝仍然不断扫过脸庞, 身体伴随着马步作轻微程度的起伏。
大家着重瞧一瞧它对于指令的依循能力, 此次我仅仅生成了十二秒, 然而效果相当出色, 画面差不多全然顺着我于提示词之中所设定的时间以及节奏向前推进。
这同样是我之前所提及的, 处于可控性方面的那种提升, 具体为2.5。它具备这样的能力, 能够依照清晰明确的时间先后顺序, 去施行人物动作, 以及镜头运动, 还有情绪变化。
能够将每一个时间段所涵盖的内容清晰加以书写, 之后模型依据这样的设置逐步达成, 这对于那些期望详细把控画面的创作者而言是一种利好情况。
同样我感觉这个画面的情绪表达真的已经逼近实拍了。
上面呈现的皆是模型直接输出的成效。然而, 要是诸位对于提示词的掌控能力并非那般出色, 我依旧大力举荐直接于豆包专业版当中调用2.5。
#02
在豆包中快速生成视频
讲真, 前面两组视频片段的提示词, 多少是有些繁杂。绝大部分普通的用户, 根本没耐心, 又没能力写出那么繁杂的提示词的。
现在, 豆包专业版已然是以 Agent 的方式着手重新组织视频创作流程了, 并且, 整个的那种体验是极其简单的。
往下的截图乃是豆包网页版本, 于技能里挑选“创意视频”之后, 能够瞧见其主要留意的是商业视频制作情景, 涵盖广告片, 口播视频, 产品推广视频等, 这般。

脚本, 我们能够将其, 及网页链接, 还有产品资料, 再加上参考图片, 直接交付给它, 只要大致清晰地讲明白自身想要做的事情便可以了。
现在存在着数量众多的专门视频 Agent, 实际上, 我们能够把豆包专业版的这个功能, 理解为那是一个搭建于模型之上的视频 Agent。
它会依据自身对于视频创作的理解, 首先去消化我们所提供的资料, 接着帮我们梳理创意, 随后拆分任务, 再接着设计分镜, 最终再调用2.5生成视频。
假设是时长超过 30 秒的长视频, 它会在自动进行拆解后, 拆分成多个段落予以分别生成, 随后最终完成拼接操作。
所以, 对于多数普通用户来讲, 没必要一开始就去掌握极为复杂的视频提示词。
先是把自身的需求, 以及素材, 还有想法交付于它, 接着让这个视频 Agent 协助你再把后续的工作予以持续完成。
就比如说, 随手再次拿起了那本孩子所喜欢的书, 名为《青铜葵花》, 紧接着直接把第一页上面的文字摘取出来, 而后喂给了2.5。

接着,豆包专业版会拆解我的需求。

要是与预计的情况不一样,那就能够接着去修改。大家能够瞧见, 依据我录入的图像, 实际上豆包专业版已然将分镜以及画面的内容准备好了。

最后生成的内容如下:
在瞅见这段视频之际, 我居然萌生出了这般一个念头: 我们说不定能够将课本里头的诗词以及课文, 径直交付2.5去制作成视频。
是由于小学生在刚开始和一首诗、一篇课文相接触时, 事实上相对而言是较难于领会文字所要表达的氛围以及情绪的, 他们未曾见识过沙漠中一缕孤烟的景象, 并且也不清楚古代的长安到底是怎样的一种模样。
过去,这一部分主要依靠老师讲解,再让孩子自己想象。
当下, 也许能够将课文交付给模型, 于几分钟之内创作出一段视频, 如此马上便能够直观地体会到文字背后所要传达的画面。
这存在着成为AI视频于教育范畴内一个颇为具体, 与此同时还极易实现落地的场景的可能性。
我再次将手机相册里唐三彩的照片, 于豆包专业版里运行了一回, 以此查看效果。我的设想是要让图片之中的人物苏醒过来, 变得生动逼真, 既有动作, 又有神态。
下面的截图,我的输入其实是通过语音输入法完成的。

或许以后博物馆出现新展品, 或者有展览上线, 完全能够直接借助AI制作一条宣传片。
文物不再仅仅是默默地放置于展柜之中, 能够以更充满活力的形式, 将其背后的故事讲述出来。
继续玩,给我喜欢的咖啡馆做个宣传片。这次的提示词非常简单:
制作一个宣传片, 针对这个咖啡馆, 我对其心怀喜欢之情的, 要做到唯美, 要能够凸显咖啡所具备的属性, 要能够展现出门店所拥有的调性。

这属最终之成品, 亦尚佳。一次径直呈现如此效果,觉着再略微简单予以编辑, 便能够使用了。
写文章的间隙,顺手又给老家山西做了一个文旅宣传片。
于此, 我依旧选用豆包专业版。大力举荐诸位采用此模式, 如同下述截图这般, 我借由语音输入法讲完自身需求后, 诸位瞧, 它随后会径直去搜寻相关景点图片。

旁白、台词这些都是豆包规划的:

我又补充了下自己的想法:

首回生成的视频中佛光寺不对, 此并非如我所愿, 我想要的实则是佛光寺东大殿。所以, 手动传送了一张图片, 以使它持续进行修改。

下面是最终生成的效果:
我制作了一个模型直出的效果, 目的是用于对比, 在此过程中发现, 云冈石窟的照片在其中完全出现了错位的情况, 此外, 整个镜头的构思, 相较于上面的豆包专业版, 并不那么合理。
这也能侧面说明模型之上 Agent 脚手架的价值。
#03
写在最后
做到这里,我突然想明白了一个道理。
有那么一段时间过去了, 众人针对AI视频展开讨论, 似乎关注的要点常常聚焦于电影以及短片之上。这些方面无疑是值得留意的, 然而事实上距离大多数人的实际需求还是存在着些许的差距的。
今日参与测评的宣传片, 产品介绍, 还有活动预告么, 课程讲解哦以及广告片, 我在寻思着, 它们或许是现实中数量更为繁多的需求。
类似于电商店铺里上架了新的产品, 这种情况下需要制作一条关于产品的视频, 又或者, 存在着有人新开了一家店铺的状况, 此时需要拍摄一条宣传片。
博物馆上线新展, 想要能使得用户知晓此情况。老师讲解课文, 期望为学生增添了一段影像资料。
这些视频多数仅仅几十秒, 制作要求不像电影那般繁杂, 然而以往依旧得有策划, 得有拍摄, 还得有演员、场地、剪辑与配乐, 一条稍微精细一点的片子, 花费很轻易就能达到几万元。
如今, 对于我们这种规模并不大的产品团队而言, 能够将产品资料, 还有图片, 以及创意交付给 2.5, 进而能够得以迅速制作出来一条产品宣传视频得的情况。
参照我们此次测试的真切体会, 付出一两百元, 便已然存在着能够生成一条颇为精美的短片的机会。
版本需要挑选, 提示词需要修改, 少量后期处理需要完成, 不过成本和过去相比, 已经完全不在同一个数量级上头啦。
这让我想起十多年前微信公众号刚刚出现的时候。
在此之前, 对于一个普通的商家而言, 要是想着持续去发布内容, 且达成触达用户的目的, 那就得自己动手去建设网站, 或者借助报纸、电视以及其他的媒体渠道才行。这成本贵得很, 而且操作起来繁杂得很。
在公众号出现之后, 任意一个商家能够快速去申请一个账号, 紧接着, 直接将消息发送出去, 进而与自身的用户持续保持联系。
今日的AI视频, 有着类似于公众号彼时的那种感觉, 它完完全全变成了一个生产力工具。
以后每一个商家都直接拥有自己的视频生产能力。
推出一款新的产品, 能够即刻生成一则宣传片。构思一场活动, 能够快速打造预告视频。甚至仅仅当做出了菜单相关内容、包装相关内容或者展品相关内容的更换, 也还是能够制作一段用来告知用户的对应内容。
我觉得,这才是 2.5 真正打开的想象空间。
AI存储扩产潮,谁是最大赢家?
美光科技和闪迪因 DRAM 和 NAND 闪存芯片需求激增而...(199 )人阅读时间:2026-08-02
Seedance 2.5依旧断档领先,还和豆包深度打通了
Seedance 2.0已成为全球视频模型Top 1,2.5...(80 )人阅读时间:2026-08-02
因AI生成大量低质漏洞报告,苹果限制安全研究人员漏洞提交数量
苹果因大量AI生成的低质量漏洞报告(AI垃圾),限制了对内部...(180 )人阅读时间:2026-08-02
OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个
AI被用于制作假医生视频带货,通过复制脚本、生成虚拟人像和声...(179 )人阅读时间:2026-08-02