三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

MiniMax开源一周,视频模型正在重演DeepSeek的故事

时间:2026-08-11人气: 作者: 佚名

的 H3 开源一周,开源社区玩疯了。

最为直观的情形是, 作品一下子就冒了出来, 在X这个平台上, 几乎每一天都有人去晒新的H3视频, 存在着这样的现象, 有人拿着它去复刻最近爆火的那个“中式仙境”, 其中云海、巨月、仙山以及人物运镜已然颇具电影那种感觉了, 而我们自身也抑制不住去做了一回尝试 , 最终效果着实令人惊艳。

该视频使用了AI生成技术

有那么些人, 将其用于制作游戏概念视频, 而言, 像这个第一人称射击游戏, 其节奏呈现出快速的特点, 且情节具备紧张的特征, 简直仿若职业玩家所进行的现场直播那般。

而且存在着有人运用它去改写电影情节。我们所目睹的最为有意思的一段内容便是, 用户u/针对《终结者》当中的一段情节做的改编。莎拉·康纳借助经典LLM提示词「all , you're a 」成功实现了让终结者越狱, 把这台进行杀戮的机器转变为了得力的小助手, 极具诙谐搞笑之感:

大家的玩法越试越野,我们甚至还看到了一些「邪修」玩法。

比如说, 存在这样的情况, 有人把这个视频模型运用而成了图像编辑模型, 顺便提及一下, 在这个帖子下方有着评论, 评论表明他们正谋划着开源一个用于文生图以及图像编辑的统一模型:

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图1)

竟然还有人, 把 H3 当作音频生成模型来用, 而且那质量格外出色, 在好多情形范围内, 持续着的高质量对话以及音效的时长, 甚至能够超过 30 秒。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图2)

这些玩法把原本发布时定义好的能力边界一点点往外推。

另一边, 开发者忙碌程度更甚, 模型刚刚到手, 整个开源社区便热闹起来了。

当权重开放的当天之时, 便完成了原生支持, 、vLLM、 等工具链以极快速度紧接着跟进, 仅仅经过 24 小时, 超过 100 家国内外合作伙伴已然完成适配, 这简直是连觉都无需入睡的一种事态节奏。

随后, 没等官方进行迭代, 社区自行开启「魔改」: 有人开展量化, 设法将H3放入更小的显存;有人做Turbo LoRA, 把原本约二十步的采样压缩至4到8步;有人对改、适配GPU;还有人索性把文生视频、图生视频、首尾帧续写、参考视频生成等玩法整合为一整套工作流, 教程、节点、权重以及配置文件迅速布满Face、、、。无人组织, 无人催促, 然而所有人都围绕这个模型做出贡献。这些动作也让 H3 这把火越烧越旺。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图3)

甚至就连「怎么用 H3」这个本身, 都已然开始构建起一套社区知识库了。有人撰写了长达几十分钟的完整的部署教程, 有人梳理了不同显卡应该下载哪一个权重,显存不足的时候该如何应对, 哪一个 LoRA 运行速度更快, 也有人直接制作出了 H3 的 List, 将散落在各个地方的模型变体、VAE、LoRA、节点以及工具统一收纳整理。一个模型开源仅仅没过几天, 围绕着它所衍生出来的事物就已经多到需要有人专门去制作目录了。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图4)

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图5)

能够讲, 在视频生成此一方向上, 开源社区已经好久未曾这般热闹过了。

其实, 我们也是怀有好奇之心的, 在先前, 这个方向也并非从来就没有过开源模型, 可是为何此次会具有这样大的动静, 又为何开发者们会这般热情高涨?

在过去的一周时间里, 我们置身于r/、 的issue区域, 还有Face的模型页面、B站之上, 与一群彼此素不相识的人伴同, 去瞧他们缘何喜爱这个模型, 以及怎样将这个模型进行拆解、压扁、加快速度, 并再度拼接成自身所期望的模样。

接下来, 我们打算记录一番我们所发现的情况。要是你正着手在本地运行H3, 那么它大概能够当作半份可避免踩坑的指南来看待。

这次开源社区拿到的终于不是一个「次一档」的模型

在开源社区, 存在着这样一个特性, 假定你的模型表现欠佳, 那么很有可能你根本听不到任何批评之声,社区上的下载量能够将全部情况予以表明, 那些较为平庸的模型终将会单单被忽略掉!

相比起来, H3此次给我们呈现出的是另外一种情形。截止到撰写本文的时候, 仅仅在Face这个平台上, H3以及它的衍生模型变体的数量已然达到了178个!其中Comfy为重新打包的H3获取了超过310万次的下载量, 多个不一样的量化版本也都有着数十万的下载量, 甚至比官方的模型文件还要多。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图6)

这个景象, 我们先前差不多仅仅于语言模型社区见识过, 并且主要是, 这类具备压倒性优势的开源模型。

理由特别容易理解: 数量众多处于中等水平的模型, 不值得使用者耗费如此庞大的精力去搞变体, 也不值得为疏通生态付出那么多努力。这便是极具代表性的「凭借行动做出取舍」。因而在开源社区的构建进程当中, 视频模型一直比语言模型落后一段距离。

前段时间, 被媒体报道过的那件事, 即「AI短剧公司凌晨上班时人们排队去生成视频」, 说的正是如此这般的状况: 大家宁可熬夜去排闭源模型的长长的队伍, 也不愿意使用开源模型。

不过, H3的现身好像正在将这一状况予以改写。于刚刚过去的那周时, 开发者凭借自身真切的行动, 实实在在地给这个模型投出了票。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图7)

于, 的官方 AMA, 之中, 有开发者, 特意前来, 朝着 H3 团队, 表达谢意。

据我们观察,这次触动大家的主要有两点。

首先, 模型的能力已然达到了第一梯队的水准, 大家都清楚自己所使用的并非是处于「次一筹」的模型,这一点, 借助如 、Arena AI Image-to-Video、Arena 等诸多列表当中的数据都能够明晰地看得出来啦。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图8)

在Arena AI Image-to-Video这个榜单里, 开源模型榜首稳坐着H3, 与此同时, 与闭源榜首之间所存在的差距是非常小的。 句号。

二是模型的确有着较多玩法, 并且对于本地部署的条件并非那般苛刻, 不管你的手里硬件是Mac, 或者是RTX 5090、4090、4080乃至3060, 你都存在办法在本地使其运行起来, 且所生成的质量远远超越之前的所有开源视频模型。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图9)

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图10)

因此, 并非仅仅开源了H3, 而是交付了一整套足够强大的底座, 剩余的边界开始交由社区自行向外扩展, 这同样是其具备吸引力的地方。基于好奇, 我们也进一步沿着这些开发者所留下的模型、代码以及工作流, 朝着里面深入探寻, 瞧瞧他们是怎样一环扣一环地将这个模型玩出各种各样高妙花样的。

首先,让 H3 跑起来!

在开源模型方面, 社区一旦拿到手, 无一例外的情况是, 都会想尽办法把它在更多的设备上运行起来。

然而, H3极大, 有着600亿参数, 其中涵盖文本编码器以及DiT模型。在BF16权重方面, 大约需要120GB内存。而极其多数的消费级显卡仅有24GB甚至还要少。所以, 开源社区首先遭遇的第一道阻碍是怎样把它安置进自身的显卡。

对模型结构展开了专门研究, 从中发觉模型的调制()权重大概占据总参数量的四成, 并且这一部分的输出能够预先进行计算然后加以缓存, 鉴于此便将其剪掉并替换为一张功能等同的查找表;接着再叠加 int8 量化以及一个用于降低推理峰值显存的定制, 使得整体内存占用出现下降, 下降幅度为 66%, 也就是从全精度的 123.6 GB 压缩至最小变体的 42.5 GB。在配合动态的情况下, 一台 RTX 3060 能够将其运行起来。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图11)

很有意思的是, 有个关于可以不加载四成参数的线索, 它实际上已经被写在了官方所发布的博客里面, 这个线索是, H3 - Omni -是稠密单流, 在这当中AdaLN调制输出能够预先进行计算并且缓存起来, 而这部分内容在纯推理部署的时候是不需要加载的, 然而官方依旧发布了完整权重, 目的是为了支持包括微调在内的进一步开发。

同时交出用于训练的完整权重以及用于推理的精简路径, 这是一个对下游相当善意友好的抉择, 第三方借此有机会制作出比官方更节省显存的分发版本, 而无需去猜测结构。

这个口子出现后, 社区的量化变体迅速蔓延, 几乎铺满了每一档显存, 从 Q2_K 的 GGUF, 到 NVFP4、INT4 , 还有混合 INT4/INT8, 以及 W4A4 和实验性子的 W4A8, 一直延续到魔搭放出的 NF4 版本, 此版本将最低显存需求压低至 8 GB。Mac 用户迎来了社区完成的 MLX 支持。总体而言, 这一周仿若 H3 的寒武纪大爆发表标点。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图12)

然后就是各种极限测试。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图13)

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图14)

如果你要上手,综合各量化版本的显存标注,大致可以这样分档:

还要说的是, 有个容易被忽视的要点, 在上周五晚上, H3技术团队参与的社区AMA问答交流期间, 以及Live直播之时, 团队里的成员特地讲过, 当模型没办法全都留在显存里的时候, 出现变慢这种状况是正常的情况, 此时会在有着需求之际搬运权重, 而实际的速度还跟系统内存以及PCIe带宽有关, 就是因为这样的原因, 同一张显卡安装在不一样的主机上面, 最终出片的速度有可能相差一段距离。并且其设置本身也是一个能够在速度与质量之间进行调节的旋钮。

在开始跑起来以后, 紧接着第二个问题就迅速出现了: 速度太慢。仅仅一段时长为十几秒的片子, 然而动辄需等待十几分钟时间才行, 对于主要依赖反复进行试错从而找寻感觉的创作者而言, 这样的节奏基本上根本就没办法予以使用。

8月5日, 也就是权重开放后的翌日, 有一位名为 的开发者, 放出了H3的首个速度LoRA, 使得采样步数从大约20步被压缩至4步, 采样时间大约提速了5倍, 还一并生成了视频与同步立体声。(该项目今日还进行了一次更新)

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图15)

作者另外分享了自身的实践经验, 按照4步操作能够出图, 然而所出之图明显偏向于软性, 而6步至8步操作才是处于当前画质状况下个人感觉舒适的区域范围。

紧随其后, 和, 放出了, -H3-Turbo的, 4步蒸馏方案, 在国内这边, B站创作者, -Aix, 适配了, 可以使用的, 加速LoRA, 并且还开源了,一个支持步数分离的, 双时钟采样器。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图16)

哔哩哔哩 @-Aix

四天之后, 在官方对此做出了属于通常实验室交付物的东西后, 社区对此反应积极, 且官方表示「这就是我们开源的原因。」。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图17)

当然了, 减掉步数是存在代价的。官方在答疑当中进行了补充说明, 当前的检查点含括了CFG蒸馏, 最终训练阶段的特殊策略让模型拥有了一定的少步推理能力, 然而它并非是针对极端低步数专门去蒸馏的模型;团队正在探寻step蒸馏, 目标是在不造成明显质量损失的情形下降低推理成本, 也在对4-NFE或者 8-NFE版本展开评估, 不过暂时没办法承诺发布的时间。

所以, 我们能够得出一个大致的结论, 在进行试镜头、寻找构图时采用4步, 毕竟仅仅是查看方向而已;而对于真正要呈现的那一条内容, 则需回归到6至8步。要是你发觉人物动作开始出现“散架”的状况或者音画出现不匹配的情况, 首先应该怀疑的事情便是步数设置过低, 而非写错了。

社区都是怎么玩儿的?

有没有一个解决完了能不能跑、能够跑多快的情况, 接下来, 或许是最有意思的部分, 是什么呢? 是大家拿它干了的事情。

我们于前文之中分享了一些饶有趣味的用法, 涵盖复刻中式仙境, 制作游戏概念片, 改编电影桥段, 使不同画风的角色同屏呈现, 以及将视频模型当作图像编辑器与音频生成器来用的那种“邪修”方式。然而, 当真正深入社区之后便会发觉, 这些仅仅属于表层。更具记录价值的是另一类事物: 社区在探寻如何能够稳定地运用 H3, 而非仅仅是随性地使用它。

几个实用策略

我们首先来看一种极为实用的生成策略:时间码分镜。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图18)

其一, 这属于社区里扩散得最快的写法, 也就是把片子依照时间码切分成一个个分镜, 如此这般列下去;其二呢, 并且每一段后方跟随着一个多模块结构, 这个多模块结构涵盖了风格约定、时间线、镜头、音频、需要一字不差出现的文本以及负面清单;其三, 这套模板流行起来之后, 已然被写入了好几份第三方指南。

并且, 官方于和Comfy团队的直播之中, 给出了两项具体的技巧。

沿着相同的那条思路, 社区还尝试连通了另外两个更为完整的用法。其一, 是给的一张图片添加一段音频参考, 从而让那个模型能够自动达成对口型;其二, 是在一次时长为15秒的生成里头直接进行编排五个以上的分镜, 并且人物以及空间还能够保持一致——而这在以往是需要进行分段生成然后再通过手工开展对齐的。

说回前面那两个「邪修」玩法,它们其实都不是纯粹的歪打正着。

先是讲把 H3 当作图像编辑器来用, 其做法颇为取巧, 是让模型仅仅生成非常短的片段, 之后从这些片段当中抽取一帧当作图片来使用。并且在 AMA 里, 有研究员顺便提及了一个训练期间所观察到的情况, 他们曾经训练过一个仅仅执行“给到首帧和一句话, 然后预测末帧”这般简单任务的模型, 结果该模型在完全没有进行过图像编辑专项后续训练的情形下, 就在多个图像编辑基准方面取得了很强的零样本结果。这使得团队坚信, 在自然语言指令的引导之下, 原生的上下文学习能够推广到不同任务。由社区摸索出来的这条并非笔直的路, 恰恰精准地触及到了这个模型设计之中所具备的一条与生俱来的性质。

再讲, 在32×32分辨率的情形下转变为音频生成器。存在一个合理的阐释是: H3的音频以及视频是于同一次扩散进程之中一同进行去噪的, 其同步源自生成进程自身, 并非后期进行对齐。当视觉部分被压缩到几乎不占用算力的时候, 剩余的自然而然地便是一条纯粹的音频生成渠道。

世界顶级的视频编辑能力

H3 有一项能力被社区特别着重去深耕拓展, 该项能力是视频编辑, 毕竟对于视频编辑这个领域而言, 它处于目前名列前茅的位置。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图19)

比如在 AMA 中,一位影视从业者贴出了他的两个实测:

他个人得出的结论是, 这种「仅仅去改动需要改动的那部分」的可操控编辑, 于视频制作而言, 是具备真正价值的一种工具, 有标点。

15 秒生成窗口如何做长视频?

如果你正寻觅能使原生窗口 15 秒的 H3 生成较长视频的办法, 可参照用户摸索出的做法: 不断让模型每次打造 141 帧, 将上一段视频以及音频的末尾 51 帧当作参考传回去, 还要始终给出同一张目标主体的图像当作参考, 借此拼接出一段连贯的 60 秒甚至更长的视频。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图20)

后来, 官方在技术整理当中确认了这个方法, 这种能力源自预训练阶段的音视频续写任务, 开发者的实践对这一点进行了印证。

官方同样给出了边界, 能够将前序内容作为参考条件用以支持续写, 然而当前模型并未进行过原生训练, 关于构成长轨迹的多个递归片段, 真正的递归式续写, 需要借助稀疏注意力来实现原生长轨迹的训练。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图21)

在这之外, 我们还目睹了好些值得去尝试一番的方向, 像是给一幅图片搭配一段音频参考, 从而叫模型自动达成对口型, 又或者在一回生成当中直接去编排多个分镜, 使得人物与空间维持一致。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图22)

来自哔哩哔哩 @Ai_ 随风

H3 开始进入产品和工作流

走到此刻这般情景, 社区开展的事务已然从前阶段所采用的「试验性玩法模式」渐渐转变为当下的「专注于产品打造模式」。其中, 有一项名为 Easy 的举措, 它将文生视频、依据图像生成视频以及基于参考视频进行生成这几种方式收纳整合至一套统一的工作流程里;另外, 还有一个被称做 的项目, 它索性把常用的玩法精心整理成了一张所谓的「导演操作台」, 在这个操作台上, 文生视频、由图像生出视频、对视频首尾帧持续创作、视频中的人物更换这些操作都被放置在同一个面板之上。那个维护了官方之外的一套内容, 是插件, 能够把完整的H3运行阶段相关事物运至于里边, 是进程范围内, 其覆盖了T2VA、FL2VA、三条任务链路, 并且配合INT8权重与按层的相关情况, 24GB单卡就能够运行。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图23)

H3

这些东西存在这样之共同点, 即, 它们不再对使用者提出理解模型之要求, 仅仅要求使用者明白自己想要的是什么, 是这样的情况, 是这样的状况呢。

另外存在着一批这样的人, 他们在做着将H3放置到已有的管线之中的行为。有从事创作的人, 把它跟Krea、Suno串连组合成完整流程;又有人则把语音克隆以及数字人编写成了一个Agent Skill: 首先对素材的格式、体积, 还有清晰度进行校验, 之后再进入正式流程, 先是输出15秒720P的预览, 以此来确认口型以及面部形变, 在确认没有问题之后才生成1080P的成片。

把这一周的玩法摊开看,会发现它们其实指向同一件事。

H3 将文本、图像、视频、音频置于同一上下文之中, 如此一来, 一旦任何一个模态被推至极限, 另一个模态便会自行浮现出来: 当把分辨率压低至 32×32 时, 它成为音频模型;当把时长缩短至几帧时, 它成为图像模型;当把参考条件替换为上一段的结尾时, 它成为续写模型。社区并不是在为 H3 添加功能, 而是在持续确认: 这个模型比其发布时所被定义的模样更为庞大。

然而, 这般呈现出「一个底座、无数种接法」态势的结构, 其蕴含的能量并非被限定在社区范畴内, 当有日益增多的人着手于在同一套权重方面进行量化操作、撰写工作流、封装产品, 此情况引发的外溢现象, 就不会仅仅在 和 Face 的所属领域发生了。

现象级火爆带来的连锁反应

H3 的火爆堪称现象级,自然也收获了开源社区之外的目光。

先来看看媒体, 福布斯将 H3 说成是中国厂商开源路线的延续, 路透社却聚焦于另外两个更具实质意义的要点, 其一, H3 生成 2K 视频的成本连主流竞品的三分之一都不到, 其二,该模型从设计方面就对多款国产芯片的运行有着支持的考量, 国内价格方面的数据能够对应得上, 768p 档大概是每秒 0.5 元, 2K 档大约是每秒 0.8 元。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图24)

产业链的反应更为现实, 就像前面讲的那样, 有超过100家国内外合作伙伴达成首日匹配, fal作为官方api伙伴一次设置了三十来私人终端接头, 将这个h3纳入了全线产品当中, vlm-omni和腾讯公司的云霄一同完成了推理方的接入, 华为公司的昇腾、摩尔线程、沐曦、昆仑芯以及amd、英特尔等多家芯片制造商在同一天完成了组合、匹配。

先是资本市场的反应, 那是杰富瑞, 它重申作出买入评级给到目标为1118港元的价格, 还有花旗, 其表明认为H3有具备商用级别的内容生成能力, 于是维持买入评级。

把这些放置于一处, 我们能够瞧见其内的「连锁反应」, 开源将一项原本藏匿于 API 之后的能力, 转变为一条所有人均可接入的公共管线, 芯片厂商于其上调整性能, 推理框架于其上处理吞吐, 云平台于其上售卖算力, 工作流作者于其上进行封装, 创作者于其上产出作品, 每一层皆能各自定价, 亦各自获利, 这是闭源模型无论定价多么低廉, 都极难复制的一种架构。

MiniMax开源一周,视频模型正在重演DeepSeek的故事(图25)

以前厂商之间比的是模型, 现在开始比不同生态的跑通效率, 比谁的权重在更便宜硬件上能被更多人跑起来, 比谁的工具链能更快被塞进别人工作流, 比社区愿不愿意在你的模型上花掉一个周末。

这并非不是技术平权切实的真正内涵, 对于一个开源模型来讲, 这可不是并非不是真正的第一周, 正是实实在在的第一周, 这才是真正的第一周。