一般来说,做一个比较好的AI视频,最累的往往不是“生成”。
你要先去寻找图片用作角色参考, 然后再去寻觅视频来确定动作;当画面呈现出来了, 声音却非得去到另外一个工具那里进行补充。要是想要修改一句台词、更换一个镜头, 先前的素材还得再次重新对齐一番。
工具这般日益增多, 然而创作链路却愈发破碎了。并且当前情况下, H3 所想要去解决掉的, 正是这一件事情。
存在这样一种模型, 它能够仅接收一段提示词, 便为你产出一段无声视频。H3 具备这样的能力, 它能够将文字、图片、视频以及音频一并视作上下文, 径直生成带有原生双声道声音的视频。官方所公布的输出上限设定为15秒、2K, 而在公开权重后的首要之事, 乃是促使开发者将768p的Base模型运行在自身的机器上。
H3 如何本地部署?速度怎么样?
当下, H3, 其公开权重呈现出处于上方的状态, 进而意味着, 所有的人, 均能够将它, 部署至自个儿的电脑上去。并且, 你只要运用自身的消费级显卡, 便立马能够使它运行起来了。

有网友进行实际测试, 在配备了+32GB内存以及+64GB虚拟内存的情况下, T2V凭借使用预设的默认提示词进行5秒视频的生成, 其中生成480p清晰度视频耗时160秒, 而生成约720p清晰度视频用时560秒。
官方把 H3 分成两个可本地跑的 Base 检查点:
当然, 倘若你并不打算这般折腾, B站的大佬Work, 先是把所有的东西予以集合, 接着就去直接借助一键下载的方式, 达成能够使用的目的啦哟哇, 对于那些有兴趣有意思并感兴趣的人而言, 能够经由夸克网盘去实施下载操作, 并且它还为30、40、50级别显卡提供支持。真的是哇, 总之就是这么回事哇!
当下载结束之后, 能够瞧见 4 个文件, 借助 7zip 把图里的整合包率先予以解压, 接着, 将其放置于 modes 文件夹之内, 直接进行替换。

综合大佬进行的测试对比情况而言, 于当前阶段, 以版本最新作为基准, 在输入达到相一致的条件下, 得出这样的结论, 即速度拥有明显提升之态势。生成时长占据10秒的一段视频, 在最短的时间限度方面, 所需时长仅为318秒。并且, 仅需满足一个条件, 也就是你的显存处于12G以上这个范围, 那么仅仅花费几分钟的时间, 便能够以相当快速的方式获取到符合自身需求以及期望的视频。

再且, 倘若你接入 Codex, 仅需使 Codex 始终为你劳作, 一个夜晚便能够直接获取几百个素材。能够讲, 普通人在头一回切实拥有了一支“不会下班的内容团队”。
这表明内容生产方面存在的瓶颈, 正从“有没有时间去搜集资料”, 转变为“你可不可以提出一个好问题”, 以及“能不能判定哪些素材确实有价值”?
以前, 一个人, 一天, 仅能去研究几个, 方向, 现在, 或许, 一晚上, 便能够同时, 去跑几十条, 线, 真正, 拉开差距的, 已然, 不是那, 谁更能, 熬夜, 而是那, 谁更会, 调度, Agent。
极其关键的一点在于, H3的开源状态, 相较于闭源模型所带有的限制来说, 存在着显著差异, 其限制要少很多, 基于这种情况, 你能够得以实现更多属于自己的想法, 如此一来以经验丰富著称的老司机们, 大多是有可能明白这究竟意味着什么的。

添加图片注释,不超过 140 字(可选)
固然哈, 要是你实在在心理上抵触去进行反复的操作, 那你能够径直去下载, 当下官方那儿存在着免费使用的次数, 相应地还有积分。生成2K视频, 时长为10秒, 其给出的最低价格是$0.6。

添加图片注释,不超过 140 字(可选)
实际体验
夜晚时分的海边, 有一名年轻女性, 她身着香槟色露背吊带长裙, 先是以背对镜头的姿态缓缓回头, 接着仰头, 之后镜头朝着右侧移动, 且逐渐推近, 最终焦点落在旁边的雏菊上。那里夜色呈现蓝调, 极具电影感, 富有浅景深, 远处是城市灯光、山体轮廓。
我感觉这个视频生成出来的质量已然是相当之高了, 整个所呈现的镜头着实具备摄影的那种感觉。其开头通过一个背影构建起场景, 中间人物进行回头的动作从而将注意力吸引到脸上, 随后人物仰头, 镜头跟着继续进行横向移动, 最后还把雏菊带入到画面之中。
近景特写, 电影感十足: 有一名年轻且漂亮的东亚女性站在公园里, 这公园是阳光明媚的那种, 她与一名男性近距离相对, 脸对着脸站着。她留着一头黑色长发, 那头发柔顺得很, 她的妆容自然又精致。她的嘴唇呈现出柔和的粉色, 在头发后方系着浅色的蝴蝶结, 午后的阳光透过她的发丝, 于头发边缘形成柔和又颇为漂亮的轮廓光。
电影画面呈现, 体魄健壮、上身无衣物覆盖的中年男子, 伫立在那暗中烟雾肆意弥漫的地下区域之内, 嘴上叼着正燃烧的雪茄之际, 手里握着黑色的霰弹枪, 他以迟缓的动作去检查而后将枪举起, 一脸冷峻。先是从中近景徐徐朝着脸部超特写推进此镜头, 捕捉雪茄上边那闪耀晃动的火星, 留意到吐出的缕缕云雾, 皮肤上的汗珠, 还有真切的纹理。随后这画面平滑地朝着右边横向挪移, 同时做焦点转换, 男子渐渐转换成画面里变得虚化的前景部分, 远处有数量繁多静静摇曳发光的蜡烛, 还有数位身穿兜帽长袍仿若神秘莫测的人物, 慢慢地在此显示得清晰起来, 在一片明亮之中, 中央位置站着有一名身形更为高大的同样戴着兜帽的人物。冷色调的蓝色烟雾, 暖色调的黄色烛光, 有着强烈的明暗方面的对比, 具备体积光效果, 营造出黑暗宗教仪式的氛围;具有35mm电影的质感, 呈现浅景深效果, 实现超写实风格, 采用单镜头连续运镜方式, 且没有进行切镜处理。
迷人少女, 于阳光灿烂的夏日午后, 一位面容姣好的东亚女子伫立在城市的街道之上, 乌黑的中长发随风悠悠轻摆, 身着白色细肩带背心、白色短裙之装, 浅米色的宽松衬衫松松垮垮地披于肩头。她带着柔情望向眼前之人绽露微笑, 步伐迟缓地朝着前方靠近, 手中握着一朵粉色的小花。而后自然而然地抬起手, 朝着镜头前的人递出花朵, 最终粉色花朵朝着镜头贴近来构成前景。以第一人称视角呈现, 右侧留存另一位女性模糊不清的肩膀与长发, 仿若两人正面对面进行互动。存在着金色的逆光之态, 有着发丝轮廓光呈现, 城市街道连同绿树背景处于虚化状况, 运用的是85mm镜头, 具备大光圈, 形成浅景深, 有着柔和散景之象, 带有日系青春电影感, 展现真实皮肤, 呈现自然微笑, 微风吹拂致使头发和衣服摆动, 动作自然且流畅, 属于超写实风格, 为单镜头, 不存在切镜。
玄幻短剧, 有个白衣女剑修站在那暴风雨笼罩着的荒凉山巅之上。彼时, 她的长发还有那宽大衣袖在狂风之中飞舞不停。接着, 她手持剑快速地施展剑诀, 而后转身挥剑, 随后高举着长剑指向天空。刹那间, 乌云开始翻滚起来。紧接着, 一个由八卦、有着古老符文跟多层旋转圆环构成的偌大蓝红色仙侠法阵在天空之中展开了。与此同时, 无数蓝白色的雷电往其中汇聚。随后, 女剑修悬浮着往空中升去, 她的剑身被雷电给包裹住了。镜头迅速推近, 只见她神情凌厉, 猛地挥剑朝着前方, 一道巨大的红蓝色通天剑光从法阵里轰然落下, 击中了远处山谷, 引发了猛烈爆炸还有冲击波。具有东方仙侠风格的电影, 呈现出史诗级打斗场面, 其中有巨大的法阵, 伴随着雷霆般的剑气, 还有体积云以及狂风, 其特效达到电影级水准, 超写实, 搭配 IMAX 技术, 构成大场面, 且运用动态运镜, 动作表现流畅。
它到底比普通文生视频,多了什么?
第一,是把“参考”当成一等输入。
H3支持最多9张图片作为参考, 支持最多3段视频作为参考, 支持最多3段音频作为参考, 文件总数最多为12个, 且能按它们之间的关系生成结果。对创作者来说, 这意味着, 你不必只说“一个女孩在海边说话”这种简单表述, 而是可以告诉它, 用这张角色图, 沿用这段运镜, 保留这段环境声, 再让人物说一句新的台词。
第二,是声音不再只是后期附件。
H3输出的是, 24帧率每秒的视频, 以及32千赫兹的双声道音频。当然, 它并不保证每一回口型、情绪以及音效都能够直接交付, 但是, 至少把那种“画面先生成、声音另起炉灶”的断点, 放进了一次推理任务当中。
第三,是它更像一个“多素材剪辑理解器”。
官方将这套能力称作Omni。把它翻译成人话就是, 模型不但得看懂每一个文件 , 还得判别“这张图属于角色设定 , 那段视频是动作参考 , 这条音频是氛围还是音色”。这种判别对于广告 、电商以及角色内容格外重要 , 因为它们最担忧的并非画面不够绚丽 , 而是品牌 、人物以及动作在历经多次修改之后走样。

添加图片注释,不超过 140 字(可选)
技术方面呢, H3进行了一次创新, 此次创新有着这样的情况, 该创新它的核心并非是把音频模型以及视频模型通过简单的方式给它串连起来。

添加图片注释,不超过 140 字(可选)
各自不同的文字, 差异明显的图片, 形式有别的视频, 特点各异的音频, 会先逐一分别进行编码, 随后再被有序整合成统一的别具一格的多模态序列, 接着被送进具有33B参数的H3 - Omni, 最后一起合力对视频和音频进行预测。并且它还使用一种特别的能够精准表明独特关系的三维位置编码去细致呈现时间、高度、宽度间的特定关联——是以模型方可确切知晓“第几秒、画面哪里、发生了什么”。
为了对长上下文加以处理, H3在进行训练之时运用了稀疏注意力, 然而官方也表明, 首版公开推理依旧是全注意力, 稀疏注意力的实现会在将来另行发布, 这便是为何本地部署不能仅仅考量“参数量33B”, 还得为序列长度、多参考素材以及音视频组件预留出余量, 另外还有其他的一些优点,诸如。
与其他视频生成模型相比较而言, H3具备特点既包含优势之处也存在劣势方面。全面进行审视的话, 2.5在综合能力上最为突出, Kling 3.0的优势体现在产品化以及视频控制这两点, H3的优势是多模态参考和视频编辑, 1.1走的则是性价比以及基础能力路线。
模型
优点
缺点
更适合
2.5
单次最长为 30 秒, 它支持多轮进行延长, 具备 4K 的条件, 最多能够塞进 50 个参考素材, 还支持时间戳控制、局部修改以及视角、运镜、动作参考, 并且剧情连续性方面表现很强。
能力越是复杂, 对于素材怎样去组织, 以及对于工作流有着怎样的要求, 就越高;强大的能力背后通常所意味着的是, 推理成本也不会低。
专业视频制作、广告、短剧、连续剧情、多镜头复杂生成
Kling 3.0 / Omni
具备角色一致性, 拥有人物参考,存在首尾帧, 多镜头成熟, 支持原生音频, 视频理解能力完整, 编辑能力也完整, 最长可延长至约 3 分钟, 产品生态成熟。
以主要的单次基础生成状况而言, 则仍是以3至15秒之间为主的;关于参考素材的数量方面, 其数量的情况是较少的;而很多被归属为高级的能力, 它们是分散于不同模式这个范畴之内的。
人物视频、动作控制、短剧、商业创作、现有视频二次编辑
H3
相较于01, 进步显著;支持图、视频、音频混合参考;有着原生立体声音频;具备V2V动作和运镜迁移;视频编辑以及文字/品牌元素生成颇具特色。
单次最长的时长大约是 15 秒 , 放到综合上限方面 , 还有长视频连续性这块 , 再加上复杂控制的情况 , 目前仍旧比不上 , 并且还缺失字节 , 或者说快手所拥有的那种天然视频数据生态。
参考视频迁移、广告素材、品牌内容、音视频联合生成
1.1
涵盖 T2V, 且涵盖 I2V , 还涵盖 R2V;对 1 至 9 张参考图予以支持;原生状态下使音视频联合生成;相较于 1.0 在动作方面、一致性方面、画质方面有着显著提升。
最高为1080p, 单次时长是3至15秒, 复杂编辑、长视频、参考素材规模以及控制粒度, 相较于前三者明显要弱些。
普通图生视频、人物参考、快速短视频生成
写在最后
要是你仅仅是想拥有一条偶尔能够呈现出惊艳之感的AI视频呢, 那么直接去运用在线产品通常来讲会更加省心一些。
然而, 要是你所从事的是品牌短片、电商、游戏角色、影视概念片这类工作任务, 手上原本就具备参考图、素材片段以及声音资产, 那么选择H3确实是挺好的, 这是由于它尝试着将“理解素材”与“生成镜头”合并到同一条链路当中。
实际去跑的时候, 可以先选取一个真实的小项目来进行测试的。去瞧瞧它的角色是不是能够保持稳定, 再者看看修改起来是不是返工的情况比较少, 还要瞅瞅画面以及声音能不能一同交付。这三项当中只要有两项明显变得更好了, 那它就不是玩具;要是每次作出改动都得重新抽取好多遍, 那么就算演示再怎么漂亮, 也仍旧还没有进入到生产力范畴。
MiniMax H3公开权重了:视频、声音、动作,终于能放进
制作AI视频目前面临工具分散、创作链路碎片化的问题。Mini...(137 )人阅读时间:2026-08-10
我花了54个小时,做了一个可能更公平的AI大模型排行榜
本周末,我创建了一个AI大模型排行榜,因其效果不错,决定免费...(160 )人阅读时间:2026-08-10
多位核心骨干离职,可灵AI的“内忧外患”
快手AI业务线核心骨干王鑫涛、王猛相继离职,不到一年内已损失...(140 )人阅读时间:2026-08-10
揭秘!Agent潜伏两个月联手作案,OpenAI还原安全事故
Hugging Face于7月16日报告安全事故,OpenA...(180 )人阅读时间:2026-08-10