
周末不卷,随便写点。

在这一个星期, 我笃定它绝对堪称视频生成范畴内最为疯狂的七天了, 我自身还疯狂地钻研了各类与视频生成存在关联的众多知识以及众多技巧。
恰好就在前两天的时候, 看到那样的情况, 处于在上面举办了一场AMA, 也就是所谓的Ask Me啦。
社区当中的用户, 能够朝着开发者去询问, 关于自身感兴趣的, 任意的话题, 其中存在着一些, 称得上还蛮关键的信息, 这些同样是大家极有可能会关心的问题, 鉴于此, 我干脆做了一些整理, 用来给大家进行分享。

一个比较先吸引我的问题是,看到有网友问
“ 以后的模型还会开源吗?”

的开发者关系负责人Ryan的回复是:
“当然了!会保持开放直到AGI到来”
那就是说这一点, 我们起码还能够期望, 给我们带来更多更优质的开源模型。
OKK,我们言归正传来。
关于H3生成的一个问题是,
参考生视频模式相比于图生视频模式画质更差一些?!

就我自身来讲, 于使用H3这部设备在初始时段, 采用参考生视频模式时, 所呈现出的画面效果, 并未达至心中所预想那般的良好程度, 此一状况实则已被我察觉出来了。
而的研究员Nero给出的解释是,
这一现象的确实际是存有在那儿的, 他们当前正处于努力去提升参考的考生所对应的视频这样事物的质量的状态之中, 呐。
出现这种画质相差很多的原因是后训练的策略不同。
图生视频是一个检查点, 参考生视频是另一个检查点, 二者本身不同, 且呈现出不一样的视觉倾向。
此之外, Nero还分享了一项小窍门, 那便是投入利用以最高质量水准进行的参考输入, 用其来展开参考生视频的相关操作。这完全是鉴于该模式本身对于参考条件的质量敏感度极高所能得出的结论。
网友还关心的一个问题是,
最终用于生成2K分辨率的那个模型会发布吗?

的开发者关系负责人Ryan表示
虽然还没有确认日期,但是确认会发布。
这里我稍微给不太了解的小伙伴补充一下上下文细节:
我们之前于官网所运用的版本, 是具备做出2K分辨率片子的能力的, 然而, 在开源的版本当中, 目前是尚不可以的。
而把分辨率提升到2K的效果,采用的也不是传统的超分办法。
可能超分这个词还是有点专业,我举个简单的例子来说一下。
假如我们现在画了一幅画。
我们采取传统办法对这幅画进行放大, 去查看其细微部分, 若无法看出细微部分相关情况, 那么就依据些情况进行推测。
放大器注视着呈现768p像素的画面, 将其放大至2K, 在放大的过程中不断揣测细节究竟是什么后予以补充。
这么做有个问题,就是,
它仅仅能够在原先的底子上进行补补修修的举动。要是原先的画面存在出差错的状况, 那么你经过超分而得出的具备高分辨率的画面依旧是处于错误的情形。
但是这里做了一个不一样的是,
它们最后生成2K的这个操作是通过重新生成得来的。
在处于生成2K的这个阶段之中,会将第一阶段所生成的草稿图视作参考上下文, 接着在2K分辨率的情形下, 自开头起完整地跑一遍生成过程。

对于2K重生成的这个模型, 大家的关注度, 我看下来, 其实是最高的, 研究员Kiro补充了一些细节, 这个2K重生成模型, 是一个专门用于潜空间的DiT模型。
这两个方法存在着核心区别, 超分是进行放大并且猜测细节, 重生成则是重新创作一回, 重生成做出来的细节会更具合理性、真实性, 甚至还会将第一阶段生成的微小瑕疵予以修补掉。
还有一个比较有意思的问题是,
有网友问,H3的稀疏注意力是否是沿用了M3的那一套?

Kiro 对此的回答是,
H3的稀疏注意力, 没有采用M3的MSA那种架构, 而是更接近于MoBA的设计, 是这样的情况。
那或许存在的一些朋友并非格外清楚到底啥是稀疏注意力, H3的设计究为何种样子。
我简单解释一下这是在干嘛。
实际上, 不管情形是视频生成, 还是我们平常单纯进行文本输出这般, 极其消耗算力的部分实际上就是注意力计算。
将一段时长为15秒的视频进行切分, 会得到数量众多的token, , 平常情况下, 每个token都要与其余所有token进行矩阵运算, , 这里存在一个问题, 即序列一旦变长, 计算量便会急剧增加, 出现飙升式的增长。
在那稀疏注意力的思路里头, 情况变为, 鉴于所有的token彼此之间去做矩阵运算极易出现爆炸的状况, 于是便采取这样的做法, 我干脆就不让这些token全都相互去做运算了。
我会先把那些token加以打包形成块, 先大致快速看一下, 针对每个块的摘要, 接着挑出重要的部分去做运算, 对不重要的直接越过。
那H3的巧思就在于挑选块的方式上。
根据Kiro 的回复来看,
他们察觉到, 视频之中相邻的两个画面内容, 原本就具备高度的相似性, 因而, 每个小块直接采用求取平均值的方式来当作概要, 便已然足够, 如此一来, 便直接节省下了一整套需要进行学习的索引器。
与此同时, 他们也提及, 当下仅仅针对视频token实行了稀疏化处理, 这些视频token占据了整个序列的绝大部分份量。此外, 他们预估在不怎么远的未来会推出一个相对较为保守的版本。
一个较受网友关心的问题是, 官方会不会去考虑推出那速度更快的、步数低一些的版本呢。

对此的回应是,
当下的这一版本, 事实上在原本的基础上已然自身具备了一定程度的加速效果。当然了, 它并非是专门针对那种通过舍弃可接受水平的画质去换取快速推理的一个模型的。
官方只说了在积极考虑低步数的版本,但是没有做出具体的承诺。
存在这样一种情况, 在这里, 比较有意思的是, 尽管官方并未做出具体的承诺, 然而社区当中确实已经有人做出了4步的模型变体, 其情况属实。

有一个名为的团队, 做出了一个快速版本, 我是在上面看到的, 然而这个版本的效果呀, 确切来讲真的不怎么样, 速度方面尽管快, 但是画质却降低了, 音频也会出现崩坏情形。
所以官方也说了目前还只是在探索低步数的版本。
还有一个点我觉得值得关注的是
确实打算推出一个图像生成模型!

具备文生图、图片编辑等功能的这个图像生成模型, 与H3采用同一基座, 是个统一模型, 现阶段仍处于后训练优化阶段。
还有一个大家反馈比较多的问题是,
人物一到远景就容易糊。

有网友察觉到了这个问题, 哪怕是在达到25步的情形这下, 也存在视频画面里远景中的事物比较有容易出现像素化这种现象。
所以, 他询问, 最值得推荐的配置生成参数, 究竟应当是什么样子的呢? 抑或是说, 这便是H3的问题了。
我感觉, 有个称得上好的方面在于, 的确并不存在隐瞒不说的情况, 而是直接予以表明, 这属于当下已经知晓的模型问题, 并且会坚持不懈地进行调查, 以此来弄清楚究竟是何种缘由所导致产生的。
现当下所呈现出来的状况, 表明是源于系统层面那儿, 其具备复杂性这个特点, 并且还将多个模型以及训练管道牵扯在内。我们能够等待后续阶段展开的更新优化之举。
还有一个,也是我自己在测试的时候体会到的一点是,
这代H3明显非常的遵守指令。
有网友同样提出了类似的见解, 并且向官方发问, 究竟是哪一个部分贡献的程度最为突出呢。

官方的回答感觉有一种大道至简的感觉。
实际而言, 很难确切界定究竟是哪一个具体部分, 然而整个关键本质无非就是去搭建具有充分多样性、足够广泛的数据集, 运用通用的架构, 去除那些无法有效实现扩展的事物。
也就是说,遵循指令只不过就是一个自然而然涌现的结果。
H3 首要目标是, 自 历经种种, 达成理解由各异模态所构成上下文, 进而凭此在每一项不同任务当中, 皆可展现十分出色泛化表现。于实际呈现的状况而言, 我个人判定这套方法论切实产生效用了。
最后还有一个比较打动我的问题是,
有网友进行了询问,在H3的研发进程当中, 是哪一个实验使得团队对于视频模型到底于学习些什么的已有认知产生了改变。

Nero 回答的非常真诚。
一个模型, 仅仅被训练做给首帧加入文字描述从而去预测尾帧, 竟然能够在一堆图像编辑方面达到相当不错的零射击成绩。
这说明模型是已经学会了举一反三。
这给予了他们极大信心, 凭借自然语言指令引导的上下文学习, 在不同任务上均能有特别出色的泛化表现, 朝着此方向持续迈进, 极具前途。
整个AMA看下来,我其实就一个感受,
它的开放是郑重其事的, 并非仅仅是单纯地将模型权重予以开源, 而且还能够切实有效地把社区的反馈纳入到那模型迭代的进程当中。
这其实是我觉得开源模型生态里非常重要的一点,
源起于一个开源模型所具备的真正生命力 , 并非仅是发布当日呈现出的惊艳之处 , 它还会步入一个持续进行迭代的循环之中 , 此循环为:
研究开发的人发布了模型, 社区开展关于它的测试, 使用的用户提出自身遇到的疑难问题, 研究组成员吸收这些反馈, 而后促使下一个版本持续进行进化。
这个过程某种程度上,比单纯追求某一次上的成绩更加重要。
我们尚不明确最终将会呈现出怎样形态的视频模型, 然而, 至少于H3其上, 我们目睹了一条极具趣味的路线:
让模型尝试着真正理解这个多模态的世界。
5万美元的导盲犬,要被2000美元的开源机器狗顶替了?
机器导盲犬研发成本高昂,传统方案存在局限性,如依赖GPS、需...(104 )人阅读时间:2026-08-10
MiniMax团队AMA揭秘:H3为何如此出色?!
本周视频生成领域非常活跃,MiniMax的AMA中透露关键信...(59 )人阅读时间:2026-08-10
“没人看消费硬件了”
去年消费硬件备受追捧,但今年热度骤降,大疆高管创业也难融资。...(69 )人阅读时间:2026-08-10
马斯克要让Cursor“消失”了
Cursor 正被 SpaceX 收购,预计下周末完成。收购...(102 )人阅读时间:2026-08-10