上个月 MiniMax 刚用 M3 在文本模型上刷了一波存在感,今天 H3 来了——一款全模态生成模型,而且承诺几天内开源权重。 先看能力边界。H3 接受文本、图像、视频、声音任意组合作为输入(它叫多模态上下文),输出带原生双声道音频的视频,最高 15 秒 2K 分辨率。举个例子:扔进去一段参考视频(取它的希区柯克运镜)、一...
Full article body is being fetched in the background. Refresh in a moment to see the complete paragraphs. For now this page shows a summary and AI analysis.
