MiniMax发布全模态生成模型H3,一个模型包办图片、视频和声音

快链头条 2026-07-31 10:27:40
阅读 5,454
二维码
微信扫一扫,分享此文章

据动察 Beating 监测,MiniMax 发布全模态生成模型 H3。它能同时理解文字、图片、视频和声音,再按一条自然语言指令生成或编辑视频。

用户可以让 H3 照着一段视频学镜头运动,使用另一张图中的人物,再参考第三段音频的声音。过去需要分别调用的动作迁移、人物参考、声音参考和视频编辑,现在可以放进同一次任务。

H3 最长可生成 15 秒视频,支持 2K 分辨率和原生双声道声音。官方 API 的 2K 价格为每秒 0.13 美元,生成一段 15 秒视频约需 1.95 美元;768P 每秒 0.09 美元。

一次任务最多可输入 9 张图片、3 段视频和 3 段音频,总数不能超过 12 个文件。

MiniMax 计划未来几天开放模型权重。官方尚未公布与 Seedance、Veo 等模型的统一评测。

快链头条登载此文本着传递更多信息的缘由,并不代表赞同其观点或证实其描述。
文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
投资有风险,入市须谨慎。本资讯不作为投资理财建议。

风险提示
根据银保监会等五部门于 2018 年 8月发布《关于防范以「虚拟货币」「区块链」名义进行非法集资的风险提示》的文件, 请广大公众理性看待区块链,不要盲目相信天花乱坠的承诺,树立正确的货币观念和投资理念,切实提高风险意识;对发现的违法犯罪线索,可积极向有关部门举报反映。