请先查看下方配置要求,确认电脑能使用再下载,如果不知道什么是网盘、什么是压缩包以及什么是电脑配置,请勿下载

MiniMax H3 是一款通用型全模态(Omni-modal)生成系统,能够在统一模型框架下理解由文本、图片、视频和音频组成的多模态上下文,并直接生成带原生立体声音频的视频内容。模型最高支持 2K 分辨率、15 秒视频生成,并具备较强的复杂多模态指令理解与执行能力。
得益于面向任务泛化(Task Generalization)的系统设计,H3 在预训练阶段即建立了广泛的多模态理解与生成能力,不仅可以“理解多种模态”,还能够综合文字、视觉、声音等信息完成统一的视频与音频生成,实现从多模态输入理解到视听内容输出的一体化生成。
核心功能:
🧠 全模态上下文理解:统一理解文本、图片、视频、音频等多种输入信息
🎬 原生视频生成:支持 4–15 秒视频生成,覆盖短视频、广告、创意内容等场景
🔊 原生立体声音频:视频生成同时支持 32kHz Stereo Audio,实现音画一体化输出
🖥️ 最高 2K 视频生成:默认短边 768px,并可通过 H3-Regenerate-2K 实现 2K 生成
📐 灵活画幅适配:支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种比例
🎞️ 稳定视频规格:支持 24 FPS 输出,适配横屏、竖屏及社交媒体内容
🌍 多语言对白生成:稳定支持中文、英文、日语、韩语、法语、德语等 11 种语言
🎯 复杂指令遵循:能够综合多个模态信息理解复杂要求,并完成对应的视听内容生成
应用场景:
🎥 AI 短视频与广告内容生成
📱 抖音 / TikTok / Reels 等竖屏视频生产
🏠 房地产项目宣传、户型展示与空间漫游视频
🎬 影视预演、分镜转视频与创意概念验证
🛍️ 电商产品展示与营销视频
🎮 游戏 CG、角色演出与剧情短片
🧑💻 AI 数字人、虚拟角色及多语言内容
🖼️ 图片 / 分镜 / 参考视频驱动的视频创作
🔊 音画同步的视听内容生成
开源地址:https://github.com/MiniMax-AI/MiniMax-H3
☞☞☞☞☞☞ 右侧下载整合包 ☞☞☞☞☞☞
配置要求:
电脑需满足以下配置:
- 操作系统:Windows 10/11 64位
- 内存:建议32G以上
- 显卡:至少12G及以上显存的英伟达(NVIDIA)显卡
- CUDA:显卡支持的CUDA版本大于等于12.8版本(如不知道显卡支持的CUDA版本,可点击此链接查看:https://aiyy.info/supported-cuda-versions/)
- 整个包解压完加上模型约136G,要留足硬盘空间
如何查看显卡品牌型号和显存:
- 打开任务管理器
- 点击“性能”
- 点击“GPU”
- 右上角可以看到显卡型号,下方可以看到显存大小

使用教程:
① 打开下载页面(https://aiyy.info/minimax-h3/)点击页面右侧下载按钮(手机端在页面底部),下载整合包之后解压,建议使用winrar解压(解压软件在文件包中,或者可以自己下载安装,下载地址:https://www.winrar.com.cn/)
不要用Windows自带解压!!不要用360解压!!

注意:文件夹路径和文件名称(包括音频、图片、视频等文件名称)不要出现中文字符,否则部分软件会因识别不出而报错

② 双击“一键启动.bat”,稍等片刻会在浏览器中自动打开操作界面

③ 文件包中有文生视频和图生视频工作流,将所需工作流文件拖到操作界面中

④ 文生视频:输入提示词,参考下方表格中的参数调整视频宽高,设置视频长度(默认生成的是10秒时长视频),最后点击“运行”即可

⑤ 图生视频:先上传图片,然后输入提示词,参考下方表格中的参数调整视频宽高,设置视频长度(默认生成的是5秒时长视频),最后点击“运行”即可

⑥ 在文件包中的“\ComfyUI\output”文件夹中能找到生成结果
