歌词时间数据
使用可选可信转录或已有对齐歌词。
歌词应该由合成器负责
先导演电影、动漫或抽象画面,再在最终合成阶段添加准确文字,而不是要求视频模型正确拼写歌词。
歌词时间轴 · 文字安全画面 · ASS 排版 · 多语言字体
MiniMaxMusic Studio 是独立第三方服务,并非 MiniMax 官方网站。
选择本站生成的歌曲,或上传有权使用的 MP3/WAV。
选择 15 秒或 30 秒高潮片段、输出比例和视觉方向。
在提交任何 H3 任务之前,生成并修改可版本化分镜。
添加已校验参考图片,并批准不可篡改的服务端报价。
逐镜头生成 H3 视频、私有审核,仅重做确实需要修改的镜头。
使用原始歌曲作为唯一主音轨,合成 H.264/AAC MP4。
生成视频可能产生类似文字的形状,但不应该成为准确歌词的权威。工作室会明确要求 H3 不在镜头中烧录字幕、Logo、水印、UI 或歌词。
歌词时间轴会转换为选定音乐范围的相对时间,再由最终 FFmpeg 合成器使用 ASS 样式渲染,保证拼写、时间、字体、对比、多语言字形和位置一致。
使用可选可信转录或已有对齐歌词。
选择为文字保留负空间的模板。
合成镜像包含 Noto CJK,支持中文和混合语言。
标题、歌词和水印保留为可配置最终层。
这种分离让文字更可靠,也让创意修改更灵活。
在 15 秒预告突出一句有传播力的歌词。
利用 9:16 负空间发布 Reels、Shorts 或 TikTok。
以统一排版渲染混合语言时间轴。
组合低复杂度封面运动和准确文字。
不是。H3 生成视觉镜头,最终合成器根据结构化时间数据渲染准确歌词。
你需要选择音乐片段、生成可版本化分镜、修改每个镜头、添加已校验参考图片、批准分镜并获取服务端报价。仅上传歌曲不会自动启动 H3。
成功保存到私有存储的 H3 镜头会由独立 FFmpeg 合成服务标准化并拼接。H3 音轨会被忽略,原始歌曲的选定片段是唯一主音轨。
首批生产格式是 15 秒预告和 30 秒社交短片,支持 16:9、9:16 和 1:1。项目架构以后可以增加更长格式,而不是把整条视频当成一个不可见的生成任务。