资讯详情

资讯详情

OpenMontage 音乐技能实战:用 ACE-Step 1.5 生成视频 BGM、人声歌曲与分轨(Stem)

OpenMontage 音乐技能实战用 ACE-Step 1.5 生成视频 BGM、人声歌曲与分轨Stem【免费下载链接】OpenMontageWorlds first open-source, agentic video production system. 12 production pipelines, 100 tools, 700 agent skill and production-knowledge files. Turn your AI coding assistant into a full video production studio.项目地址: https://gitcode.com/GitHub_Trending/op/OpenMontage本文为 OpenMontage 音频技能体系中acestep技能Agent Skill的深度解读。该技能文档定义了基于开源模型 ACE-Step 1.5 的完整音乐生成工作流——覆盖纯器乐 BGM、带歌词的完整歌曲、参考曲翻唱/风格迁移与干声分轨并给出了面向视频制作的场景预设、提示词工程方法与音画合成规范。读完本文你可以直接在 OpenMontage 的 Agent 工作流中复现这些命令理解其参数约束与工程边界并弄清它与仓库中其他音乐生成工具ComfyUI 本地推理、ElevenLabs API的关系。技能定位Agent Skill 而非独立 CLI.claude/skills/acestep/SKILL.md是一份标准的 Agent Skill 文件YAML frontmatter 声明了name: acestep与触发条件background music、soundtrack、jingle、stem extraction、cover、style transfer 等任务关键词正文则是 Agent 执行音乐任务时遵循的操作手册。技能文档自述基于 MIT 许可的开源音乐生成模型 ACE-Step 1.5通过tools/music_gen.py封装推理托管在 RunPod serverless 上.env中需要配置RUNPOD_API_KEY与RUNPOD_ACESTEP_ENDPOINT_ID两个环境变量首次可通过--setup参数创建 RunPod 端点。从仓库结构看acestep在 skills/INDEX.md 的技能目录中被归入 Infrastructure基础设施类别并在 AGENT_GUIDE.md 的音频技能清单中与music、sound-effects等并列说明它服务于整条视频生产流水线的配乐环节而不是孤立工具。需要注意适用前提技能文档中的命令入口tools/music_gen.py是技能定义指向的 CLI 形态源自其上游视频工具包以当前仓库实际存在的源码为准可直接调用的 ACE-Step 推理入口是 ComfyUI 本地后端comfyui_music详见文末仓库中的 ACE-Step 证据链一节而music_gen工具名在仓库中对应的是 ElevenLabs API 版实现 tools/audio/music_gen.py。快速参考一条命令完成常见任务技能文档给出的 Quick Reference 覆盖了全部八种典型用法以下完整继承并按用途分组基础生成与音乐控制# 基础生成 python tools/music_gen.py --prompt Upbeat tech corporate --duration 60 --output bg.mp3 # 带音乐参数控制BPM / 调性 python tools/music_gen.py --prompt Calm ambient piano --duration 30 --bpm 72 --key D Major --output ambient.mp3场景预设面向视频制作python tools/music_gen.py --preset corporate-bg --duration 60 --output bg.mp3 python tools/music_gen.py --preset tension --duration 20 --output problem.mp3 python tools/music_gen.py --preset cta --brand digital-samba --duration 15 --output cta.mp3人声与歌词# 带歌词的 Jingle python tools/music_gen.py --prompt Indie pop jingle --lyrics [verse]\nBuild it better\nShip it faster --duration 30 --output jingle.mp3翻唱/风格迁移与分轨# Cover / style transfer python tools/music_gen.py --cover --reference theme.mp3 --prompt Jazz piano version --duration 60 --output jazz_cover.mp3 # Stem extraction python tools/music_gen.py --extract vocals --input mixed.mp3 --output vocals.mp3 # 列出全部预设 python tools/music_gen.py --list-presets场景预设为视频叙事节奏预置的音乐参数技能内置了 8 个场景预设每个预设锁定 BPM 与调性直接对齐视频叙事段落的情绪曲线。完整预设表如下PresetBPMKey适用场景corporate-bg110C Major专业感背景音、演示类内容upbeat-tech128G Major产品发布、技术演示ambient72D Major概览页、反思性内容dramatic90D Minor揭幕、重大宣告tension85A Minor问题陈述、挑战桥段hopeful120C Major方案揭晓、释然时刻cta135E Major行动号召、收尾高能量段落lofi85F Major屏幕录制、编码演示预设本质上是caption BPM Key的打包配合--duration即可让配乐与镜头时长严格对齐。创建一首歌三种实战路径路径一纯器乐背景音最简单python tools/music_gen.py --prompt Upbeat indie rock, driving drums, jangly guitar --duration 60 --bpm 120 --key G Major --output track.mp3路径二带人声与歌词的完整歌曲技能推荐将长歌词先写入临时文件再用$(cat ...)注入并用结构标签structure tags控制歌曲段落。完整示例# 先把歌词写入文件长歌曲推荐做法 cat /tmp/lyrics.txt LYRICS [Verse 1] Walking through the morning light Coffee in my hand feels right Another day to build and dream Nothings ever what it seems [Chorus - anthemic] WE KEEP MOVING FORWARD Through the noise and doubt We keep moving forward Thats what its about [Verse 2] Screens are glowing late at night Shipping code until its right The deadlines close but so are we Almost there, just wait and see [Chorus - bigger] WE KEEP MOVING FORWARD Through the noise and doubt We keep moving forward Thats what its about [Outro - fade] (Moving forward...) LYRICS # 生成歌曲 python tools/music_gen.py \ --prompt Upbeat indie rock anthem, male vocal, driving drums, electric guitar, studio polish \ --lyrics $(cat /tmp/lyrics.txt) \ --duration 60 \ --bpm 128 \ --key G Major \ --output my_song.mp3路径三视频场景直接用预设python tools/music_gen.py --preset tension --duration 20 --output problem_scene.mp3出好结果的关键技巧技能文档总结的七条经验法则直接继承无删减Caption 整体风格流派、乐器、情绪、制作质感Lyrics 时间结构主歌/副歌走向、人声演绎方式歌词全大写 高能量人声括号 和声/背景人声We rise (together)每行保持 6–10 个音节以获得自然节奏不要在 caption 里描述旋律——描述的是声音与感觉迭代调参时用--seed锁定随机性只改变 prompt/lyrics任务类型六种能力的边界技能定义了 6 种任务类型其中 3 种可用、3 种为规划中的能力任务状态说明text2music默认文本 prompt 可选歌词生成音乐cover可用参考音频风格迁移--cover-strength控制混合度extract可用干声/分轨分离repaint规划中在保留其余部分的前提下重生成音频的某时间段lego规划中需 base model在既有音频上下文中生成单独乐器轨complete规划中需 base model为不完整编曲补全指定乐器cover 的强度参数--cover-strength取值 0.0–1.00.2是宽松的风格启发创作自由度高0.5均衡迁移0.7贴近原曲结构默认值1.0最高保真度。extract 支持的分轨共 10 种vocals、drums、bass、guitar、piano、keyboard、strings、brass、woodwinds、other。提示词工程Caption 的分层写法分层维度技能主张用多维度叠加来写 caption而不是单个形容词。可用的维度流派/风格pop、rock、jazz、electronic、lo-fi、synthwave、orchestral情绪melancholic、euphoric、dreamy、nostalgic、intimate、tense乐器acoustic guitar、synth pads、808 drums、strings、brass、piano音色Timbrewarm、crisp、airy、punchy、lush、polished、raw年代感80s synth-pop、modern indie、classical romantic制作方式lo-fi、studio-polished、live recording、cinematic人声breathy、powerful、falsetto、raspy、spoken word或 instrumental对比示例技能原文好Slow melancholic piano ballad with intimate female vocal, warm strings building to powerful chorus, studio-polished production差Sad song五条核心原则具体胜于含糊——写出乐器、情绪、制作风格避免自相矛盾——不要同时要求 classical strings 和 hardcore metal重复即强调——重要元素重复出现可提升优先级稀疏 caption 更多创作自由——描述越细模型越被约束BPM/调性走元数据参数——不要写 120 BPM 进 caption用--bpm 120。歌词排版语法结构标签写在歌词里不写在 caption 里[Intro] / [Verse] / [Chorus] / [Bridge] / [Outro] [Instrumental] / [Guitar Solo] / [Build] / [Drop] / [Breakdown]人声控制前缀修饰某行或某段[raspy vocal] / [whispered] / [falsetto] [powerful belting] / [harmonies] / [ad-lib]能量标记全大写 高强度WE RISE ABOVE括号 背景人声We rise (together)段落内每行保持 6–10 音节。完整示例——科技产品 Jingle[Verse] Build it better, ship it faster Every feature tells a story [Chorus - anthemic] THIS IS YOUR PLATFORM Your vision, your stage Digital Samba, every page [Outro - fade] (Build it better...)视频制作集成配乐、混音与品牌一致性按场景类型选曲技能给出了与叙事段落一一对应的配乐方案表完整继承场景预设时长备注Titledramatic或ambient3–5s短促、定调Problemtension10–15s阴暗、不安Solutionhopeful10–15s释然、乐观Demolofi或corporate-bg30–120s不抢戏时长匹配演示内容Statsupbeat-tech8–12s建立可信度CTActa5–10s最高能量、干脆有力Creditsambient5–10s轻柔收尾淡出时长对齐工作流先从配音脚本规划各场景时长用--duration 场景秒数生成匹配长度的音乐技能声明生成时长精确与请求值误差在 0.1s 内需要跨多个场景的连续 BGM 时一次性生成长曲目。与人声旁白混音在 Remotion 合成中背景音乐建议压到 10–20% 音量Audio src{staticFile(voiceover.mp3)} volume{1} / Audio src{staticFile(bg-music.mp3)} volume{0.15} /规则旁白之下用纯器乐预设corporate-bg、ambient、lofi音乐主导型场景Title、CTA可以提高音量甚至使用带人声版本。这一器乐优先的约束在仓库的 skills/creative/music-gen-usage.md 与 tools/audio/music_gen.py 中同样被强制force_instrumental默认True是整个项目音频技能的一致口径。品牌一致性--brand name从brands/name/brand.json加载品牌音乐提示--cover --reference brand_theme.mp3以品牌主题曲为参考做变体保持声音身份跨项目统一音色固定--seed 42只变动时长/prompt。技术细节与禁用边界技能声明的技术参数完整继承输出格式48kHz MP3/WAV/FLAC时长范围10–600 秒BPM 范围30–300推理耗时GPU 上 turbo 模式约 2–3s8 步Mac MPS 约 40–60sTurbo 模型8 步采样、无需 CFG速度快且质量良好Shift 参数turbo 下推荐 3.0可改善质量。什么时候不要用 ACE-Step技能明确划出的四条边界声音克隆——应使用 Qwen3-TTS 或 ElevenLabs音效SFX——应使用 ElevenLabs SFX语音/旁白——用 TTS 类工具不要用音乐生成从视频直接分轨——先用 FFmpeg 抽出音轨再走--extract。仓库中的 ACE-Step 证据链本地 ComfyUI 推理路径技能文档描述的是 RunPod 托管形态而当前仓库源码中ACE-Step 的实体落在 ComfyUI 本地推理路径上可互为印证工具实现tools/audio/comfyui_music.py 定义了ComfyUIMusic工具capability music_generation、provider comfyui、determinism SEEDED支持seed/lyrics/离线运行。它默认加载内置工作流ace-step-1-t2a.json并把输入参数逐节点注入prompt → 节点2的tagslyrics/lyrics_strength默认 0.99→ 节点2duration_seconds→ 节点4的secondsseed/steps默认 50/cfg默认 5.0→ 节点8输出文件名 → 节点10。这与技能文档中caption 描述风格、结构标签进歌词、seed 锁定随机性的语义完全同构。工作流模板tools/_comfyui/workflows/ace-step-1-t2a.json 基于 ComfyUI 核心原生节点TextEncodeAceStepAudio与EmptyAceStepLatentAudio构建不需要第三方节点包tools/_comfyui/metadata.py 声明了该工作流所需的检查点ace_step_v1_3.5b.safetensors及下载位置。设计文档docs/comfyui-adapter-plan.md 说明 ACE-Step 选择走 ComfyUI 的原因diffusers 生态在部分新硬件上不可用并明确该工具面向 ACE-Step v1ACE-Step 1.5 可通过workflow_json/workflow_path自定义工作流方式接入自定义工作流必须提供output_node。契约测试tests/contracts/test_comfyui_tools.py 验证了内置路径无需自定义工作流、缺模型时返回含下载 URL 的结构化错误、以及 prompt/lyrics/duration/seed 确实被正确 patch 进工作流等断言。选型关系comfyui_music的fallback_tools声明为[suno_music, music_gen]——本地 ComfyUI 不可用时回退到其他音乐工具说明 ACE-Step本地/RunPod与 ElevenLabs API 在工具选择器中是同一music_generation能力下的并列/互备 provider。可以推断技能文档面向云端 RunPod 上的 ACE-Step 1.5仓库源码面向本地/自托管 ComfyUI 上的 ACE-Step v1 并可扩展 1.5两者共享同一套 ACE-Step 提示词方法论tags/lyrics/结构标签/seed技能中沉淀的 caption 分层与歌词排版规则对两条路径都适用。适用前提与限制小结运行 ACE-Step 技能需要配置RUNPOD_API_KEY与RUNPOD_ACESTEP_ENDPOINT_ID首次可执行--setup创建端点技能文档声明参数硬边界时长 10–600s、BPM 30–300、输出 48kHzrepaint/lego/complete目前为规划能力不可当作可用功能引用音乐生成不覆盖声音克隆、音效与旁白——这些属于仓库内其他音频技能TTS、SFX的职责范围仓库当前实际代码路径以 ComfyUI 版comfyui_musicACE-Step v1 内置工作流为准技能文档中的tools/music_gen.pyCLI 参数集预设、brand、extract、cover-strength是该技能定义的能力面引用时应以技能文档声明为前提。【免费下载链接】OpenMontageWorlds first open-source, agentic video production system. 12 production pipelines, 100 tools, 700 agent skill and production-knowledge files. Turn your AI coding assistant into a full video production studio.项目地址: https://gitcode.com/GitHub_Trending/op/OpenMontage创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →