- Python 74.5%
- HTML 21.6%
- PowerShell 2.4%
- JavaScript 1.3%
- Batchfile 0.2%
|
|
||
|---|---|---|
| assets | ||
| client-win | ||
| docs | ||
| evaluation | ||
| local-installer | ||
| musagent | ||
| scripts | ||
| showcase | ||
| tests | ||
| .gitattributes | ||
| .gitignore | ||
| CONTEXT.md | ||
| PRD.md | ||
| QUICKSTART.md | ||
| README-给朋友.md | ||
| README.md | ||
| requirements-diffrhythm.txt | ||
| requirements-old.txt | ||
| 启动-新网页-8000.bat | ||
| 启动-生成网页-7860.bat | ||
| 自检报告-20260810.md | ||
MusAgent v2.0 · 音乐工坊 —— AI 纯音乐创作智能体
AI+ 应用项目提案(Specs · v2 现状版)
参赛赛道:AIGC 技术赛道 · 音乐大模型子赛道 参赛方向:方向一 · 研发 AI 智能体工具 版本:v2.0 · 2026-08-02(Wave 2 提交口径 2026-08-13 刷新;v1 提案见旧仓库档案,重新立项依据见 docs/立项书-v2.0.md)
文档导航:上手使用 QUICKSTART.md | 领域语言唯一事实源 CONTEXT.md | 决策记录 docs/adr/ | 进度快照 docs/进度快照-2026-08-02.md | v1→v2 进步史 docs/v1-v2-进步史.md | 原创性自证(双层查重零疑似,报告在 B 机
outputs/submission-pack/,未入库)
评审导航:提交要求对照表
| 比赛要求(方向一) | 本仓库位置 | 状态 |
|---|---|---|
| 需求描述 | 一、项目概述 | ✅ |
| 目标用户 | 1.3 | ✅ |
| 核心功能 | 三、核心业务逻辑 + 四、产品需求规格 | ✅ |
| 评测方法 | 五、评测标准 + 20 场景测试集 + 盲听设计(ADR-0008/0010) | ✅ 已实测 |
| 本轮验证的关键能力 | 九、项目进展:引擎定型/编排器/机器耳朵/盲听 全部实测收官 | ✅ |
| 工具集 | musagent/tools/ + musagent/engines/(契约隔离,换引擎不动管线) |
✅ |
| 流程图 | 3.1 系统架构 / 3.2 核心业务流程 | ✅ |
| 逐轮迭代计划 | docs/adr/ 十条 ADR + 各轮听判记录(决策留痕即迭代史) | ✅ |
| 演示证据 | 同题盲测 6 卡 81.7%(剔低辨别力卡 88%,结果档案)+ 大脑决策留痕直出(showcase/index.html);20 首定格成品与提交包在 B 机 outputs/(音频体积原因未入库,可按赛事要求补传) |
✅ |
| 演示视频 | v2.1 全流程实录(4 分 33 秒):一句话 → 对话式生成 → 五星制候选 → 拍板交付(2560×1600 原画含系统音,Release 附件可直接下载) | ✅ 2026-08-31 |
| M1 端到端成功率 ≥70%(20 条全量) | M1 收官批次 20/20 端到端打通(2026-07-28);20 场景定格五格全满贯、人评 83–90(进度快照) | ✅ 已达成 |
| 对话式交互界面 | ✅ 全交付:对话式网页「音乐工坊」(web_api/ :8000 + 管理台 :8010,N 抽+用户拍板流程)· Gradio 版(musagent/ui/app.py :7860)· 物料包(musagent/tools/release_pack.py)· 展示页(showcase/index.html) |
✅ |
一、项目概述
1.1 项目定位
MusAgent(音乐工坊)是一款 AI 智能体工具:输入一句话(情绪/场景/主题),输出一首通过客观质检、可发布的原创纯音乐单曲。
v2 与 v1 的本质区别:v1 名为 Agent 实为固定脚本链+写死决策树;v2 把失败归因交给 LLM 推理——编排器读多维质检报告后自主决定"改 prompt 还是换 seed",每步推理留痕。质量目标从单一 CLAP 阈值(v1 锚错的指标)改为"硬指标入场券 + 结构指标 + 机器评审团 + 人评盲听"的多维权衡。
核心价值主张(不变):
- 把 AI 音乐从"黑盒抽卡"变成"工程化创作"——生成可控、质量可测、失败可迭代、成果可交付
- 每条产出自带质检报告与决策日志,"好/坏"有客观依据,过程可审计
1.2 要解决的创作问题(v2 实测回答)
| 痛点 | v2 对策 | 证据 |
|---|---|---|
| 生成不可控 | 五风格格体系(签名=音阶/律动/织体/音色)+ 配方工程铁律(稀疏标签/乐器排他/BPM 锁) | 20 场景定格人评 83–90 分 |
| 质量不可测 | 硬指标 + 结构指标 + 机器评审团 6 检测器,阈值全经真实听判校准 | ADR-0001~0004 校准证据链 |
| 失败不可归因 | LLM 编排器读指标复盘,decision_log 全程留痕 | m1-batch 20/20 端到端 |
| 说 AI 生成就是抽卡 | 同题配对盲听:同引擎裸跑基线对打,唯一变量=Agent 管线 | 5 卡合计 83% 偏好率 |
1.3 目标用户
| 优先级 | 用户群体 | 痛点需求 | 使用场景 |
|---|---|---|---|
| ⭐ 首要 | 短视频/自媒体创作者(无乐理基础) | 说人话就能出 BGM、质量稳定、无版权风险 | 视频原创配乐、账号主题曲 |
| 次要 | 独立音乐人 | 灵感验证成本高 | 情绪动机 → 可听 demo |
| 次要 | AIGC 爱好者/内容玩家 | 快、好玩、可晒 | 热点场景配乐 |
二、应用场景
2.1 短视频原创 BGM(主场景)
输入"海边告别的黄昏,钢琴独奏,克制一点",MusAgent 输出 95 秒过检纯音乐:响度 -14 LUFS 流媒体标准、无削波、无静默事故、经机器耳朵与人工双重听判。95 秒时长覆盖主流短视频配乐需求(赛事无时长要求已确认;120–240s 中间时长攻关在路线图)。
2.2 独立音乐人灵感验证
风格格配方 + seed 记录全留档,同一灵感可复现、可换 seed 再抽、可换格对照——"感觉"被翻译成工程参数,demo 成本从数天降到分钟级。
2.3 内容玩家快速产出
端到端单首生成约 17 秒(RTX 5060 Laptop,DiffRhythm v1.2 直出),加质检一分钟级;热点窗口内可大量试错。
三、核心业务逻辑
3.1 系统架构(真 Agent)
用户一句话
│
▼
┌──────────────────────────────────────────────┐
│ LLM 编排器(v2 的灵魂:失败归因=LLM 推理) │
│ · 意图 → 风格格匹配 + 英文生成 prompt 草拟 │
│ · 生成 → 读硬指标/结构指标/评审团报告 │
│ · 自主归因决策:换 prompt / 换 seed / 接受 │
│ · ≤3 轮自限;decision_log(JSONL)逐步留痕 │
└──────┬───────────────────────────────────────┘
│ 调用
▼
┌──────────────────────────────────────────────┐
│ 确定性工具集(musagent/tools/) │
│ audio_probe · loudness_fix · structure_metrics│
│ ear_jury(机器评审团 6 检测器)· clap_score │
│ ending_fix(尾奏手术)· fingerprint/CLAP 查重 │
├──────────────────────────────────────────────┤
│ 引擎层(engines/base.py 契约隔离) │
│ DiffRhythm v1.2(唯一主力引擎)· │
│ MusicGen(兜底;ACE-Step 备胎 2026-08-03 已砍) │
└──────────────────────────────────────────────┘
3.2 核心业务流程(实测形态)
一句话 → 大脑草稿(风格格+稀疏 prompt,铁律见 loop.py 系统提示词)
→ 生成(95s 整曲直出,~17s/首)
→ 门槛:结构指标(copy%/unique,分格豁免)+ 评审团(尾寂/静默缝/高频,分格强制)
→ 不过 → 大脑复盘:retry_prompt 或 retry_seed(≤3 轮,决策留痕)
→ 过 → 人工听判终审(人评是唯一定格途径,ADR-0004)
→ loudness_fix 归一 → 硬指标终检 → 交付
诚实声明(自治程度):当前管线为"编排器自治迭代 + 人工终审拍板"的半自动形态。人工拍板不是缺陷而是设计——它是质量终审(ADR-0004:机器永不作终审),也是赛事"人类创作参与"条款的合规证据(见原创性自证报告 §1.3)。对话式交互层(三个人工决策点的产品化)在 Wave 3 路线图。
3.3 数据流转
- 每件作品:
decision_log.jsonl逐步留痕(草稿/每轮指标/大脑复盘原文/交付探针)+final_manifest.json汇总; - 留痕即迭代史:十条 ADR + 各轮听判记录构成完整的"为什么这么决策"证据链;
- 阈值双轨制(v1 继承):目标值与判定容差分离,清单照抄实测值,防数据造假。
四、产品需求规格(v2 现状)
| 需求 | 描述 | 状态 |
|---|---|---|
| FR1 一句话→生成 prompt 编译 | 大脑草稿:风格格匹配+稀疏纹理标签(≤12 词) | ✅ 已交付 |
| FR2 音频硬指标检测 | 时长/响度/削波自动测量(-14±1 LUFS、peak<-1) | ✅ 已交付 |
| FR3 结构指标+机器评审团 | copy%/unique + 尾寂/静默缝/高频能量,分格强制 | ✅ 已交付(校准后转强制) |
| FR4 归因回环 ≤3 轮 | LLM 复盘决策 retry_prompt/retry_seed,全程留痕 | ✅ 已交付 |
| FR5 响度补救+尾奏手术 | loudness_fix 归一;ending_fix 局部修复(ADR-0005) | ✅ 已交付 |
| FR6 原创性双层自查 | 指纹查重(录音级)+ CLAP 距离(语义级) | ✅ 已交付(提交包) |
| FR7 对话式交互界面 | 三个人工决策点:简报确认/候选拍板/交付确认 | ✅ 已交付(2026-08-02,musagent/ui/app.py) |
| FR8 发布物料包 | 封面描述+裁方校验+元数据实测打包+三平台宣发文案(v1 release-pack 迁移) | ✅ 已交付(2026-08-02,musagent/tools/release_pack.py) |
| FR9 作品展示网页 | 播放+decision_log 过程可视化 | ✅ 已交付(2026-08-02,showcase/index.html) |
非功能指标(实测)
| 类别 | 目标 | 实测 |
|---|---|---|
| 单首生成耗时 | — | ~17s(5060 Laptop,95s 直出) |
| 自动迭代上限 | ≤3 轮,超限如实报告 | 实现于 loop.py,轮尽取最优轮交付并留痕 |
| 可解释 | 每条产出自带报告+决策日志 | 100% 覆盖(decision_log + manifest) |
| 合规 | AIGC 披露 + 原创性自查 | 双层查重报告随投稿提交 |
五、评测标准(v2 重建)
核心理念不变:评测先行。v1 的教训(CLAP 锚错)直接催生了 v2 的多维权衡与分格校准。
| 评测项 | 方法 | 结果 |
|---|---|---|
| 端到端成功率 | 20 场景测试集无人工干预跑通 | m1-batch 20/20 |
| 硬指标合规率 | ffmpeg+pyloudnorm 逐首实测 | 20/20(清单见提交包 成品清单.json) |
| 结构指标门槛 | copy%/unique 分格阈值 | 阈值经 24 条摇滚校准集+名作参照标定(ADR-0001) |
| 机器评审团有效性 | 6 检测器 vs 人评对照 | 校准后转强制(ADR-0001~0004) |
| 盲听 MOS(终审) | 同题配对:vs 同引擎朴素裸跑基线,唯一变量=Agent 管线 | 5 卡合计 83%(收集中;设计 ADR-0008/0010) |
| 原创性 | 双层查重(指纹+CLAP) | 零疑似(提交包报告第 3-4 章) |
盲听方法学(评审重点):基线=我方 20 场景各自的朴素英文一句话、同引擎零配方裸跑单发。跨题材配对已被证伪为口味噪声(55%/60% 数据作废,ADR-0010)——同题对打下偏好才纯粹反映管线增量。这一方法学迭代本身就是"评测先行"开发方式的实证。
六、技术实现
| 层级 | 选型 | 说明 |
|---|---|---|
| 编排/LLM | Kimi(Anthropic 兼容 API) | 草稿、复盘、归因;每轮独立调用,历史显式拼入留痕 |
| 主引擎 | DiffRhythm v1.2(95s 档,Apache-2.0) | 整曲直出;vendor 功能性补丁五项(seed 控制/时长放开等,台账见 docs/vendor-patches.md) |
| 兜底 | MusicGen-medium(ACE-Step 备胎已于 2026-08-03 拍板整砍:依赖不补装、C 机筛选取消) | 引擎接口契约隔离,可热插拔 |
| 检测链 | pyloudnorm · librosa · chromaprint · laion-clap · 自研 6 检测器 | 硬指标+结构+评审团+双层查重 |
| 运行环境 | Linux · 双 venv(编排层/推理层隔离)· torch 2.11+cu130 | RTX 5060 Laptop 8GB;重建实录见 vendor-patches.md |
6.3 创新点
- 真 Agent 归因:失败处理从写死决策树升级为 LLM 读报告推理,且推理原文留痕可审计;
- 机器耳朵评审团:把人耳听判逐条转化为确定性检测器,阈值全部经真实听判与名作参照双校准——"sample-and-verify"架构,用户只见幸存者;
- 盲听方法学:同题配对设计+噪声数据主动作废,评测纪律本身可评审;
- 原创性双层自证:指纹层(录音复制)+嵌入层(语义相似)互补,附阳性对照与方法学校验,可直接随投稿提交。
七、商业模式
参赛阶段免费开源;工具订阅(生成额度+质检报告+物料包);单曲物料包按首计费;品牌主题曲承制(工具降本、人工兜底)。
八、社会价值
降低创作门槛(无乐理也有原创 BGM);正版化(原创生成替代盗用罐头音乐);AIGC 合规示范(披露+双层查重+过程留痕)。
九、项目进展
- M0 引擎定型(2026-07-28):DiffRhythm v1.2 定型,95s 直出 ~18s/首;full/180s/120s 外推判死;ACE-Step 降备胎(后于 2026-08-03 整砍)
- M1 Agent MVP(2026-07-28):编排器端到端打通,批次 20/20
- M1.5 机器耳朵(2026-07-30):评审团 6 检测器校准后转强制
- 20 场景定格(2026-07-31):五格全满贯,人评 83–90;含尾奏手术、策展批次等案例
- M2 盲听验收(2026-07-31 非正式通过,ADR-0009);同题配对正式盲听收集中:5 卡 83%
- 原创性自证(2026-08-02):双层查重零疑似,提交包备妥
- B 机 Linux 环境重建(2026-08-02):双 venv,冒烟 16.7s/首
- Wave 3 · FR7 对话式界面(2026-08-02):Gradio 三决策点端到端,会话留痕 outputs/sessions/
- Wave 3 · FR9 展示网页(2026-08-02):showcase/index.html 由留痕资产自动生成(scripts/build_showcase.py)
- Wave 3 · FR8 release-pack 迁移(2026-08-02):纯音乐适配版物料包(封面描述+元数据+三平台文案),UI ④ 按钮+CLI 双入口
- 赛事提交(B 机掌管、A 机仅执行提交动作,截止时间查证中)
十、参赛信息
- 项目名称:MusAgent · 音乐工坊 —— AI 纯音乐创作智能体
- 参赛赛道:AIGC 技术赛道 · 音乐大模型子赛道 · 方向一(研发 AI 智能体工具)
- 参赛宣言:让每一句"我想有段音乐",都变成一首经得起检测、查得到来路的原创纯音乐。
十一、路线图
| 项 | 内容 | 依据 |
|---|---|---|
| ✅ FR7 界面 + FR8 物料包 + FR9 展示页全部交付(2026-08-02) | musagent/ui/ · musagent/tools/release_pack.py · showcase/ | |
| 120–240s 中间时长攻关 | v1.2 中间时长探针(补丁已备:--audio-length 放开+帧率换算) | vendor 台账 §补丁 3 |
| 长程作曲新格 | 后摇/极简主义/室内独立(M1 落地即解锁,未启动) | 立项书 §4.5 |
本文档为 v2.0 现状版 Specs。与 v1 提案的差异均有决策记录可查:纯音乐定死/歌词线废弃(立项书 §4.5)、95s 时长定档(M0 收官)、CLAP 降级(§3 评测表)、盲听设计迭代(ADR-0008→0010)。