您的位置:首页 > 手游攻略 > MuScriptor - Kyutai 携手 Mirelo 开源的多乐器音乐转录模型
MuScriptor - Kyutai 携手 Mirelo 开源的多乐器音乐转录模型
作者:互联网 时间: 2026-07-21 18:31:11
MuScriptor是什么
MuScriptor 是 Kyutai 与 Mirelo 联合推出的开源多乐器音乐转录模型,可将真实世界多种流派的音乐音频自动转录为 MIDI。MuScriptor是首个在涵盖 17 万首歌曲的大规模真实数据集上训练的同类模型,采用纯解码器 Transformer 架构,提供 60M 至 1.4B 四种参数规模,支持乐器条件控制,代码以 MIT 协议开源。

MuScriptor的主要功能
- 多乐器音频转录:将包含多种乐器的真实世界音乐音频自动转换为标准 MIDI 格式,支持钢琴、吉他、鼓、贝斯等 36 类乐器。
- 多流派音乐支持:覆盖流行、古典、摇滚、重金属等多种音乐流派,适配复杂的真实混音场景。
- 乐器条件控制:支持用户指定需要转录的目标乐器集合,实现定制化输出并稳定跨片段的乐器识别一致性。
- 多规格模型选择:提供 60M、103M、307M 及 1.4B 四种参数规模,兼顾轻量部署与高精度需求。
- 端到端自动处理:用5 秒音频切片为单位输入,模型自动完成分帧、特征提取、音符检测与 MIDI 生成全流程。
MuScriptor的技术原理
- 纯解码器 Transformer 架构:模型用 5 秒音频切片为输入,将 16kHz 单声道音频转换为 mel-spectrogram,通过自回归方式预测 MIDI-like token 序列,实现端到端的多乐器转录。
- 三阶段训练策略:模型首先在 150 万合成 MIDI 数据上进行预训练,随后在 17 万首真实音乐上微调,最后用 300 首高质量标注数据通过 GRPO 风格的强化学习进行后训练,对齐高质量输出。
- 乐器条件控制:模型支持通过前缀嵌入指定目标乐器集合,用户可自定义需要转录的乐器种类,同时用 classifier-free guidance 稳定跨片段的乐器分配一致性。
- 数据合成与增强管线:预训练阶段采用动态合成流程,对 MIDI 进行音高偏移、速度变化、乐器随机化等符号级增强,用 250 多种 soundfont 合成音频,加入随机失谐提升泛化能力。
微信关注回复“开源”,加入AI开源项目交流群
如何使用MuScriptor
- 环境准备:克隆 GitHub 仓库并安装依赖,确保系统支持 Python 及 PyTorch 等深度学习框架。
- 下载权重:从官方渠道获取对应参数规模(103M、307M 或 1.4B)的模型权重文件。
- 加载模型:用提供的推理代码初始化模型,可选择是否启用乐器条件控制。
- 输入音频:将待转录的音频文件(支持多种格式)输入模型,模型自动切分为 5 秒片段进行处理。
- 获取 MIDI:模型输出标准 MIDI 文件,可直接导入 DAW 或乐谱软件进行后续编辑。
MuScriptor的核心优势
- 真实世界泛化能力最强:相比依赖合成数据训练的模型(如 MT3),MuScriptor 在 17 万首真实多乐器音乐上训练,在复杂真实混音场景下错误率显著降低,官方称其为迄今最佳开源多乐器转录模型。
- 强化学习对齐高质量输出:通过后训练阶段的 GRPO 风格强化学习,模型在音符 onset、offset 和 frame 级别的 F1 分数均获得进一步提升,减少漏检和误检。
- 灵活的乐器条件控制:用户可指定需要转录的乐器种类,能精简输出,也能跨音频片段保持乐器识别的一致性,避免片段间乐器分配波动。
- 多规格开源:提供从 60M 到 1.4B 的四种模型规模,兼顾边缘设备部署与高精度需求,代码 MIT 开源,权重 CC BY-NC 4.0 可获取。
MuScriptor的项目地址
- GitHub仓库:https://github.com/muscriptor/muscriptor
- HuggingFace模型库:https://huggingface.co/MuScriptor
- arXiv技术论文:https://arxiv.org/pdf/2607.08168v1
MuScriptor的同类竞品对比
对比维度 | MuScriptor | YourMT3+ | 发布方Kyutai / Mirelo学术研究团队
架构纯解码器 Transformer分层注意力 Transformer + MoE
训练数据150万合成 MIDI + 17万真实音乐 + 300首 RL 数据小规模合成数据 + 有限真实数据
核心策略真实数据微调 + 强化学习后训练架构改进 + 跨数据集增强
乐器控制支持显式乐器条件控制不支持
开源协议代码 MIT / 权重 CC BY-NC 4.0部分开源
真实音频表现Multi F1 约 41.6,显著领先作为 baseline 被超越
力度信息分词器暂不支持视具体实现而定
MuScriptor的应用场景
- 音乐制作辅助:制作人可将无 MIDI 的现有音频快速转换为可编辑的 MIDI 轨道,用于重新编曲、混音或采样。
- 乐谱自动生成:音乐教育机构和出版方可将录音自动转换为乐谱,降低人工扒谱成本。
- 音乐信息检索:为和弦识别、调性分析、风格分类等下游任务提供高质量的符号化输入。
- 生成式音乐建模:为音乐生成模型提供大规模、高质量的 MIDI 训练数据,推动符号音乐生成研究。
- 音乐考古与存档:将历史录音、现场演出等非结构化音频转化为结构化 MIDI 数据,便于数字化保存与分析。