腾讯混元及其合作伙伴发布了MMAE评估标准,结果显示人工智能音频编辑技术的精确度低于5%。

人工智能在音频生成领域已取得显著进展,但编辑现有音频仍是一项重大挑战。近期,腾讯混元联合上海交通大学、南洋理工大学、天津大学、北京大学及复旦大学等顶尖研究机构,推出了MMAE(大规模多任务音频编辑基准测试)——这是首个专为通用指令驱动型音频编辑设计的大规模多任务基准测试。该基准的推出为人工智能音频编辑领域确立了系统的评估标准,同时也暴露出现有技术在实现精准修改方面的明显不足。
从“生成”到“编辑”:人工智能音频面临的真正挑战
传统的音频人工智能技术主要侧重于根据文本或提示词生成新内容。而MMAE基准测试的核心要求则是让模型理解现有的音频片段,并依据自然语言指令进行精准调整:仅修改需要改动的部分,其余部分保持不变。这种“编辑而非重构”的思路对音频的保真度、指令遵循能力以及上下文理解深度都有更高要求,因此更贴近播客后期制作、音乐混音和语音个性化等实际应用场景。
测试结果显示,当前主流模型的整体精确匹配率低于5%,这凸显出可靠音频编辑技术存在的巨大差距。这意味着在处理实际的编辑任务时,人工智能往往会出现过度修改、遗漏指令或降低原始音频质量等问题。
MMAE基准测试的亮点:针对真实场景的多维度评估
MMAE基准测试在设计上极为严谨周全,具备以下核心特点:
2,000个高保真样本:全部取自现实场景,确保评估具有实用性和多样性。17,741项细粒度评估指标:提供详尽的评分标准,便于进行客观量化。7种模态设置:涵盖声音、音乐、语音及其组合,可支持在复杂的音频环境中进行测试。6个任务复杂度等级:从基础修改到多步推理及多轮编辑不等,能够全面评估模型的能力。8类操作类型:支持不同粒度上的编辑任务,包括局部和全局操作,从而考验模型对细节的掌控能力。
AIbase评论:MMAE不仅仅是一个技术评估工具,更是推动音频人工智能从“生成型”向“可编辑型”转变的重要里程碑。它为研究人员和开发者提供了统一的评估标准,有望加速下一代音频编辑模型的发展。
未来展望:音频编辑或将成为人工智能多模态系统的核心能力
随着多模态大模型快速发展,精准的音频编辑将在内容创作、电影后期制作以及无障碍工具等领域发挥关键作用。腾讯混元与其他机构近期的合作体现了中国在音频人工智能研究领域的领先地位。业内预计未来会有更多开源资源及后续模型出现,共同填补这一技术空白。
