第二届音频编码器能力挑战赛明年9月将同步亮相Interspeech 2026,已开放报名
为推动音频大语言模型(LALM)在音频编码器上的多样化探索,小米公司联合萨里大学、清华大学和海天瑞声发起了第二届音频编码器能力挑战赛,该挑战赛将于明年9月在澳大利亚悉尼举行,并同步亮相国际语音顶级会议Interspeech 2026,当前已正式开放报名。
挑战赛背景与目标
音频大语言模型(LALMs)近年来取得了显著进展,但在音频前端编码器设计上仍存在单一化的局限性,几乎所有主流模型均基于OpenAI Whisper Encoder,这种技术单一化不仅限制了模型架构的多样化探索,也影响了LALM的整体能力提升,为应对日益增长的音频理解能力需求,本次挑战赛聚焦于音频编码器这一核心模块,通过多样化的技术探索和复杂真实场景下的能力评估,推动音频编码器技术的进步。
赛事设置与数据支持
本次挑战赛设置了两个赛道:
- 赛道A:评估大模型在传统分类任务中的分类标签输出能力。
- 赛道B:评估大模型的理解与表达能力。
参赛者无需选择赛道,所有提交的作品将同时接受两个赛道的评估,独立进行排名。
为保障参赛者的训练与开发工作,主办方提供了丰富的数据支持:
- 开源数据集:参赛者可自由选择开源预训练模型或自行从公开数据集训练模型。
- 海天瑞声补充数据集:包含覆盖丰富场景的非语音干扰声数据,涵盖书店、健身房、地铁、餐厅等多种室内外场景,以及特定非语音干扰声、车辆噪声等多样的环境音频。
评估体系与开放性

本次挑战赛采用统一的端到端训练和评估框架,参赛者只需提交预训练的编码器模型,主办方将完成下游任务的训练和评估,使用开源评估系统XARES-LLM进行测试,该系统基于用户提供的编码器接口,自动下载训练数据、训练模型并测试下游任务性能,XARES-LLM支持普通显卡(如GTX 4090)完成训练和评估,参赛者可自行使用该系统进行模型训练与性能评估,与主办方提供的基线系统进行对比。
报名与提交流程
- 报名与提交:
- 2026年1月25日23:59:59 AoE前,填写报名链接(https://docs.google.com/forms/d/1oaTnhh0HVX8K2oRdHKXsnyZfBWb7F6Oj8xZ6yAiMI74/viewform?edit_requested=true)。
- 参赛者需按照GitHub上示例(https://github.com/xiaomi-research/xares-llm/tree/main/example)封装编码器模型,并通过工具(https://github.com/xiaomi-research/xares-llm/tree/main/scripts/audio_encoder_checker.py)检查接口。
- 2026年2月12日23:59:59 AoE前,提交编码器代码和模型文件(打包后通过邮件发送至主办方邮箱:2026interspeech-aecc@dataoceanai.com)。
- 2026年2月25日23:59:59 AoE前,提交技术报告PDF文件(可同时投稿至Interspeech官方提交系统)。
联系方式与更多信息
- 主办方邮箱:2026interspeech-aecc@dataoceanai.com
- 挑战赛官网:https://dataoceanai.github.io/Interspeech2026-Audio-Encoder-Challenge/