分层的基准结构:基准由基础测试和对话测试组成。基础测试包含19项不同的音频任务,包含超过19,000道单选题,每道题目仅集中测试一种基础能力。GPT-4通过精心设计的提示扩展了问题和候选选项。对话部分包含超过2,000道基于音频的开放式问题。为了增加音频的复杂性并更贴近真实场景中的复杂音频,我们提出了一种新的音频混合策略,包含音量控制和时间偏移。具体来说,我们在两个音频片段的混合过程中调整音量,并引入不同的时间偏移。由此生成的相对音量和时间位置信息被记录为额外的元信息,为音频提供了更全面的文本描述。数据质量通过 GPT-4 的自动过滤并由人工复核得以保证。