8月28日,Google DeepMind联合多家机构测试了首个面向专有前沿模型的双盲评测系统。在这个系统中,保密基准和模型权重在机密计算环境中相遇,评测双方都看不到对方的资产,只得到可验证的结果。这一尝试试图从技术上减少基准污染问题,为AI模型评测提供更可信的方法。
基准污染难题
随着大模型能力的不断提升,基准评测的可信度正面临严峻挑战。所谓”基准污染”,是指模型在训练过程中可能已经接触到了基准测试的数据,导致测试结果不能真实反映模型的能力。这一问题在开源模型中尤为突出,因为训练数据公开,研究者可以轻易检查是否包含基准数据。但对于闭源专有模型,基准污染几乎无法验证。
基准污染导致的后果是严重的:模型在基准测试上的分数越来越高,但实际能力可能并没有相应提升。这不仅误导了研究者和用户,也浪费了大量研发资源。业界一直在寻找更可信的评测方法,双盲评测就是其中一种尝试。
双盲评测的设计
Google DeepMind的双盲评测系统基于机密计算(Confidential Computing)技术。在评测过程中,模型提供方将模型权重加密后传入机密计算环境,基准提供方也将测试数据加密传入。在硬件级隔离的可信执行环境(TEE)中,数据被解密并执行评测,最终只有评测结果被输出,双方都无法看到对方的原始数据。
这种设计的核心优势在于:模型提供方不需要暴露模型权重,保护了知识产权;基准提供方不需要暴露测试数据,防止了基准被污染。评测结果由可信硬件保证真实性,双方都无法篡改。这为专有模型的可信评测提供了一种技术解决方案。
行业意义
双盲评测如果能够推广应用,将对AI行业产生深远影响。首先,它可以提高模型评测的可信度,让用户和研究者能够更准确地了解模型的真实能力。其次,它可以保护基准数据的安全性,延长基准的使用寿命。最后,它为专有模型和开源模型之间的公平比较提供了可能,有助于建立更健康的竞争环境。
当然,双盲评测也面临一些挑战。机密计算环境的性能开销可能影响评测效率,硬件兼容性也需要考虑。此外,如何确保评测过程的可复现性和可审计性,也是需要解决的问题。但总体而言,双盲评测代表了AI评测技术的一个重要发展方向。
Google DeepMind表示,将继续与学术界和产业界合作,完善双盲评测系统,并推动其成为行业标准。随着AI模型能力的持续提升,可信评测的重要性将日益凸显。
风腾网 - 最新 AI 风向|AI 工具、大模型与人工智能行业资讯





