欢迎光临
我们一直在努力

Google DeepMind启动双盲AI评测:保密基准和模型权重在机密计算环境相遇

8月28日,Google DeepMind联合多家机构测试了首个面向专有前沿模型的双盲评测系统。在这个系统中,保密基准和模型权重在机密计算环境中相遇,评测双方都看不到对方的资产,只得到可验证的结果。这一尝试试图从技术上减少基准污染问题,为AI模型评测提供更可信的方法。

基准污染难题

随着大模型能力的不断提升,基准评测的可信度正面临严峻挑战。所谓”基准污染”,是指模型在训练过程中可能已经接触到了基准测试的数据,导致测试结果不能真实反映模型的能力。这一问题在开源模型中尤为突出,因为训练数据公开,研究者可以轻易检查是否包含基准数据。但对于闭源专有模型,基准污染几乎无法验证。

基准污染导致的后果是严重的:模型在基准测试上的分数越来越高,但实际能力可能并没有相应提升。这不仅误导了研究者和用户,也浪费了大量研发资源。业界一直在寻找更可信的评测方法,双盲评测就是其中一种尝试。

双盲评测的设计

Google DeepMind的双盲评测系统基于机密计算(Confidential Computing)技术。在评测过程中,模型提供方将模型权重加密后传入机密计算环境,基准提供方也将测试数据加密传入。在硬件级隔离的可信执行环境(TEE)中,数据被解密并执行评测,最终只有评测结果被输出,双方都无法看到对方的原始数据。

这种设计的核心优势在于:模型提供方不需要暴露模型权重,保护了知识产权;基准提供方不需要暴露测试数据,防止了基准被污染。评测结果由可信硬件保证真实性,双方都无法篡改。这为专有模型的可信评测提供了一种技术解决方案。

行业意义

双盲评测如果能够推广应用,将对AI行业产生深远影响。首先,它可以提高模型评测的可信度,让用户和研究者能够更准确地了解模型的真实能力。其次,它可以保护基准数据的安全性,延长基准的使用寿命。最后,它为专有模型和开源模型之间的公平比较提供了可能,有助于建立更健康的竞争环境。

当然,双盲评测也面临一些挑战。机密计算环境的性能开销可能影响评测效率,硬件兼容性也需要考虑。此外,如何确保评测过程的可复现性和可审计性,也是需要解决的问题。但总体而言,双盲评测代表了AI评测技术的一个重要发展方向。

Google DeepMind表示,将继续与学术界和产业界合作,完善双盲评测系统,并推动其成为行业标准。随着AI模型能力的持续提升,可信评测的重要性将日益凸显。

赞(0)
未经允许不得转载:风腾网 - 最新 AI 风向|AI 工具、大模型与人工智能行业资讯 » Google DeepMind启动双盲AI评测:保密基准和模型权重在机密计算环境相遇

评论 抢沙发

登录

找回密码

注册