2022年8月15日,周一,上午九点。
陈诺坐在AI伦理认证委员会的办公室里,面前摆着第一批申请认证的AI项目名单。一共有十二个项目,涵盖了人脸识别、语音合成、推荐算法、自动驾驶等多个领域。每个项目都需要经过严格的伦理审查。
审查流程分为三个阶段。第一阶段,项目方提交伦理自评报告,包括技术说明、数据来源、隐私保护措施、公平性评估、安全性评估等五个方面的内容。第二阶段,委员会组织专家进行书面评审,每位专家独立打分,满分一百分,六十分及格。第三阶段,专家进行现场考察,核实自评报告的真实性。整个流程预计需要两个月。
陈诺拿起第一份申请,是一家公司的人脸识别系统。他仔细阅读了伦理自评报告,发现这家公司在隐私保护方面做得不错,采用了差分隐私技术,确保个人数据不会被泄露。但在公平性方面存在问题——系统对女性、老人、有色人种的识别准确率明显低于对年轻白人的识别准确率。数据显示,对年轻白人男性的识别准确率为百分之九十八点五,对老年女性的识别准确率仅为百分之八十七点三,差距超过十个百分点。
他拿起手机,给项目的负责人打了电话:“张总,我看到你们的伦理自评报告了。隐私保护方面做得不错,差分隐私技术的应用值得肯定。但公平性方面有问题。你们的系统对不同群体的识别准确率差异很大,这是不符合伦理标准的。”
对方沉默了片刻,然后说:“陈总,这个问题我们也注意到了。但技术上的改进需要时间。我们正在收集更多的训练数据,特别是女性和老年人的数据,希望能够提高对这些群体的识别准确率。我们已经增加了五千张女性面孔和三千张老年人面孔的训练数据。”
陈诺说:“我理解。但在问题解决之前,我们不能通过你们的伦理认证。这是对用户负责,也是对你们负责。如果你们的系统被用于安防领域,因为识别准确率低而导致误判,可能会造成严重的后果。比如,如果一个老年人因为系统误判而被拦在机场安检口,那不仅是用户体验问题,更是人权问题。”
当天下午,陈诺组织了第一次伦理审查会议。五位专家对十二个项目进行了逐一评审。评审过程非常严格,每个项目都要经过三轮投票。最终,有八个项目通过了初审,四个项目需要补充材料。那家人脸识别系统,被要求补充公平性改进方案,并且在改进完成后重新提交申请。
会议结束后,陈诺单独留下了王教授。
“王教授,今天的评审您觉得怎么样?”
王教授说:“整体不错,但有一个问题。我觉得我们的评审标准可能过于严格了。有些项目虽然存在一些小问题,但总体上是好的。如果因为一些小问题就否决,可能会打击企业的积极性。”
陈诺说:“我理解您的顾虑。但我觉得,伦理审查就是要严格。如果标准太低,就失去了意义。就像药品审批一样,宁可慢一点,也不能让不合格的药品上市。不过,我们可以给企业提供一个"整改期",让他们在规定时间内改进问题,然后重新提交申请。”
王教授说:“这个主意好。既保证了标准,又给了企业机会。”
当天晚上,陈诺回到家,坐在书房里,拿起那本旧笔记本,写下了一行字:“2022年8月15日,AI伦理认证委员会开始了第一批项目的伦理审查。十二个项目中有八个通过了初审,四个需要补充材料。那家人脸识别系统因为公平性问题被要求整改。王教授建议适当放宽标准,但我坚持严格审查。最终我们决定给企业提供整改期。我知道,伦理审查会得罪很多人,但这是必要的工作。因为只有严格的伦理审查,才能确保AI技术被正确地使用。”