ELECTE 4.0 正式上线——AI Agent 来了。看看有哪些新功能
治理与合规阅读需 6 分钟

人工智能安全考虑因素:利用人工智能保护数据

贵公司为人工智能收集数据--但不加区分的收集是否仍可持续?斯坦福白皮书警告:总体危害大于个体危害。三项主要建议:从 "选择不接受 "到 "选择接受",确保数据供应链的透明度,支持新的治理机制。目前的法规还不够。采用道德方法的组织可通过信任和运营弹性获得竞争优势。

Considerazioni sulla sicurezza dell'IA: Proteggere i dati sfruttando l'IA

用 AI 总结本文

人工智能时代的数据安全与隐私:斯坦福白皮书提供的视角

随着各类组织越来越多地采用人工智能解决方案来提升效率和推动创新,数据安全和隐私问题已成为重中之重。正如斯坦福大学关于人工智能时代隐私与数据保护的白皮书(2023年)执行摘要中所指出的那样,"数据是所有人工智能系统的基础","人工智能的发展将持续加剧开发者对训练数据的渴求,从而引发一场比过去几十年更为激烈的数据争夺战。"人工智能在带来巨大机遇的同时,也带来了独特的挑战,需要我们从根本上重新思考数据保护的方法。本文探讨了组织在部署人工智能系统时需要考虑的主要安全与隐私问题,并提供了在整个人工智能生命周期中保护敏感数据的实用指导。

了解人工智能的安全和隐私状况

正如斯坦福白皮书《数据保护与隐私:关键概念与监管格局》第 2 章所指出的,人工智能时代的数据管理需要一种方法,考虑到超越单纯技术安全的相互关联的层面。根据执行摘要,有三项关键建议可用于降低人工智能的发展和采用所带来的数据隐私风险:

  1. 打破默认数据收集的常态,从选择退出(opt-out)机制转向选择加入(opt-in)机制
  2. 聚焦人工智能数据供应链,以改善隐私和数据保护
  3. 转变个人数据的创建与管理方式,支持开发新的治理机制

这些方面需要超越传统 IT 安全实践的特定方法。

反思人工智能时代的数据收集工作

正如斯坦福白皮书明确指出的那样,"收集基本不受限制的数据会带来独特的隐私风险,这种风险超出了个人层面--它们合在一起会造成社会危害,而这些危害仅靠行使个人数据权利是无法解决的"。这是执行摘要中最重要的观点之一,要求我们从根本上重新思考数据保护战略。

将默认数据收集非规范化

直接引用斯坦福大学执行摘要中的第一条建议:

  • 从选择退出转向选择加入:"打破默认数据收集的常态,从选择退出模式转向选择加入模式。数据采集方必须通过'默认隐私'策略促进真正的数据最小化,并采用相应的技术标准和基础设施,以实现有意义的同意机制。"
  • 有效的数据最小化:按照白皮书第三章《挑衅与预测》的建议,实施"默认隐私"原则,仅收集特定用例所必需的数据
  • 有意义的同意机制:采用能够实现真正知情且细粒度同意的技术标准和基础设施
实施建议:建立一套数据分类系统,自动标记敏感元素,并根据敏感程度实施相应的控制措施,默认设置为不收集。


提高人工智能数据链的透明度

根据斯坦福大学执行摘要的第二项建议,整个数据链的透明度和问责制是任何处理数据隐私的监管系统的基础。

关注人工智能数据链

白皮书明确指出,有必要 "关注人工智能数据供应链,以改善隐私和数据保护。确保数据集在整个生命周期内的透明度和问责制,必须成为任何解决数据隐私问题的监管系统的目标"。这需要

  • 完整的可追溯性:保留关于数据来源、转换过程和使用情况的详细记录
  • 数据集透明度:确保模型所用数据的构成和来源具有可见性,尤其是考虑到第二章中针对生成式人工智能系统提出的担忧
  • 定期审计:对数据采集和使用流程进行独立审查
实施建议:建立一套数据溯源系统,记录人工智能系统训练和运行过程中所用数据的完整生命周期。

改变数据创建和管理方法

斯坦福执行摘要的第三条建议指出,需要 "改变个人数据的创建和管理方法"。正如文件中所述,"政策制定者应支持开发新的治理机制和技术基础设施(如数据经纪人和数据授权基础设施),以支持个人数据权利和偏好的行使并使之自动化"。

新的数据管理机制

  • 数据中介机构:如白皮书明确建议的那样,支持开发能够代表个人行使受托责任的实体
  • 数据授权基础设施:构建能让个人对其数据使用表达细粒度偏好的系统
  • 个人权利行使自动化:开发能自动化实现个人数据权利行使的机制,同时认识到——正如第三章所强调的——仅靠个人权利是不够的
实施建议:采用或参与开发开放的数据授权标准,以实现不同系统和服务之间的互操作性。

保护人工智能模型

人工智能模型本身需要特殊保护:

  • 模型安全:通过加密和访问控制保护模型的完整性与保密性
  • 安全部署:使用容器化和代码签名确保模型的完整性
  • 持续监控:部署监控系统以检测未经授权的访问或异常行为
实施建议:在开发流程中设立"安全关卡",要求在模型投入生产之前完成安全性和隐私性验证。

防御对方攻击

人工智能系统面临独特的攻击载体:

  • 数据投毒:防止训练数据被恶意操纵
  • 敏感信息提取:防范可能从模型响应中提取训练数据的技术手段
  • 成员推断:防止判定特定数据是否属于训练数据集
实施建议:在开发过程中采用对抗性训练技术,专门让模型接触潜在的攻击向量。

具体部门的考虑因素

不同部门对隐私和安全的要求大相径庭:

医疗保健

  • 符合HIPAA对受保护健康信息的合规要求
  • 针对基因组和生物特征数据的特殊保护措施
  • 在研究价值与隐私保护之间取得平衡

金融服务

  • 支付信息的PCI DSS要求
  • 反洗钱(AML)合规考量
  • 采用差分隐私方法处理客户敏感数据

公共部门

  • 公民数据保护法规
  • 算法决策过程的透明度
  • 符合地方、国家和国际隐私法规

切实可行的实施框架

在人工智能中实施全面的数据隐私和安全方法需要:

  1. 隐私与安全内嵌设计
    • 从开发早期阶段就纳入隐私考量
    • 针对每个AI应用场景开展隐私影响评估
  2. 集成化数据治理
    • 将AI管理与更广泛的数据治理举措保持一致
    • 在所有数据处理系统中实施一致的控制措施
  3. 持续监控
    • 实施对隐私合规情况的持续监督
    • 建立基线指标以检测异常情况
  4. 法规一致性
    • 确保符合现行及不断演变的法规要求
    • 记录隐私保护措施以备监管审查


案例研究:在金融机构中实施

一家全球性金融机构采用分层方法实施了基于人工智能的欺诈检测系统:

  • 数据隐私层:在处理前对客户敏感信息进行令牌化处理
  • 同意管理:细粒度系统,让客户能够控制哪些数据可被使用以及用于何种目的
  • 透明度:面向客户的仪表盘,展示其数据在AI系统中的使用情况
  • 监控:持续分析输入、输出及性能指标,以检测潜在的隐私违规行为

结论

正如斯坦福白皮书的执行摘要中明确指出的那样,"虽然基于全球公认的公平信息做法(FIPs)的现有和拟议的隐私立法对人工智能的发展进行了隐性监管,但不足以解决竞相获取数据以及由此产生的个人和系统性隐私伤害问题"。此外,"即使是包含关于算法决策和其他形式人工智能的明确规定的立法,也没有提供必要的数据治理措施,以对人工智能系统中使用的数据进行有意义的监管"。

在人工智能时代,数据保护和隐私再也不能被视为次要的了。各组织必须遵循白皮书中的三项关键建议:

  1. 从不加区分的数据收集模式转向基于自愿明确同意(opt-in)的模式
  2. 确保整个数据链条的透明度和问责制
  3. 支持新的治理机制,让个人对自己的数据拥有更多控制权

这些建议的实施意味着我们在人工智能生态系统中构想和管理数据的方式发生了根本性转变。正如斯坦福白皮书中的分析所示,目前的数据收集和使用方式是不可持续的,有可能破坏公众对人工智能系统的信任,同时造成远远超出个人范围的系统性漏洞。

为了应对这些挑战,监管环境已经在发生变化,国际上越来越多地讨论不仅要监管人工智能的结果,还要监管为这些系统提供数据的数据采集过程,这就是证明。然而,仅仅遵守法规是不够的。

采用合乎道德、透明的数据管理方法的组织将在这一新环境中处于更有利的位置,通过用户信任和更强的运营复原力赢得竞争优势。我们面临的挑战是如何平衡技术创新与社会责任,认识到人工智能的真正可持续性取决于其尊重和保护服务对象基本权利的能力。

评论

暂无评论——来发表第一条吧。