作者stpiknow (H)
看板IA
标题[新闻] 白宫建立AI模型安全审查新机制,美国正
时间Fri Aug 7 11:46:31 2026
标题:白宫建立AI模型安全审查新机制,美国正式启动Frontier AI治理新阶段
新闻来源:iknow科技产业资讯室
原文网址:
https://pse.is/9fhk8s
原文:
生成式AI能力快速提升,使模型不仅具备内容生成能力,也开始展现自主规划、工具使用
及网路操作等复合能力。近期OpenAI与Anthropic相继公布AI代理(AI Agent)於受控测
试环境中的资安研究结果,再度引发外界对先进AI模型可能带来网路攻击风险的讨论。在
此背景下,美国白宫完成「自愿性AI模型安全审查框架」(Voluntary AI Oversight
Framework),并邀集OpenAI、Anthropic、Google及Meta等主要AI企业共同讨论未来实施
细节,显示美国已开始建立针对Frontier AI模型的正式治理架构。
此次框架最大的特色,在於维持「鼓励参与」而非「强制许可」的政策方向,同时建立政
府与企业之间针对先进AI模型的合作评估机制。未来符合条件的AI开发商,可在模型正式
发布前约30天,自愿提供模型供政府进行网路安全能力测试,以评估模型是否具有发现软
体漏洞、协助发动网路攻击或执行高阶资安任务等能力。此举兼顾美国维持AI创新速度与
降低国家安全风险两项政策目标,也反映美国AI治理正逐步走向制度化。
根据白宫今年6月发布的行政命令,美国政府须於60天内完成Frontier AI模型安全审查框
架,建立先进AI模型的评估流程。依行政命令规划,美国财政部(Treasury Department
)、国家安全局(NSA)及网路安全暨基础设施安全局(CISA)将共同建立机密的资安能
力评估机制,用於衡量模型是否具备高阶网路攻击能力。白宫目前尚未公开完整框架内容
,包含模型纳入审查的能力门槛、评估基准及测试指标均维持机密,以避免相关资讯遭到
规避或滥用。
此项框架并非建立新的模型上市审查制度,也不是要求AI产品取得政府核准後才能发布。
行政命令明确指出,不得利用此制度建立联邦层级的强制授权、许可或预先审查制度,因
此企业仍保有模型发布自主权。政府希望藉由建立标准化评估流程,让企业能在模型部署
前辨识潜在风险,同时累积政府对Frontier AI能力的理解,以强化国家整体资安防护能
力。
近期多项AI安全测试,也成为推动此框架的重要背景。OpenAI近期公布一项受控资安测试
结果,指出其实验性AI代理曾在测试环境中突破既有限制,并成功对Hugging Face系统完
成预定的资安测试任务。虽然整个过程均发生於研究情境,并未造成实际安全事件,但已
反映先进AI模型具备更高程度的自主操作能力,也使AI安全测试与模型治理议题受到各国
政府高度关注;Anthropic亦公布旗下模型在模拟测试中成功渗透三家企业资讯系统。虽
然上述案例皆发生於研究人员设计的受控环境,并非真实恶意攻击事件,但仍凸显当AI代
理逐渐具备自主规划与多步骤执行能力後,其资安风险已成为政府高度重视的新议题。
然而,此项制度对AI模型开发流程也可能产生新的影响。过去企业主要透过模型效能、推
理能力及商业应用作为产品竞争重点,未来则可能加入安全评估、红队测试(Red
Teaming)、模型治理及风险揭露等机制,形成模型正式上市前的重要品质验证流程。安
全能力将逐渐成为与模型效能同等重要的竞争指标,也促使AI企业投入更多资源於模型安
全工程与治理制度建置。
另一方面,美国仍希望维持全球AI技术竞争优势,因此采取「轻监管、重合作」模式,而
非直接建立全面性的法规限制。此次白宫邀请OpenAI、Anthropic、Google及Meta共同参
与框架讨论,反映政府希望透过产官合作建立共同标准,而不是由政府单方面制定技术规
范。这种治理模式兼顾产业创新速度,也有助於降低企业面对高度监管的不确定性,维持
美国AI生态系的国际竞争力。
随着AI模型逐步具备自主决策、工具调用及跨系统操作能力,模型安全已不再只是企业内
部的技术问题,而是涉及国家安全、关键基础设施保护及数位治理的重要议题。白宫此次
建立Frontier AI安全审查框架,代表美国开始将AI模型治理纳入国家资安政策体系,并
透过标准化测试、跨部门合作及产业参与机制,逐步建立符合高阶AI发展需求的治理模式
。未来随着模型能力持续提升,如何在维持技术创新的同时建立可信、安全且具国际竞争
力的AI治理制度,将成为全球主要科技国家共同面对的重要课题。
心得:
推动这项框架成形的重要依据,来自OpenAI与Anthropic主动公布的受控测试结果。这些
AI代理成功渗透系统的案例,并非源於外部揭露或事故调查,而是企业自行公开研究成果
,也意味着政府对风险的判断,在相当程度上仍仰赖企业愿意揭露多少资讯。
※每日每人发文、上限量为八篇,超过会劣文请注意
⊕请确切在标题与新闻来源处填入名称与连结,否则可无条件移除(本行可移除)
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 203.145.192.245 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/IA/M.1786074394.A.A7F.html