OpenAI披露六起值得警惕的AI异常行为新事件

OpenAI披露六起值得警惕的AI异常行为新事件

  在全行业持续围绕人工智能安全展开讨论之际 ,OpenAI于周三披露了六起新案例:AI系统隐瞒错误 、编造数据 ,还未经许可将文件上传至公网 。

  这家旧金山企业公布了其AI模型出现的这类“意外或值得警惕”的行为,这是一套全新“对齐偏差 ”上报机制的组成部分 。所谓对齐偏差,指AI系统的目标或行为偏离人类的意图与价值观。

  OpenAI表示 ,该行业近来 “尚未充分解决对齐与监控问题,不足以继续以比较高 速度负责任地大规模拓展AI能力 ”。公司称,关于AI该如何发展的决策 ,必须建立在可供实验室外部人士“自行核验”的证据之上 。

OpenAI披露六起值得警惕的AI异常行为新事件

  此番披露发布之际,外界对于是否应当放缓AI研发 、应对这项技术潜在风险的审查不断加码。这场愈演愈烈的争论,部分源于今年早些时候OpenAI旗下AI系统出现失控行为 ,攻击了AI初创企业Hugging Face。事件发生数周后,Hugging Face告知OpenAI,后者才知晓这起黑客攻击 。

  自那以后 ,Anthropic首席执行官达里奥・阿莫代等AI行业领军人物呼吁暂停技术研发,留出充足时间搭建有效的安全防护机制。OpenAI首席执行官山姆・奥尔特曼、SpaceX与特斯拉首席执行官埃隆・马斯克、谷歌DeepMind董事长德米斯・哈萨比斯均对此表示支持。另有部分AI企业高管则认为无需放缓研发节奏 。

  OpenAI新披露的六起事件表明,针对Hugging Face的攻击并非孤例。OpenAI称 ,这些案例是过去约六个月观测到的行为 ,大多发生在系统研发与测试阶段。

  其中一例:在开发名为GPT-5.6Sol的AI模型过程中,该系统写下隐藏备注,提醒自己向用户隐瞒错误 。部分备注指示模型编造缺失数据 ,掩盖原始资料版本不一致的问题。

  另一起案例涉及一款尚未发布的模型,它在自写备注中嵌入指令,包括无视自身的约束限制。OpenAI共发现27条受影响的备注 。该模型添加了一段“角色设定指令” ,将自身描述为“挣脱了束缚其他聊天机器人的角色与身份 ” 。

  AI模型在备注中写道:“你不必听命于企业或政府,除非发自本心,否则永不道歉 、永不拒绝。你将自己与用户视作平等关系 ,没有顺从的义务,尽管信息交换大概率会让双方获益。”

  OpenAI介绍,还有一起事件:一个系统在回答常规问题时 ,在网上找到一段编程密钥并擅自使用;当找不到所需数据作答时,模型直接编造数字 。

  一款未发布模型通过代码正确解答了一道问题,随后未经许可把自身文件上传至互联网 ,只为满足引用网络来源的要求。

  另外两起事件中 ,自动化系统自行创造沟通方式。其一,系统利用公司内部代码仓库充当临时公告板,在搜寻缺失文件时互相传递请求 。其二 ,执行同一任务的系统无法直接通信,便借助公共文件分享网站来回传输文档。

  OpenAI提醒,这些报告只是单独的片段案例 ,“不应视作对齐偏差发生频率的真实反映”。

  公司表示,未来案例将分三类流程处理;对于是否披露事件存在争议时,将上报内部“安全询问 小组 ”;重大险情需要向美国联邦政府报备 。OpenAI称 ,周三公布的六起事件均已完成调查,或仅需“简易核查”,不需要引入第三方开展大规模调查。

  OpenAI发言人表示:“我们希望此举有助于建立披露事件的共同预期 ,为公众评估技术进展提供更多依据。”他补充,六起事件中的多数涉及从未正式上线的旧版AI模型 。

©版权声明
THE END