Your current location:Home > 调解面对面 text

致命id

AI 不需要永远正确,我们只需要守住最后一道底线_我的网站

爱情魔发师

一 |     该图片使用了AI生成技术          本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs          现在谈AI安全,很多人的第一反应都是:怎样让模型少犯错?          减少幻觉、优化提示词、防止提示词注入、增加上下文、接入更强的模型,再用另一个Agent检查前一个Agent。1月14日,Redmi Red Rice Note 7是独立小米品牌Redmi于1月10日在北京发布的一款新机器。

二 | 这台新的Redmi机器也很受用户欢迎,因为它具有极高的性价比。今天,雷军在微博上透露,米粉都很喜欢康宁GG5玻璃,我们决定用GG5做电池的封底。这样,Redmi Note7双面玻璃全部采用GG5,名副其实的“小钻石”。也就是说,红米红米注7的双面2.5D玻璃是康宁第五代大猩猩玻璃制成的,非常真诚的为999元的手机,也不愧为“小金刚”。

三 | 目前,康宁最新的保护玻璃是第六代大猩猩保护玻璃,但这并不意味着第五代大猩猩保护玻璃已经落后。

四 |          这些工作当然有价值。         但它们容易让人产生一种错觉:只要模型足够聪明、提示词足够完善、检测系统足够复杂,AI就可以安全地完成一切。

五 |          问题是,AI真的可能永远正确吗?          答案恐怕是否定的。康宁第五代大猩猩玻璃于2016年7月20日发布。官方数据显示,当落在粗糙表面时,第五代大猩猩玻璃是竞争玻璃的四倍;当屏幕从1.6米下降到粗糙表面时,康宁的第五代大猩猩玻璃达到80%。         我们无法消灭所有错误          AI Agent面对的不是一道标准答案明确的考试题,而是不断变化的现实环境。此外,虽然第五代大猩猩玻璃的韧性得到了很大的提高,但它仍然保持了大猩猩玻璃众所周知的抗损伤性、光学清晰度和触摸灵敏度。

六 |          它读取的邮件可能是伪造的,访问的网页可能包含恶意指令,接收到的数据可能已经被污染,用户给出的任务也可能存在歧义。         即使模型本身没有受到攻击,它也可能误解目标、遗漏条件,或者基于不完整的信息作出一个看起来合理的决定。         我们可以持续提高模型的准确率,却很难证明它在下一次任务中一定不会犯错。         试图让AI永远正确,是在追求一个无法验证的目标;阻止危险结果发生,才是一条可以真正落地的边界。         真正的问题不是AI会不会犯错。         它一定会。         真正的问题是:当它犯错以后,系统是否会毫无阻碍地把这个错误执行出去。

七 |          模型错误不一定等于现实损失          一个AI在聊天窗口里回答错误,造成的可能只是一次糟糕的体验。

八 |          但当同一个AI拿到支付接口、管理员权限、数据库写入权限和服务器控制权以后,错误的性质就完全不同了。         它可能把钱转给错误的地址,删除重要数据,修改生产环境,扩大成员权限,或者关闭本应保留的审计记录。

九 |          模型只是产生了一个错误判断。         真正把错误变成事故的,是后面的执行能力。         模型犯错只是答案错了,执行失控才是真的出事。         这也是为什么,AI安全不能只盯着模型内部。         我们当然要防提示词注入,要提高推理能力,也要检测恶意输入。但即使前面的所有防线都失效了,系统仍然应该保留一道最后的底线。         这道底线不负责判断AI为什么犯错。

十 |          它只负责确认:这件事到底能不能发生。         守住钱袋子,比猜出所有骗子更现实          假设一个AI Agent正在替企业处理付款。         我们可以训练它识别诈骗邮件,可以要求它核对合同,可以增加一个模型复核收款信息。         但我们无法保证它永远认得骗子。         骗子会改变话术,邮件账号可能被入侵,真实员工也可能被冒充。即使多个模型同时参与判断,它们仍可能基于同一份错误信息得出相同结论。         更现实的做法,是直接守住付款的底线:          单笔金额不能超过限制;新收款地址不能立即付款;审批后收款目标不能被替换;超出风险阈值必须经过独立确认;任何远程管理员都不能临时关闭这些规则。         这样,即使AI被欺骗,损失仍然会被限制。         你不需要保证AI永远认得骗子,只需要保证骗子无法轻易带走你的钱。         这就是大道至简。

十一 |          前面可以有复杂的模型、提示词、工作流和检测系统。         最后只需要一条明确的边界:          不符合条件,就不执行。

十二 |          最后的系统不必比AI更聪明          很多人认为,保护AI的安全系统也应该是一套更强大的AI。         但位于最后一道边界的系统,未必需要理解自然语言,也不需要参与复杂推理。         它只需要知道几个确定事实:          这次操作要转多少钱,目标是谁,权限是否发生变化,数据是否可以恢复,风险条件有没有超限。         这些事实不满足,就拒绝。         安全不一定要比风险更聪明,它只需要守住风险最终必须经过的那道门。

十三 |          越靠近最终执行,系统反而越应该简单、独立和保守。         因为复杂意味着更多配置、更多依赖、更多攻击面,也意味着系统可能被前面的同一套错误逻辑同时影响。         真正的最后防线,不应该和Agent使用同一个提示词、同一个上下文、同一套权限,也不应该因为SaaS中有人点击了“强制执行”就自动失效。         它存在的意义,就是在所有人都认为可以继续时,依然保留拒绝的能力。         底线应该由人提前决定          当然,底线并不是系统自己创造的。         企业需要提前决定,什么事情绝对不能由AI单独完成。         可能是一笔超过限额的付款,可能是删除核心数据库,可能是修改管理员权限,也可能是让现实设备进入不可逆状态。         这些边界一旦确定,就不应该交给Agent在执行过程中临时解释。         真正的安全,不是让AI在最后一秒重新思考,而是让人类在风险发生之前提前划清边界。         AI可以负责分析、规划、推荐,甚至完成绝大部分自动化工作。         但越是不可逆、越是高价值、越可能造成现实损失的操作,越需要一道独立于AI判断的最终约束。         AI安全的终点,不是把模型训练成永不犯错的圣人,而是让系统在模型犯错时依然守得住自己的底线。

十四 |          未来的AI一定会越来越聪明,也会获得越来越多的工具和权限。         我们没有必要因为它可能犯错,就拒绝所有自动化。

十五 |          但我们也不能因为它越来越强,就默认把最后的决定权一起交出去。         最后想和大家讨论一个问题:          对你来说,AI最不能越过的底线是什么——钱、管理员权限、核心数据,还是现实设备的控制权?          本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 [email protected]

Current article:http://7su.feizengbubaipeirangnalouchuo.sbs/list_s0d/6ywwe.html

Published on:13:17:05


 Live broadcast Hall
·中国人民银行新增8家数字人民币业务运营机构
·王毅会见乌兹别克斯坦总统办公厅主任米尔济约耶娃
·幕后“金主”被判无期!山西省警方公布特大跨境电诈案
·五菱缤果S申报信息曝光 定位纯电小型SUV 比亚迪元UP同级
·समझदार झारखंड ...झारखंड के स्कूलों में घटा ड्राप आउट, प्राथमिक कक्षाओं में बच्चों को स्कूल छोड़ने की दर शून्य
 Press release
·韩国第一夫人终于露面,她已成为尹锡悦的“魔咒”?
·研究内容晚了一天,投顾服务时效应该怎样验收
·ST际华:新兴际华集团累计增持公司股份3994万股,增持计划实施完毕
·工信部:打造更多专精特新“小巨人”企业、制造业单项冠军企业
·媒体人:应剥夺快船首轮签并废除伦纳德合同
 Collection of municipal and local releases
·美团客服
·A股午评:超3500只个股飘红,三大指数集体收涨,A股午评:超3500只个股飘红,三大指数集体收涨
·【ユニクロ】「こんなのが欲しかった」「思った以上に良い」荷物がたっぷり入る『大容量バッグ』3選。使い勝手がよくて手放せません!
·《红色沙漠》发售五个月首迎折扣!全平台8折限时两周
·中央气象台:今晚到明晚,内蒙古、黑龙江、吉林、辽宁、山东、湖北、湖南、江西、浙江、福建、广西、海南岛等地有雷暴大风或冰雹天气

 

Copyright © 2020-2099 致命id All Rights Reserved 致命id Copyright