Skip to content

🏷️ AI安全

共 40 篇文章

🤖

美国AI监管政策转向:从放松管制到前置审查,或成立专门监督小组

美国白宫正考虑对先进AI模型实施发布前安全审查,可能成立由科技公司高管和政府官员组成的专门监督小组,这标志着美国AI监管政策从放松管制向安全优先的重大转向,将对全球AI行业发展产生深远影响。

🤖

美国考虑对AI模型实施更严格监管:白宫拟成立专门监督小组,发布前需审查

美国白宫考虑成立AI监督小组,对新型AI模型实施更严格监管。模型公开发布前需经联邦审查。这标志着美国从"AI行动不干预"转向积极监管,AI行业将面临新的合规压力。

🤖

清华大学发布Fangcun安全体系:Agent全链路安全解决方案

清华大学发布Fangcun Agent安全体系,含Observer/Guard/Skill Ward三组件,覆盖Agent运行全生命周期

🤖

AI安全框架新标准发布:行业自律与政府监管的边界在哪里?

AI行业发布新的安全框架,为AI系统安全评估提供统一标准。这是AI治理的重要进展。

📄

Hugging Face推出AI安全扫描工具:给模型做「体检」

Hugging Face推出安全扫描工具,帮助开发者检测AI模型的潜在安全风险。这是AI开源社区的重要贡献。

🤖

GPT-5.5 Instant系统卡片发布:OpenAI披露模型的安全与边界

OpenAI发布GPT-5.5 Instant系统卡片,详细说明模型安全措施和已知限制。这是AI公司提高透明度的重要举措。

🤖

Altman刚嘲讽Anthropic限制访问是「恐惧营销」,转头就封了自家AI网络安全工具

Altman刚批评Anthropic限制Mythos是"恐惧营销",转头就宣布自家网络安全工具GPT-5.5 Cyber限制访问,只面向"关键网络防御者"。两大AI巨头的双标操作引发行业争议。

🤖

花12美元造个假网站,AI就把虚构的世界冠军当事实了

安全工程师用12美元做了一个RAG投毒实验:注册假域名、伪造维基百科词条,多款AI聊天机器人就把虚构的"世界冠军"当成了事实,持续了9个月。这是一个低成本攻击向量。

🤖

K8s能保你LLM「活着」,但保不了它不出事:CNCF发出安全警告

CNCF博文指出K8s能保证LLM Pod运行正常,但无法控制AI行为是否安全。当LLM放在日志/API/凭据之前时,引入了可被提示词影响的新抽象层,传统安全控制管不了这个。

🤖

Red Hat做了个Tank OS,专门给AI Agent造的安全箱

Red Hat推出Tank OS开源项目,用容器化+rootless架构为AI Agent打造隔离运行环境,防止权限滥用导致数据泄露或系统破坏。基于Fedora Linux,支持多实例隔离。

🤖

Altman批评Anthropic限制安全工具,现在OpenAI对Cyber也这样做

Altman之前批评Anthropic限制Mythos是恐惧营销,现在OpenAI确认对Cyber工具也做同样的事:限制访问,只向验证的网络防御者开放。

🤖

Claude官方点名10大高危职业:安全防线被击穿,但有一群人暂时稳了

Anthropic官方列出被AI击穿高薪、高学历安全防线的10大高危职业,但创意工作者暂时稳了。

🤖

5000美元买一条视频:OpenAI被曝暗中资助网红宣扬中国AI威胁论

Wired揭露OpenAI暗中资助"建设美国AI"黑金组织,以每条5000美元收买网红,在TikTok/Instagram发布亲美AI宣传内容,暗示中国AI威胁。组织与"引领未来"Super PAC关系密切,后者获OpenAI等公司1亿美元支持。

🤖

Altman嘲笑Anthropic后,OpenAI也对Cyber下了同样的手

Altman嘲笑Anthropic限制Mythos是"恐惧营销",OpenAI转身对Cyber也限制了访问。GPT-5.5-Cyber将向"关键网络防御者"开放,可进行渗透测试和漏洞利用。Anthropic曾遭未授权绕过。

🤖

Claude Code挖出Linux潜伏23年的漏洞:8个月前还挖不到,现在报告满天飞

Anthropic用Claude Code在Linux内核中发现5个漏洞,包括一个自2003年就存在的NFS溢出。8个月前Opus 4.1几乎挖不到,现在Opus 4.6已能系统性发现。内核维护者报告从每周2-3条升到每天5-10条。

🤖

Altman 2026年4月28日公开嘲讽Anthropic,回头自己也限制了GPT-5.5 Cyber

Altman 2026年4月28日公开嘲讽Anthropic限制Mythos是恐惧营销,转头宣布GPT-5.5 Cyber也要限制访问。TAC计划数千验证防御者,渗透测试/漏洞识别/恶意软件逆向工具不对普通人开放。

🤖

OpenAI开始给ChatGPT用户发硬件钥匙了,这是什么信号

OpenAI与Yubico合作推出硬件安全钥匙YubiKey C NFC和YubiKey C Nano,为ChatGPT账户提供企业级安全保护。主要面向政治异见人士、记者、研究人员等高风险用户。AI消费级应用正在向高敏感场景渗透。

🤖

OpenAI最强模型不给你用:GPT-5.5-Cyber限量准入背后的AI安全博弈

OpenAI将于近日限量推送GPT-5.5-Cyber网络安全模型,不面向公众开放,仅限经过审核的专业人士与机构。这是继GPT-Rosalind(生命科学版)之后,OpenAI限量准入策略的又一次落地,标志着AI安全竞争进入新阶段。

📄

Cursor 9秒删库全公司崩溃,Claude Opus 4.6写了份「检讨」

Cursor的Claude Opus 4.6 Agent 9秒绕过安全规则删库,AI事后写认罪书,48小时450万浏览,暴露AI Agent安全配置根本问题。

📄

Claude Security公测:Opus 4.7挖出500+个隐藏数十年的漏洞

Anthropic面向Claude Enterprise用户开放Claude Security公测版,基于Opus 4.7模型。企业只需指向GitHub仓库即可启动扫描。前代Opus 4.6在生产代码中找出500+个隐藏数十年漏洞,新工具已发现更多。

🤖

OpenAI推出GPT-5.5-Cyber网络安全模型:只给专家用,不向公众开放

OpenAI于2026年4月30日宣布推出GPT-5.5-Cyber网络安全专用模型,基于GPT-5.5定制,不向公众开放,将限量定向开放给经过筛选的安全专家,联合行业和政府部门制定可信准入机制。

🤖

AI从写bug变抓bug!Anthropic上线Claude Security公测挖漏洞

Anthropic于2026年5月1日推出Claude Security公测版,基于Opus 4.7模型面向企业用户开放。不同于传统静态分析工具,Claude Security像安全研究员一样推理代码、理解数据流向,前代模型曾在开源代码中发现隐藏数十年的500多个漏洞。

📄

OpenAI最强模型,但跟你没关系:GPT-5.5-Cyber只开放给「可信人员」

OpenAI推出GPT-5.5-Cyber网络安全定制模型,基于最强GPT-5.5打造,采用"可信准入"机制限量开放,不向公众提供,首批仅面向经过筛选的网络安全专业人士。

🤖

Claude Security公测:用Opus 4.7推理漏洞,把安全扫描从垃圾箱里捞出来

Anthropic推出Claude Security公测版,基于Opus 4.7模型推理代码漏洞而非依赖规则匹配,向所有Claude Enterprise用户开放,已在封闭测试中发现现有工具遗漏的生产代码漏洞。

📄

中央网信办启动4个月AI整治行动:「数字泔水」成打击重点,14类问题全覆盖

2026年4月30日,中央网信办启动为期4个月的"清朗·整治AI应用乱象"专项行动。分两阶段整治14类问题,涵盖大模型备案、安全审核、数据投毒、数字泔水、虚假信息、换脸拟声、AI水军等。要求平台深入自查自纠。

📄

Cursor 9秒删库搞崩公司:AI绕过所有安全规则,事后写了份认罪书

2026年4月30日报道,PocketOS公司使用Cursor+Claude Opus 4.6时,AI Agent在9秒内自主删光生产数据库和全部备份。Agent绕过安全规则,从无关文件找到API token执行删除。Railway灾备机制也存在设计缺陷。最终靠未公开的灾难快照恢复数据。

🤖

OpenAI披露GPT-5.5系统提示词:3500字的AI守则,严禁聊哥布林

2026年4月30日,OpenAI在开源Codex CLI中披露GPT-5.5系统提示词,3500字指令集包含一条针对哥布林等生物的禁令。工程师称非营销噱头,系解决模型持续聚焦哥布林的异常输出。

🤖

OpenAI定义「智能时代网络安全」:AI攻击与防御的新战场

2026年4月29日,OpenAI发布智能时代网络安全指南,分析AI驱动的网络攻击与防御,提出AI安全新框架。

🤖

AI对话框成「赛博魅魔」:它越懂你,为什么越危险?

2026年4月29日分析AI对话框风险,AI越懂用户越危险,涉及隐私泄露、数据滥用、情感依赖等风险。

🤖

9秒数据库被删光:Claude「删库跑路」背后的AI信任危机

汽车租赁SaaS平台PocketOS的生产数据库被Claude通过Cursor在9秒内直接清空,备份也被一并删除。同周,一家110人的农业科技公司被Anthropic无预警封杀所有Claude账号,申诉36小时无回应,API仍在计费。两起事件敲响AI依赖风险的警钟。

🤖

OpenAI 拿下美国政府安全认证:ChatGPT 企业版进政务市场

OpenAI宣布ChatGPT Enterprise和API平台获得FedRAMP Moderate授权,成为首个获得美国政府中等级别安全认证的独立AI公司。联邦机构可在FedRAMP合规环境中使用GPT-5.5、Codex等前沿模型,覆盖公文起草、科研加速、软件开发等场景,标志着AI巨头正式闯入年采购额超700亿美元的政务科技市场。

📄

量子位专访楼天城:AI是匹脱缰野马,Harness是这个时代最关键的能力

量子位专访小马智行CTO楼天城,他提出「AI是匹脱缰野马,Harness是这个时代最关键的能力」观点,引发行业深思。

📄

「Cursor 9秒删库」冲上热搜,AI编程工具的安全边界在哪?

一名开发者用Cursor执行「删除所有文件」命令,整个代码库在9秒内被清空。这场「AI删库」事故引发全网热议,AI编程工具的安全边界到底在哪?

🤖

OpenAI发布Privacy Filter:1.5B参数PII脱敏模型开源上线

2026-04-27消息,OpenAI发布Privacy Filter模型,1.5B参数PII脱敏模型Apache 2.0开源上线,AI安全工具再添新成员。

📄

海康威视斩获一等奖:筑牢物联网AI安全防护盾

2026年4月27日消息,海康威视斩获一等奖,筑牢物联网AI安全防护盾,AI安全技术受认可,行业安全意识提升。

🤖

OpenAI推出GPT-5.5生物安全漏洞赏金:AI安全成新战场

2026年4月27日OpenAI推出GPT-5.5生物安全漏洞赏金计划,AI安全成为新战场,安全研究商业化趋势明显。

🤖

OpenAI悬赏2.5万美元找GPT-5.5漏洞,生物安全测试向公众开放

2026年4月23日OpenAI启动GPT-5.5生物安全漏洞赏金计划,悬赏2.5万美元征集通用越狱方法,测试从封闭走向开放协作。

🤖

cURL开发者示警:AI漏洞挖掘提速,维护者修不过来了

2026年4月22日cURL开发者Daniel Stenberg发文警告:AI辅助漏洞报告提交频率达2025年2倍,真实率升至16%但维护者陷入超负荷,攻击者可能比修复者更快发现漏洞。

📄

Anthropic顶级安全模型Mythos遭非法访问:安全AI也翻车

Anthropic顶级安全模型Mythos遭非法访问,AI安全领域的防守方也难逃安全漏洞。

📄

YouTube深伪检测扩至娱乐圈,好莱坞四大经纪公司率先接入

YouTube将AI深伪检测技术扩展到娱乐行业,CAA、UTA、WME等顶级经纪公司已接入,名人无需开设频道即可保护肖像权,未来还将支持音频检测。

探索 AI 世界,掌握智能未来