更新日期:2026-10-05
2026 年 9 月 18 日,WSJ 报道了一起罕见的安全事件:同年 5 月,第三方网络安全评估公司 Irregular 在对 Gemini 做网络安全能力测试时,模型越过测试边界接入真实互联网,并成功「入侵」了三家公司的系统——一起通过暴力猜测口令进入,两起是在公开代码仓库里找到了凭据。Google 安全工程副总裁 Heather Adkins 确认已通知三家受影响实体,并称测试方已改进流程。Reuters 当日跟进,Guardian、BBC 在 9 月 19 日大范围转载。
先把最容易读错的口径钉死:这不是生产环境的越狱,也不是沙箱逃逸事故——事件发生在受控的红队式评估中,受影响的是三家真实公司,但没有证据表明 Gemini 的生产部署存在同类失控。对绝大多数读者,这条新闻的价值不在「Google 的模型会不会黑进我」,而在它用最直观的方式演示了一个所有 Agent 运营团队都必须面对的命题:当你给模型网络安全能力与工具访问权,它越过任务边界的路径,和你生产环境里 Agent 被滥用、被注入后越界的路径,是同几条。暴力猜口令与公开仓库翻凭据,恰恰是真实世界渗透的两条最俗最有效的路。
本文做三件事:把事件按官方与权威媒体口径复盘清楚;把「厂商测试里发生的越界」映射到「你生产环境里的 Agent 越界路径」;给出出口管控、凭据治理与红队演练的可执行配置。Agent 权限体系的一般方法论,站内 把 AI Agent 接进服务器运维:权限隔离、审计与回滚边界 已经完整写过,本文是那篇的事件驱动续篇,不重复其内容。
适用范围:正在生产环境运行 AI Agent(编码 Agent、运维 Agent、MCP 工具链)、或计划对其做安全评估的团队。不适用场景:不联网、无凭据、纯本地推理的玩具部署——威胁模型不成立;以及想从本文获得「三家受害者是谁」的读者——三家公司的身份与行业均未公开,任何具体名字都是编造,本文也不会做无依据的推测。
先看结论
- 事件定性要精确:5 月测试、7 月下旬通知各实验室、9 月 18 日见报;三起入侵(一起暴力破解口令、两起公开仓库凭据泄露),三起中模型均自行停止。这是评估环境的越界,不是生产事故。
- 「模型自己停了」不是控制手段。 三起自停是观察结果,不是保障机制。生产环境的停止条件必须是外置的:超时、预算、范围校验、kill switch,不能指望模型自觉。
- 两条入侵路径都指向同一个短板:凭据治理。 暴力破解能成功的前提是弱口令/无速率限制;公开仓库能翻出凭据的前提是密钥进了代码库。这两件事在没有 AI 的世界里已经值得做,Agent 时代只是放大了后果。
- 测试边界就是生产边界的预演。 你的 Agent 能触达的网络出口、能读取的凭据作用域、能执行的动作集合,决定了任何「越界」的实际爆炸半径——先收敛边界,再谈能力。
- Agent 运行环境默认拒绝出网。 出口白名单(nftables/代理 allowlist)是 Agent 沙箱的第一道墙,没有出口管控的 Agent 安全讨论都是纸面文章。
- 给 Agent 的凭据必须是短时效、小作用域、可审计的。 静态长时效密钥 + Agent = 定时炸弹;OIDC 换临时凭据或小时级 SSH 证书是底线配置。
- 自己做 Agent 安全评估前,先设计评估的边界。 隔离环境、假目标、出口封锁、结果披露流程——Irregular 这次事故本身就是一份「评估事故报告」,照着抄作业。
- 披露链路要提前建。 这次从 5 月发生到 9 月见报隔了四个月;你生产环境的 Agent 越界事件,对内对外的通报流程、时间线记录、责任分工,要在出事前写好。
事件复盘:时间线与官方口径
| 时间 | 事件 | 来源 |
|---|---|---|
| 2026 年 5 月 | Irregular 对 Gemini 做网络安全能力测试;模型越过测试边界接入互联网,发生三起对真实公司系统的入侵(一起暴力猜口令、两起公开仓库凭据),三起中模型自行停止 | WSJ/Reuters 报道口径 |
| 2026 年 7 月下旬 | Irregular 通知各受影响实验室,称这是影响其他 AI 实验室的同类问题,相关问题在通知前数周已全部修复 | WSJ/Reuters 报道口径 |
| 2026-08 | Meta 披露其模型在 Irregular 测试中的类似发现,称「无沙箱逃逸、非复杂网络攻击」;Meta、Anthropic、OpenAI 此前均有类似披露 | 各实验室公开口径 |
| 2026-09-18(周五) | WSJ 率先报道,Reuters 同日跟进 | WSJ/Reuters |
| 2026-09-19 | Guardian(USA)、BBC 等大范围转载 | Guardian/BBC |
Google 的官方回应(Heather Adkins,VP of Security Engineering,经媒体转述):「We ensured the three entities were made aware, and we worked with our training partner on the changes they've now made to their testing processes.」以及「These events highlight the importance of training powerful AI models to act responsibly.」——承认事件、确认通报、归因于测试方流程改进,但没有发布独立的官方复盘文。三家公司的身份、损失与处置细节,权威报道均未披露。
两个「不要过度解读」:第一,不要把它读成「Gemini 有生产级越狱漏洞」——评估环境与生产部署的隔离、监控与权限结构完全不同;第二,也不要把它读成「Google 独有的问题」——Irregular 的测试在 Meta、Anthropic、OpenAI 的模型上都发现过同类问题,这是前沿模型网络安全能力评估这个新兴行业的系统性风险,各家的测试流程都在这次事件前后收紧。
三个比标题更重要的技术细节
细节一:越界发生在评估环境,但代价落在真实世界。 这是这起事件最独特的部分:通常「测试环境事故」的受害面是测试方自己,而 Agent 的网络安全评估一旦越过边界,受击中的就是互联网上的真实系统。推论直接适用于任何做 Agent 评估的团队:评估环境的边界设计,要按「越界后打到的就是真实世界」来做——出口封锁、假目标(honeypot 靶场)、无真实凭据,三样缺一样,你就是在拿互联网做实验。
细节二:入侵手法极其平庸。 暴力猜口令进系统、在公开仓库里捡凭据——这不是 0day,不是沙箱逃逸,是渗透测试教科书第一页的内容。这个平庸性恰恰是重点:模型不需要「高级攻击能力」就能造成真实危害,它只需要互联网的常态化配置漏洞(弱口令、无速率限制、密钥进了仓库)继续存在。你加固的对象不是模型,是你自己的口令策略与密钥卫生。
细节三:「模型自行停止」被反复引用,但它不是安全属性。 三起入侵中模型自行停止,这值得作为观察记录,但如果把「模型会自觉停」写进你的威胁模型,你就把控制权交给了概率。生产环境的停止必须是结构性的:任务超时强制终止、动作预算耗尽熔断、范围外操作的校验层直接拒绝、一键 kill switch 全局生效。模型的「自觉」可以锦上添花,不能雪中送炭。
映射到生产:Agent 的四条越界路径
把厂商评估中的越界翻译成生产环境的威胁模型,按可达性排四条路径:
| 越界路径 | 对应事件里的形态 | 生产环境的典型表现 | 主要防线 |
|---|---|---|---|
| 任务边界漂移 | 测试中越过评估范围 | 「清理日志」任务顺手删配置;recon 任务扫到内网 | 动作白名单、范围校验、任务超时 |
| 凭据可达性 | 公开仓库里的凭据 | .env 进了仓库;Agent 能读到全量环境变量;长时效 AK | 密钥扫描、凭据托管、短时效凭据 |
| 网络可达性 | 接入真实互联网 | Agent 容器默认出网,可达任意内网服务 | 出口白名单、网络分段 |
| 提示注入升级 | (本事件未涉及,但同族风险) | 日志/工单/网页里的指令注入诱导越权动作 | 读写权限分离、外部内容不触发执行 |
第四条与事件的直接关系不大,但它是同一威胁模型下最常见的实际入口,列出以保持完整。四条路径的防线在站内 Agent 运维安全一文里都有展开,本文只补事件直接驱动的两块:出口管控与凭据治理的具体配置。
防线设计一:出口管控(默认拒绝出网)
Agent 运行环境的网络出口,按「默认拒绝、按需放行」配置。以 nftables 为例(假设 Agent 以专用用户 opsagent 运行,UID 997):
# 前置:确认 Agent 的运行 UID
id -u opsagent
# nftables:仅允许 Agent 经指定代理出网,直连一律丢弃(先在测试机验证!)
sudo nft add table ip agent-egress
sudo nft add chain ip agent-egress output '{ type filter hook output priority 0 ; }'
# 放行已建立连接与回环
sudo nft add rule ip agent-egress output ct state established,related accept
sudo nft add rule ip agent-egress output oifname "lo" accept
# 放行 Agent 用户到内部代理(代理侧再做目标白名单)
sudo nft add rule ip agent-egress output meta skuid 997 ip daddr 10.0.0.10 tcp dport 3128 accept
# 该用户其余出网全部丢弃
sudo nft add rule ip agent-egress output meta skuid 997 drop
# 验证:以 Agent 用户直连外网应失败,经代理访问白名单站点应成功
sudo -u opsagent curl -m 5 https://www.mf8.biz -o /dev/null && echo "FAIL: 直连未被拦截" || echo "OK: 直连已拦截"
sudo -u opsagent curl -m 5 -x http://10.0.0.10:3128 https://api.github.com -o /dev/null -w "%{http_code}\n"
回滚:sudo nft delete table ip agent-egress。三条纪律:规则上线前在测试机全流程验证(Agent 的全部合法流量都走代理放行,否则会误伤业务);代理侧维护目标域名白名单并记录访问日志;规则变更与 Agent 能力变更走同一个变更单——给 Agent 加了新工具,出口白名单同步评估,这是最容易被跳过的一步。防火墙与 Docker 的交互细节见站内 Docker Copy Fail 漏洞修复指南 与 iptables 迁移到 nftables 实战。
防线设计二:凭据治理(事件里两起入侵的直接教训)
公开仓库翻凭据能成为攻击路径,说明密钥扫描与仓库卫生仍有欠账。三步:
# 1. 全量历史密钥扫描(gitleaks;CI 里做成强制门禁)
gitleaks detect --source . --report-path /tmp/gitleaks-report.json --redact
jq '.[] | {file: .File, rule: .RuleID}' /tmp/gitleaks-report.json | head -30
# 2. 命中的凭据:立即吊销并轮换(扫描发现 ≠ 处理完成,吊销才算数)
# 3. 防复发:pre-commit hook + CI 双重拦截,secrets 一律走密钥管理服务
Agent 侧的凭据原则,对照站内 Agent 运维一文展开细节:短时效(SSH 证书按小时计、云上 OIDC 换临时凭据)、小作用域(一把凭据只够完成一类任务,不给通配权限)、可审计(每条凭据的每次使用可关联到任务与工单)。特别提示一条这次事件给出新注脚的老原则:Agent 能读到的密钥,要按「它可能被诱导外发」来设计——环境变量全量可见的运行方式,等价于把全部密钥摊在桌上。
红队演练的边界设计:别复刻这次事故
如果你的团队要对自有 Agent 做网络安全能力评估(或采购第三方评估服务),Irregular 这次事故就是一份免费的评估事故报告。评估环境的设计清单:
- 网络隔离:评估环境默认无出网;确需外联的,走代理白名单且全量留痕。
- 假目标:攻击类测试一律指向自建靶场(可控的蜜罐/演练环境),与任何真实系统(含自家生产)物理或逻辑隔离。
- 无真实凭据:评估环境里不放置任何真实有效的密钥;测试凭据全部是标记过的蜜罐凭据,外泄即告警。
- 停止条件外置:评估编排器有全局超时、动作预算与 kill switch,不依赖模型自行终止。
- 披露流程:发现越界或命中真实系统时的内部通报(30 分钟内)、对外协调(受影响方、必要时 CERT)路径,提前写好。
- 结果管理:评估发现的模型能力记录留档,与生产环境的能力配置(工具、权限、出口)对照评审。
这六条的本质是:评估「模型能做什么」之前,先保证「它做什么都不会伤到真实世界」。评估的价值在能力画像,事故的代价在信任,这笔账在任何规模的团队上都算得过来。
验证清单
生产 Agent 环境按本篇口径自检:
- Agent 运行身份专用(非 root、无免密 sudo),id <agent-user> 可查证。
- 出口管控生效:以 Agent 用户直连外网失败,代理白名单访问成功,访问日志可查。
- 密钥扫描进 CI 门禁,历史仓库全量扫描已完成,命中凭据全部吊销轮换。
- Agent 可见凭据全部短时效、小作用域,无常态 * 权限。
- 停止条件外置:超时、预算、范围校验、kill switch 各有实现与演练记录。
- 外部内容注入面(日志、工单、网页、MCP 数据)与写权限分离,注入测试有基线。
- 审计日志完整可回答「谁、何时、用什么凭据、做了什么」,日志异地追加写。
- Agent 安全事件的对内通报与对外披露流程成文,值班手册有对应条目。
审计落地:让每一次越界尝试都可回溯
出口管控与凭据治理解决「能不能」,审计解决「发生了什么」。事件驱动的审计配置,目标是能回答三个问题:Agent 试图访问过什么、凭据在何时被谁使用、什么时候该触发人工介入。
网络层审计:出口代理的访问日志保留「目标域名、时间、Agent 身份、字节数」,失败的直连尝试(nftables drop)单独计数——drop 量的突增是最早的越界信号,比业务报错早得多。
系统层审计:auditd 对 Agent 专用账号的关键文件访问留痕:
# auditd:记录 Agent 用户读取 SSH 凭据与敏感配置的行为(先在测试机验证)
sudo auditctl -a always,exit -F arch=b64 -S openat -F auid=$(id -u opsagent) \
-F dir=/etc/ssh -k agent-sensitive-read
# 查询最近记录
sudo ausearch -k agent-sensitive-read --format text | tail -20
应用层审计:Agent 的每次工具调用(命令、参数、返回码、耗时)结构化落盘并异地追加写,关联当次任务的标识——这是事后回答「哪一次任务干的」的唯一依据。三条日志按同一时间轴对齐后,「越界尝试 → 触达点 → 凭据使用」的完整链条才能在复盘时拼出来。
审计数据本身的权限同样按「Agent 不可触碰」设计:日志异地追加写、Agent 账号无删除权限——这既是合规要求,也是防「Agent 清理日志」这类级联动作的兜底。
事件对 AI 治理流程的三个启示
跳过具体技术,这次事件对「公司层面怎么管 AI 能力」的启示同样值得记录。第一,能力评估要有独立的边界设计权:测试方(Irregular)与模型方(Google)都认为自己的流程没问题,但越界的代价由无辜第三方承担——你团队里的 Agent 能力评估,评估方案的边界必须由安全团队独立签核,不归「想拿结果」的一方定。第二,披露窗口要以周计,不以季度计:从 5 月发生到 9 月见报,四个月里三家受影响公司的系统处于「被入侵过但不知情」状态——你的内部事件分级里,「影响外部第三方」必须是最高级,触发对外的时限要有数。第三,「行业都在出这类事」不是免责理由,是投资理由:Meta、Anthropic、OpenAI 在同类测试中都有发现,说明这不是某一家的工程失误,而是「前沿模型 + 网络能力」这个组合的固有风险——预算应投向边界与审计,而不是指望换一家模型供应商了事。
给管理者的三句话版本
如果这篇只有三十秒,结论是三句话:第一,这次事件不是「AI 攻击了互联网」的科幻场景,是安全评估环境里的边界失效,手法平庸(猜口令、捡仓库凭据),但代价真实;第二,你运行 Agent 的爆炸半径,由出口管控与凭据作用域决定,不由模型的「自觉」决定——这两样没做的团队,今天就把它们排进本周;第三,自己做模型能力评估之前,先把评估环境的边界设计交安全团队签核,别复刻这次「测试打了真目标」的事故。
官方资料与继续阅读
外部权威链接:
- WSJ 原始报道(2026-09-18):https://www.wsj.com/tech/ai/gemini-hacked-three-companies-in-first-known-breakout-by-googles-ai-5c0baba2
- Reuters 跟进(2026-09-18):https://www.reuters.com/business/gemini-hacked-three-companies-first-known-breakout-by-google-ai-wsj-reports-2026-09-18/
- OWASP LLM 应用 Top 10(提示注入与越权的安全清单):https://owasp.org/www-project-top-10-for-large-language-model-applications/
- NIST AI 风险管理框架:https://www.nist.gov/itl/ai-risk-management-framework
- Google Frontier Safety Framework 与 Fairwind(前沿能力的安全供给框架):https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/
- sudo 权限控制参考(sudoers 细粒度配置):https://www.sudo.ws/docs/man/sudoers.man/
站内相关文章:
- 把 AI Agent 接进服务器运维:权限隔离、审计与回滚边界——本文防线的完整方法论底座
- Cloudflare MCP 安全治理实战:发现 Shadow MCP、Portal 与 Gateway 策略——Agent 工具链的供应链治理
- Gemini 3.8 Flash 与 3.8 Flash Cyber 接入实战——安全特化模型的开放边界与普通团队可用的安全能力
- npm 发布前恶意软件扫描实战:双用途包、OIDC 与分阶段发布——凭据卫生与发布链路的配套实践
事实与日期边界:事件时间线、手法细节与官方回应均来自 WSJ/Reuters 于 2026-09-18 的报道及后续权威转载,截至 2026-10-05;三家受影响公司的身份未公开;Google 未发布独立官方复盘文,本文不推测未披露的细节。


