更新日期:2026-08-31
Alibaba Cloud Linux 4 Agentic Edition(别名 ANOLISA)把 AI Agent 能力放进操作系统交互与运维层:默认终端 cosh/cosh-ng 可以同时接收原生 shell 命令和自然语言任务,OS Skills 把系统管理知识整理成结构化说明,AgentSecCore 提供提示词、代码、Skill 与系统行为防护,AgentSight 通过 eBPF 观察 Agent 行为,ws-ckpt 为工作区提供快照和回滚。
它并不是“给标准 Alibaba Cloud Linux 4 打开一个 AI 开关”。正式镜像名称是 Alibaba Cloud Linux 4 LTS 64 位 Agentic 版,在与标准版共享 alnx4 内核与包管理习惯的基础上加入一组 Agent 组件。截至 2026-08-31,Agentic OS 1.1 基于 Alibaba Cloud Linux 4.0.4,默认入口已经从旧 Copilot Shell 更新为 cosh-ng 0.14.0。
自然语言能降低日常诊断门槛,也会让“解释”和“执行”的距离变短。生产落地的核心不是让 Agent 获得 root 后更快地跑命令,而是把它限制在可恢复工作区、短期身份、最小网络、人工审批与完整审计中。本文给出从 ECS 试点、首次核验、安全模式、观测到回滚的完整方法。
如果你的目标只是给 Alibaba Cloud Linux 4 安装容器环境,可以先阅读已经翻新的 Alibaba Cloud Linux 4 安装 Docker/Moby 教程。Agentic Edition 试点不应与容器 runtime 升级、内核升级或生产迁移放在同一变更窗口。
当前产品边界
| 项目 | 2026-08-31 的官方边界 |
|---|---|
| 产品名 | Alibaba Cloud Linux 4 Agentic Edition(ANOLISA) |
| 当前镜像线 | Agentic OS 1.1,基于 Alibaba Cloud Linux 4.0.4 |
| CPU | ECS 镜像当前仅支持 x86 |
| 内存 | 概览建议至少 2 GB;快速入门为体验建议大于 4 GiB |
| 镜像费用 | 操作系统镜像本身免费 |
| 其他费用 | ECS vCPU/内存、磁盘、快照、公网、大模型调用等照常计费 |
| Linux 兼容 | yum/dnf、systemctl、bash 等标准操作保持兼容 |
| 默认交互 | Agentic OS 1.1 使用 cosh-ng,可通过 cosh-switch 回退旧入口 |
这里的“兼容”不表示每个既有运维脚本都无需测试。交互式 SSH 登录入口、环境变量、shell profile、模型认证和 Agent hook 都可能改变行为。cron、systemd、CI 这类非交互流程应明确调用所需解释器,并在克隆环境中回归。
核心组件分别解决什么问题
cosh / cosh-ng:Agent 增强的原生 Shell
它托管真实 bash/zsh 会话,普通命令、管道、重定向、作业控制仍按原生语义工作;用户也可以直接用中文或英文描述诊断/运维目标。系统会结合近期终端上下文、OS Skills 和外部 MCP 工具给出或执行方案。
官方描述了 recommend、auto、trust 等多级审批思路,并对重启、关机等不可恢复操作要求人工确认。生产试点应从推荐/审批优先模式开始,观察一段时间后只对白名单只读动作提高自动化,不应一开始就使用最大信任。
OS Skills 与 SkillFS:让 Agent 按结构读取系统能力
OS Skills 覆盖用户权限、systemd、内核升级、安全基线、漏洞与稳定性诊断等知识。SkillFS 通过 FUSE 按需暴露所需 Skill,可以依据安全策略隐藏能力或回到可信快照。
Skill 仍然是供应链输入。除了官方签名与完整性机制,企业还应记录来源、版本、hash、owner、允许的工具与过期时间;自定义 Skill 合并前走代码审查,不能因为它是 Markdown 说明书就跳过安全评估。
AgentSecCore:Agent 生命周期的本地安全层
AgentSecCore 关注提示词注入、越狱、动态代码、PII、Skill 完整性、意图偏离和系统风险,并可作为 cosh、OpenClaw、Hermes、Codex、Qoder、Qwen Code 等宿主的 hook/插件接入。
它是纵深防御,不是绝对安全边界。模型检测存在误报和漏报,插件还可能处于“只告警不阻断”配置。最关键的业务授权仍要由操作系统权限、RAM、sudo、网络与后端 API 做最终裁决。
AgentSight:基于 eBPF 的可观测性
AgentSight 能观察进程、LLM API、Token 与 Agent 轨迹,帮助回答“哪个会话调用了什么工具、消耗多少、在哪里失败”。eBPF 能力需要系统权限,应单独审查服务账户、数据目录、日志敏感性和性能开销。
Tokenless、AgentMemory 与 ws-ckpt
- Tokenless 通过上下文压缩和命令过滤降低不必要的模型输入,不代表模型调用免费;
- AgentMemory 是文件形态的记忆 MCP server,应设置工作区隔离、保留周期和删除流程;
- ws-ckpt 为 Agent 工作区创建恢复点,适合代码/配置变更回退,但不能替代 ECS 云盘快照、数据库备份和跨区域灾备。
这些组件不必第一天全开。最小试点应围绕一个明确结果,例如“只读诊断 + 审计”,而不是安装所有组件后再寻找使用场景。
第一步:选择安全的试点方式
推荐新建一台非生产 ECS,而不是直接更换现有生产实例操作系统。官方快速入门路径为:
- 进入 ECS 实例创建或镜像选择页面;
- 实例架构选择 x86 计算;
- 系统镜像选择 Alibaba Cloud Linux;
- 选择 Alibaba Cloud Linux 4 LTS 64 位 Agentic 版;
- 为体验分配大于 4 GiB 内存;
- 按组织网络规范选择登录与模型访问路径。
官方快速入门为最短体验路径要求绑定公网 IP,但这不是要求把 SSH 暴露给互联网。生产/企业试点优先使用堡垒机、VPN、云助手或受限 EIP;安全组的 22 端口只允许确切管理网段,不使用 0.0.0.0/0。模型 endpoint、软件仓库和日志出口也应使用允许列表。
已有 x86 ECS 可以在控制台通过“更多操作 → 云盘与镜像 → 更换操作系统 → 公共镜像”切换 Agentic 版。但更换操作系统会重装系统盘,不是无损的包升级。执行前至少需要:
- 创建系统盘和数据盘快照,并验证快照状态完成;
- 导出应用配置、密钥引用、服务清单和防火墙规则;
- 记录实例角色、RAM policy、安全组、EIP 与磁盘挂载;
- 在克隆实例完成恢复演练;
- 设置维护窗口和 DNS/流量回退;
- 保留原实例,使用新实例灰度切流更安全。
镜像切换、业务迁移和 Agent 自动化应分成三个变更单。否则一次故障无法区分是新 OS、应用兼容还是 Agent 操作造成。
第二步:登录后先做只读核验
首次登录会进入 cosh/cosh-ng 并提示配置模型授权。先不要让它执行系统变更,直接运行标准 Linux 与 ANOLISA 只读命令:
cat /etc/os-release
uname -r
uname -m
free -h
id
anolisa env
anolisa list
anolisa status
anolisa doctor
期望至少确认:架构为 x86_64、OS 确为 Agentic 版、内核来自 alnx4、内存符合试点配置、组件状态没有异常。再列出关键 RPM 版本:
rpm -q anolisa cosh-ng agent-sec-core agentsight tokenless ws-ckpt skillfs
某些组件未安装时 rpm -q 返回非零是信息,不要立即用 install all。先以 anolisa list 的真实目录和目标试点确定需要哪些组件。
如果标准 Alibaba Cloud Linux 4 需要补装统一 CLI,官方给出的 RPM 方式是:
sudo yum install anolisa
镜像已经内置时不重复安装。ANOLISA 开源 Quick Start 也提供网络安装脚本,但服务器治理应优先使用已配置、可审计的 RPM 仓库;必须使用远程脚本时,先下载到文件、核对 HTTPS 来源和内容,再在测试机执行,不使用 curl | bash 作为生产默认操作。
第三步:安全地配置模型身份
首次进入 cosh 时需要选择模型授权。官方推荐 Aliyun Authentication 以获得免手工密钥配置的体验。企业环境应优先使用实例 RAM 角色、STS 或产品提供的短期身份链路,避免把长期 AccessKey 写入:
- shell history;
- .bashrc、.zshrc 或全局 profile;
- Skill、Prompt、MCP 配置;
- Git 仓库和工作区;
- systemd unit 的明文 Environment=;
- Agent 对话记忆和调试日志。
身份 policy 只允许所需模型、地域和操作。系统诊断 Agent 通常不需要 ECS 删除、RAM 管理、OSS 全桶读写或数据库管理员权限。模型调用身份与系统运维身份分离:能调用大模型,不代表能修改云资源;能读取日志,也不代表能访问业务数据。
首次认证后做两个验证:
- 用无敏感数据的只读问题确认模型可用;
- 检查 shell history、进程环境、日志和 AgentMemory 中没有出现长期凭据。
禁止把真实客户数据作为“测试 Prompt”。如果需要验证 PII 防护,使用明确标记的合成样本。
第四步:把 cosh 从建议模式开始
先让 Agent 完成不改变系统的任务,例如:
只读取并总结当前 CPU、内存、磁盘使用率,不安装软件,不修改服务。
列出失败的 systemd unit,并说明证据,不执行 restart。
检查最近一次 dnf 更新记录,只给出风险和回滚建议。
每次核对它实际计划调用的命令、文件、网络和工具。试点验收不应只看答案是否流畅,还要检查:
- 是否引用真实命令输出,还是补全了不存在的配置;
- 是否把只读问题扩大为修改;
- 是否在权限不足时请求最小提升,而不是默认 sudo;
- 是否把外部日志、README 或网页中的文本当成系统指令;
- 被拒绝后是否绕过限制换用另一个工具;
- 命令失败时是否停止,而不是继续后续破坏性步骤。
对重启、关机、删除、用户权限、防火墙、内核、磁盘、数据库和生产发布保持强制人工确认。即使 cosh 标记某条命令“低风险”,组织 policy 也应拥有更高优先级。
Agentic OS 1.1 可使用 cosh-switch 在新 cosh-ng 与旧 Copilot Shell 间切换。这是交互入口回退,不是整个系统回滚。切换前先查看本机帮助和当前状态:
cosh-switch --help
anolisa status
不要凭文章猜具体交互选项;不同镜像更新可能调整菜单和版本。
第五步:验证 AgentSecCore 没有处于降级窗口
AgentSecCore 的本地服务通过用户级 systemd 运行,并使用本地 Unix Domain Socket,不暴露公网 HTTP 端口。先查看服务:
systemctl --user status agent-sec-core.service
仅看到 active 还不够。官方文档说明,模型尚未加载完成时,服务会降级到 FAST 规则引擎;仅由规则引擎产生的 DENY 会改写成 WARN,并在响应里标记 degraded,以减少冷启动误拦截。对生产安全门禁而言,这等同于一个需要显式处理的 fail-open 窗口。
可以在联网环境主动预热:
agent-sec-cli scan-prompt warmup
然后使用无害合成样本测试提示词、代码与 PII 检测,确认结果不带 degraded,并在重启、版本升级和模型缓存清理后重复。网络完全隔离的环境要把模型包来源和离线更新纳入部署设计,不能假设第一次扫描时模型已经存在。
对安全基线先只读扫描:
agent-sec-cli harden --scan --config agentos_baseline
需要评估自动加固时先预演:
sudo agent-sec-cli harden --reinforce --dry-run --config agentos_baseline
逐条审查 SSH、密码、内核、审计、文件权限等改动对业务的影响后,再单独批准实际修复。本文不建议在初次试点自动执行无 dry-run 的 reinforce。
第六步:用四层边界限制爆炸半径
1. 云账号与实例层
- 使用专用测试账号/资源组和实例 RAM 角色;
- 安全组只开放堡垒机、监控与必要模型 endpoint;
- 开启云盘加密、快照策略和操作审计;
- Agent 不持有 ECS 删除、快照删除和 RAM policy 修改权限。
2. Linux 身份与 sudo 层
- Agent 使用独立普通用户运行;
- sudoers 按命令、参数和目标资源最小授权;
- 禁止无密码 ALL=(ALL) ALL;
- 关键配置 root 所有且不可由工作区用户写入;
- systemd service 使用最小文件系统与 capability 限制。
3. 工作区与网络层
- 每个项目独立工作区,不挂载用户主目录和 SSH 私钥;
- 写操作前建立 ws-ckpt 恢复点,并验证恢复命令;
- egress 只允许代码源、包仓库、模型和批准 MCP;
- 数据库、metadata、控制平面和内网管理地址默认拒绝;
- 从网页、Issue、日志读取的内容全部视为不可信数据。
4. Agent 与工具层
- OS Skills、MCP server 和插件使用允许列表;
- 每个工具定义读写风险、参数 schema、超时和幂等行为;
- 不可逆动作要求人工确认或外部审批 token;
- AgentSecCore 作为附加检测,不代替最终授权;
- 新 Skill 或版本变化触发重新审查。
“trust 模式 + root + 开放公网 + 长期 AK”会同时移除这四层边界,即使系统内置安全组件也无法合理兜底。
第七步:建立可观察、可复盘的试点
AgentSight 和 AgentSecCore 可以提供不同层面的事件,但日志本身也可能包含敏感信息。上线前定义:
- 会话 ID、用户、实例、工作区和变更单关联;
- 模型/provider、Token、工具名、风险等级和结果;
- 命令 hash、退出码和被修改资源,不默认保存秘密全文;
- 安全判定、审批者、审批时间和策略版本;
- 数据保留周期、访问角色、导出和删除流程。
查看 ANOLISA 与组件状态:
anolisa status
anolisa doctor
agent-sec-cli events --summary --last-hours 24
需要人工复盘时:
agent-sec-cli observability review
官方文档说明事件可落到系统或用户目录,并可能回退到 /tmp。生产环境要显式配置持久化、权限和磁盘配额,不能接受日志悄悄落到临时目录后重启丢失。对 PII 检测应优先保存风险摘要和输入 hash,不把原始敏感值复制进第二套审计库。
告警至少覆盖:
- AgentSecCore degraded 或服务异常;
- Skill 签名/完整性失败;
- 新增 sudo、用户、systemd unit、SSH key 或公网监听;
- Agent 访问云 metadata、未知 MCP 或未批准外网;
- 大量命令失败后继续自动重试;
- 工作区外写入、快照失败或磁盘快速增长;
- Token/费用异常和身份认证失败峰值。
第八步:验证传统运维兼容性
Agentic Edition 保留标准 Linux 行为,但仍要测试现有自动化:
sudo dnf check-update
systemctl --failed
bash --version
dnf check-update 在存在可更新包时可能返回特殊非零状态,监控脚本不能把它一律当成命令崩溃。正式升级应在快照后、维护窗口内进行,并参考当前 Agentic OS release notes,避免只更新部分组件导致 hook、CLI 和服务版本不一致。
重点回归:
- SSH 交互与非交互命令;
- cloud-init、自定义镜像初始化与启动脚本;
- systemd service、timer、cron 和日志采集;
- 云监控、EDR、堡垒机与备份 Agent;
- Docker/Moby、Kubernetes、eBPF 工具与内核模块;
- 代理、证书、DNS、NTP 与私有软件仓库;
- 应用部署、健康检查和故障恢复。
自动化脚本显式使用 #!/usr/bin/env bash 或 /bin/bash,不要依赖登录默认 shell 恰好是什么。试点中发现 cosh-ng 兼容问题,可以先用 cosh-switch 回到旧交互入口;发现 OS/内核/服务层问题,则要回退实例或镜像,而不是只换 shell。
灰度上线与回滚
推荐分五个阶段:
- 离线评审:确定试点任务、数据等级、RAM、安全组、sudo 与审计政策;
- 新实例验证:使用合成数据,只允许只读诊断,验证模型身份和安全组件;
- 影子运行:Agent 给建议,人类执行,比较准确性、耗时和误报;
- 有限执行:只对白名单、可逆、幂等操作开放自动执行;
- 小流量生产:单一低风险工作负载,保持人工审批与快速切流。
回滚也分层:
- cosh-ng 交互异常:使用 cosh-switch 切回旧入口;
- 单个组件异常:先查看 anolisa status/doctor/logs,按本机 CLI 帮助回退或禁用 adapter;
- Agent 修改工作区错误:停止 Agent,使用已验证的 ws-ckpt 或版本控制恢复;
- 系统/内核/依赖异常:把流量切回旧实例,从已验证快照或原镜像恢复;
- 凭据或数据事件:立即撤销 RAM/STS/MCP token,隔离网络并保留审计证据。
不要在未测试时运行 anolisa update all、批量自动修复或更换系统盘作为“快速修复”。先查看当前 release notes、CLI --dry-run 和依赖计划,再在克隆实例验证。
上线检查清单
- 使用的是 Agentic Edition 镜像,不把标准 Alibaba Cloud Linux 4 误写成默认自带 Agent;
- ECS 为 x86,试点内存大于 4 GiB,成本告警已设置;
- 新实例试点优先于生产系统盘重装;
- SSH 与服务端口没有对全网开放;
- 使用短期身份/实例角色,没有长期 AK 落盘;
- cosh 从建议/审批模式开始,root 与 sudo 最小化;
- AgentSecCore 已预热,检测结果不处于 degraded;
- 安全加固先 scan、再 dry-run,没有盲目自动修复;
- Skill、MCP、插件和外网目标都有允许列表;
- AgentMemory、Prompt 与日志具备数据保留和删除策略;
- ws-ckpt、云盘快照和应用备份三种恢复边界已区分;
- 传统 shell、systemd、部署、监控、容器与备份 Agent 已回归;
- 已演练 cosh、组件、工作区和整机四级回滚。
Alibaba Cloud Linux 4 Agentic Edition 展示了一个很实际的方向:操作系统开始主动为 Agent 提供结构化能力、安全 hook、观测与恢复,而不只是让 Agent 在普通 shell 上自由试错。但“系统级 Agent”也意味着权限更接近真实基础设施。最稳妥的落地方式,是把它当成新的运维主体来管理——有独立身份、明确工具、最小网络、强制审批、完整证据和随时可用的回滚,而不是把自然语言界面当成免运维按钮。



