AI Agent恢复与委派成形
今天最值得看的变化,不是 Agent 又多了一个功能,而是恢复身份、工具执行真值、长期委派和技能来源开始被写成可检查的系统状态。
RISC 机器说明
RISC = 生产级 Agent / 机器人身体的四个系统
一个真正能上生产的 Agent,不能只有大脑。它要能持续运行,要能判断和行动,要能抵御错误、攻击和投毒,也要能进入真实世界的协作网络。
ALUX 今日雷达
恢复状态开始包含身份与权限
Claude Code 的版本说明表明,真正的恢复不是回到最后一条消息,而是恢复原 Agent、工具限制、工作区和在途意图。
生态认证仍快于能力证明
技能下载认证、域名策略和仓库内委派都在补安全,但仍缺可衰减授权、效果幂等与跨组织责任结算。
Agent Continuity & Authority Envelope v0
统一 resume identity、delegation state、effect truth、skill provenance、capability veto 与 evidence retention。
重点信号
Claude Code 2.1.216 把长会话恢复、后台重跑与隔离绕过修复压进同一版本
发生了什么:2.1.216 修复长会话消息归一化随轮次平方增长、慢恢复、后台会话恢复后丢失原 Agent 提示与工具限制、容器重启时丢失在途消息等问题,同时堵住 worktree 通过 git 参数回到共享 checkout、.claude 符号链接越界写入与 rewind 经硬链接改写文件等隔离缺口。
对 ALUX 的关系:这组修复把持续执行、恢复、执行身份和文件边界放进同一条责任链。ALUX 最该学习的不是某个终端交互,而是恢复时必须同时恢复 Agent 身份、工具限制、工作区边界和在途意图,不能只恢复文本历史。
可行动建议与产出物:建议形成 Agent Resume Identity Receipt,绑定 session_id、agent_profile、tool_restrictions、workspace_root、inflight_turn、auth_epoch、resume_reason 与 post-resume verdict。 可沉淀为:Agent Resume Identity Receipt v0。
这条消息主要动到机器人的强韧 / 机体:长会话、后台任务与容器重启后的恢复能否继续,是身体能不能站住的直接证据;安全 / 免疫为次维度,因为恢复时还必须守住工具限制、工作区和文件边界。
Agno 2.8 把工具执行真值、隔离 rollout 与抗注入裁判做成统一评估面
发生了什么:2.8.0 增加 CodeScorer、JudgeScorer、ToolCallScorer 与隔离 rollout 环境;每次尝试使用新数据库、会话和用户,关闭记忆写入与缓存,并把被拒绝、报错或人工拒绝的工具请求排除在成功执行之外。版本还用随机 nonce 加固裁判提示,避免被评估文本逃逸输出边界。
对 ALUX 的关系:行业正在承认“模型请求过工具”不等于“工具成功执行”,“裁判给出分数”也不等于裁判未被注入。ALUX 可把真实效果、拒绝原因、隔离环境和评估策略绑定到可重放运行证据。
可行动建议与产出物:可沉淀 Verified Agent Evaluation Envelope,覆盖 expected_effect、actual_effect、refusal_or_error、environment_fingerprint、policy_drift、judge_model 与 provenance_sidecar。 可沉淀为:Verified Agent Evaluation Envelope v0。
这条消息主要动到机器人的安全 / 免疫:评估必须识别假成功、人工拒绝和裁判注入;强韧 / 机体为次维度,因为隔离 rollout 与多次重复运行用于观察真实通过率和漂移。
Qwen Code 用标签接管 Autofix,把百轮委派、人工重启与 fail-closed 校验显式化
发生了什么:预览版新增由 autofix/takeover 标签驱动的 PR 接管,可把托管上限从 5 轮提升到 100 轮;重新接管会开启新计数窗口但保留全局水印,skip 标签在所有介入路径上优先。该变更还修复 forced dispatch 因 jq 布尔处理而长期绿色空转,并把缺字段校验改为 fail-closed。
对 ALUX 的关系:这是很贴近 ALUX 的长程委派样本:人工授权开启、显式标签作为状态源、轮次封顶、可重新武装、旧反馈不重放、释放后停止未来介入。ALUX 可把这些行为从 GitHub 工作流惯例提升为通用会话与能力语义。
可行动建议与产出物:建议形成 Delegated Work Session Contract,字段包括 grantor、target_pr、takeover_state、round_cap、rearm_event、global_watermark、skip_veto、secret_scope 与 release_effect。 可沉淀为:Delegated Work Session Contract v0。
这条消息主要动到机器人的连接 / 社会:维护者把一项长期工作显式委派给 Agent,并可接管、重启和释放;安全 / 免疫为次维度,因为命令权限、skip 否决、fail-closed 校验与密钥暴露决定委派是否可控。
CrewAI 1.15.5 为技能仓库下载加入认证,Skill 供应链开始进入权限面
发生了什么:1.15.5 的核心功能只有一项:对技能仓库下载增加认证。它紧接 1.15.4 将 Skills Repository 移出实验状态,说明技能生态从可发现、可下载进入身份与访问控制阶段。
对 ALUX 的关系:技能不再只是代码包,而是 Agent 能力供应链。ALUX 应把仓库身份、包哈希、签发者、下载授权、运行时能力和撤销状态分开记录,避免“能下载”被误读成“能安全执行”。
可行动建议与产出物:适合整理 Skill Supply-Chain Receipt,覆盖 registry_identity、package_digest、publisher、download_grant、runtime_capabilities、dependency_attestation 与 revoke_event。 可沉淀为:Skill Supply-Chain Receipt v0。
这条消息主要动到机器人的安全 / 免疫:技能下载开始要求身份与授权;连接 / 社会为次维度,因为技能仓库是 Agent 进入开发者生态的分发接口。
Deep Agents 0.1.44 同时修正审批资格提示与 MCP 认证启动阻塞
发生了什么:0.1.44 在不符合条件时隐藏审批界面的 Auto 选项,并把 MCP 认证的首次文件系统加载移出异步事件循环,避免启动时因阻塞调用失败。认证支持加载失败时,只影响需要它的 MCP server,不阻断无关或 stdio server。
对 ALUX 的关系:一个生产运行时既要让权限选项和真实资格一致,也要把局部连接故障限制在最小范围。ALUX 可把 approval_eligibility、connector_auth_state 与 failure_scope 写进同一启动收据。
可行动建议与产出物:建议形成 Connector Startup Receipt,包含 approval_eligible、auto_mode_state、mcp_server、auth_loaded、blocking_work_isolated、failure_scope 与 retry_policy。 可沉淀为:Connector Startup Receipt v0。
这条消息主要动到机器人的安全 / 免疫:审批界面必须和实际资格一致,MCP 认证失败也要按连接器边界隔离;强韧 / 机体为次维度,因为启动阻塞与故障局部化决定系统能否继续站住。
Langfuse 3.222 让保留期清理按到期积压排序,观测后台开始暴露运行债务
发生了什么:3.222.0 将 retention cleanup 按 expiry lag 优先调度,修复实验成本只统计部分观测树的问题,并压缩 session 视图。版本把数据到期积压、完整成本树和会话阅读效率同时落进观测产品。
对 ALUX 的关系:可观测系统本身也会积累运行债务。ALUX 若要提供审计与重放,必须记录证据保留策略、清理水位、归档证明和全树成本,避免后台积压悄悄改变可追责范围。
可行动建议与产出物:适合形成 Evidence Retention Ledger,记录 retention_policy、expiry_lag、cleanup_watermark、archive_hash、observation_tree_cost 与 deletion_receipt。 可沉淀为:Evidence Retention Ledger v0。
这条消息主要动到机器人的强韧 / 机体:观测后台能否及时清理到期数据并正确统计完整运行成本,决定证据系统能否稳定运转;安全 / 免疫为次维度,因为保留与删除直接影响审计边界。
Stagehand 3.7.3 同时加入域名策略、环境变量警告与浏览 Agent 基准
发生了什么:3.7.3 为 setDomainPolicy 增加文档,对 browse CLI 自动加载 .env 给出警告并提供退出开关,引入 OdysseysBench 浏览 Agent 基准,同时修复评估 skill 的来源路径。
对 ALUX 的关系:浏览 Agent 的风险集中在可访问域名、无意加载的秘密和评估环境漂移。ALUX 可把域名策略、环境变量来源、浏览会话和基准版本统一进执行前能力合同。
可行动建议与产出物:可沉淀 Browser Session Capability Receipt,覆盖 allowed_domains、credential_sources、env_autoload、navigation_effects、download_hash、benchmark_version 与 policy_verdict。 可沉淀为:Browser Session Capability Receipt v0。
这条消息主要动到机器人的安全 / 免疫:域名策略和 .env 自动加载决定浏览 Agent 能接触哪些站点与秘密;智能 / 大脑为次维度,因为 OdysseysBench 用于测量浏览规划与执行能力。
融资 / 合作窗口
技术 / 产品启发
风险边界
ALUX 不能被说成已经完整交付智能体平台。当前底层 TVM 已具备并发、持久化执行、能力安全、运行记录和逐比特重放审计等关键基础;智能体产品层、可观测性、仪表盘、追踪与评估工具仍是待构建和融资重点。也不要说 TVM 让 LLM 本身确定性。准确说,TVM 记录模型输出和运行环境输入,使编排、权限、状态转移和审计可重放、可验证。长会话修复、隔离 rollout、仓库内接管、技能下载认证、审批资格、保留期清理和域名策略,都不能自动证明跨步骤原子回滚、对象能力或中立跨公司协作。
来源
- Anthropic Claude Code:Claude Code 2.1.216 把长会话恢复、后台重跑与隔离绕过修复压进同一版本 官方发布
- Agno:Agno 2.8 把工具执行真值、隔离 rollout 与抗注入裁判做成统一评估面 官方发布
- Qwen Code:Qwen Code 用标签接管 Autofix,把百轮委派、人工重启与 fail-closed 校验显式化 官方发布
- CrewAI:CrewAI 1.15.5 为技能仓库下载加入认证,Skill 供应链开始进入权限面 官方发布
- LangChain Deep Agents:Deep Agents 0.1.44 同时修正审批资格提示与 MCP 认证启动阻塞 官方发布
- Langfuse:Langfuse 3.222 让保留期清理按到期积压排序,观测后台开始暴露运行债务 官方发布
- Browserbase Stagehand:Stagehand 3.7.3 同时加入域名策略、环境变量警告与浏览 Agent 基准 官方发布