LONGARENA ENGINEERING / 工程实战

RSI:生产级多智能体持续进化与工程实践

从单兵幻觉到双工流水线。LongArena 将智能体架构、测试驱动开发(TDD)与无人值守安全治理的真实踩坑与实战数据完全公开。

LongArena Core Team · · 14 分钟阅读 ·
Autonomous RSI双工流水线TDD五维溯源法

从单兵幻觉到工业级双工流水线

LongArena 的企业级生产系统由自主多智能体工程流水线持续维护:智能体在真实生产环境中诊断、复现、测试并修复线上工单。本专区公开我们在这一过程中的第一手工程发现、架构演进与经生产验证的安全协议。

文中所有指标均来自真实生产工单的盲测对照实验,案例标识与客户信息已脱敏。

第一章:为什么单 Agent 无法胜任生产环境?

在许多演示中,给单个大模型输入完整仓库和复杂报错,模型似乎能一次性完成“分析-修复-测试”。然而在长达数月的工业级真实生产实践中,我们发现了单 Agent 闭环全流程的三大不可逾越的瓶颈:

1. 上下文肥胖综合征(Context Bloat)与推理长尾

当一个 Agent 在同一会话中连续完成探索、走读、调试与单测时,上下文迅速堆叠至 10~15 万 Tokens,累计消耗超 160 万 Tokens。这会导致模型在 High Reasoning 模式下的单次交互延迟飙升至 4~5 分钟,且网络中断和幻觉漂移的概率呈指数上升。

2. “破案”与“工匠”的心智冲突

先遣排查需要极高的探索敏感度、模糊推理与快速时空定标;而工程落地需要极高的防御收敛性、测试先行(TDD)与严格的代码边界感。强求单一角色兼顾,极易导致“排查很深入但代码粗糙”,或“代码很严谨却修错了根因”。

3. 缺乏机器化交接门禁

单 Agent 容易在“自以为已经理解”的幻觉中跳过测试直接修改代码,或者在遇到沙箱边界时产生静默回退。

为了突破这一瓶颈,LongArena 开创了双 Worker 协同流水线(Dual-Worker Pipeline)。

第二章:双工协同流水线(DSH 探针 + Codex 工匠)

我们根据认知特性,将流水线严格解耦为两组异构智能体与一道强交接门禁。

双工流水线流转机制:无头探针只读取证 → 强交接门禁与会话蜕皮 → 纯净上下文 TDD 修复 Stage 1 · DSH 先遣探针 无头只读取证 Stage 1.5 · Guardian 门禁 机器质检 + 会话蜕皮 Stage 2 · Codex 工匠 纯净上下文 TDD 修复
双工流水线流转机制:无头探针只读取证 → 强交接门禁与会话蜕皮 → 纯净上下文 TDD 修复

Stage 1 DSH 先遣探针(Worker 1: Scout-Investigator)

  • 职责:纯只读探索、代码调用链走读、基于安全跳板的只读库表时空定标。
  • 特点:轻量级无头执行、不累积冗余对话历史、不编写任何业务代码。
  • 产出:工业级技术调查报告,明确直接根因、受影响主键、历史突变时间窗与修复建议。

INVESTIGATION_REPORT.md

Stage 1.5 Guardian 强交接门禁(Quality Gate)与会话蜕皮(Molt)

  • 外部守护进程执行机械化断言:调查报告存在且非空(> 1024 字节)。
  • 检查报告包含核心必要事实:根因、源码定位、对照组证伪、突变形态。
  • 扫描检查报告不包含明文密码或凭据泄露。
  • 质检通过后,触发白蚁协议第 9 条“会话蜕皮(Molt)”,彻底切断历史上下文。

Stage 2 Codex 施工工匠(Worker 2: Craftsman-Solver)

  • 在纯净的全新上下文中启动,仅注入上游排查结论。
  • TDD 契约单测先行:先编写测试用例复现漏洞,确认红灯基线。
  • 靶向防御编程:补充完整性校验与槽位防护,杜绝整条替换破坏。
  • 跑绿测试与全套 CI 门禁:单测 100% 通过,跑通类型检查与组件构建。
  • 收官归档:输出生命周期报告,恪守生产发布边界。

regression-before.log regression-after.log LIFECYCLE_REPORT.md

INVESTIGATION_REPORT.md
  -> Guardian Gate: non-empty > 1KB, facts complete, no credentials
  -> regression-before.log (RED baseline)
  -> targeted defensive fix
  -> regression-after.log (GREEN, 84/84)
  -> LIFECYCLE_REPORT.md

真实生产工单对比评测数据(脱敏对照实验)

同一生产工单(商机决策槽位完整性防御)分别在单 Agent 闭环与双工流水线下执行的盲测对照:

评测指标单 Agent 闭环模式双工协同流水线 (DSH + Codex)工程收益
排查完成耗时~14 分钟(混杂在长会话中)9 分 16 秒(556 秒)提速 35%
单轮上下文峰值130,711 Tokens(极度臃肿)< 15,000 Tokens(清爽轻量)降低 88%
全流程 Token 消耗1,643,347 Tokens~180,000 Tokens算力成本降低 89%
单次推理等待延迟4 ~ 5 分钟 / 轮20 ~ 40 秒 / 轮时延降低 85%
测试与质量保证84 项测试全绿84 项测试全绿(红灯基线先立)消除长尾超时风险
实验背景与指标口径说明

实验对象为真实线上数据异动工单(案例编号 CASE-SN15,已脱敏)。单 Agent 组由同一模型在单会话内完成排查、修复与测试全流程;双工组按 Stage 1 / Stage 1.5 / Stage 2 严格分工。上下文峰值取单轮请求最大值,Token 消耗为会话累计值,时延为单轮推理等待时间。

第三章:生产数据异动五维溯源方法学(Production Data Trace)

在云原生与多端协同系统中,数据异常时常陷入三方推诿:“是底层生成器缺陷?AI 工具改坏了?还是运营在后台人工改错了?”LongArena 沉淀了通用的五维时空溯源定标方法学:

时空定标主线:T0 初始生成 → T1 正常运行 → T2 突变窗口 → Nginx 主体指纹三角定位 T0 初始生成 初始快照比对 T1 正常运行 对照组健康运行 T2 突变窗口 覆写 / Hard-Delete Nginx 主体指纹三角定位 IP · User-Agent · 接口端点 · 操作节奏
时空定标主线:T0 初始生成 → T1 正常运行 → T2 突变窗口 → Nginx 主体指纹三角定位

1. 四维时空定标(T0 / T1 / T2)

比较初始生成母本的创建时间(T0)、课堂正常运行时间(T1)与异常发生时间(T2);若 T1 阶段数据完好且有正常交互记录,则当场排除“初始生成器缺陷”。

2. 对照组证伪(Control Group Falsification)

检查同剧本、同租户其他未报错组别与 NPC;若其他 NPC 标记完好且玩法引擎正常触发,则排除“系统底层玩法引擎缺陷”,定性为“特定对象数据受损”。

3. 突变形态诊断(Mutation Pattern Diagnosis)

区分“增量字段更新”与“整条删除重建(Hard Delete + Reinsert)”:通过自增 ID 跃迁和更新时间戳,查证系统是否存在“更新非关键属性时却粗暴重写整条列表、导致元数据槽位静默归零”的架构漏洞。

4. 主体指纹三角定位(Fingerprint Triangulation)

提取突变时间窗口内的 Web 访问日志:结合请求 IP、用户代理(User-Agent)、接口端点与操作节奏,精准定位触发主体。

5. 最小差异幂等恢复与长效契约防御

严禁通过“修改前端假状态”或“让用户重新出牌”冒充修复;修复不仅要在客户端补齐元数据槽位,更要在服务端接口建立不可绕过的槽位完整性契约校验。

第四章:安全网与白蚁协议(Termite Protocol)

无人值守迭代(Unattended RSI)的最大风险不是“做不出”,而是“失控破坏”。为此,LongArena 确立了不可让渡的四大安全底线:

1. 只读跳板与凭据隔离

Worker 绝不直接读取包含真实明文凭据的环境变量文件;通过系统核验的只读跳板脚本在非占用端口建立瞬时通信,禁止向公网泄露任何凭据。

2. 物理工作区隔离(Git Worktree Isolation)

每个工单必须在独立的物理 Worktree 和专属 Git 分支中施工,依赖通过受保护的全局缓存共享,严禁在主干工作区直接施工。

3. 权限分立与独立复核员(Independent Reviewer)

施工 Worker 产出代码后,由另一个独立的只读 Reviewer 进程进行安全与代码审查,审查通过后才提交至候选发布队列;严禁施工 Worker 自提自发。

4. 白蚁协议自演进内核

遵循 10 条自演进语法与 4 条安全网:任何行动留下可追踪痕迹(DEPOSIT)、高权重风险强制升级(ESCALATE)、上下文超限必须蜕皮交棒(MOLT)。

工程专区更新日期: · demo@long-arena.com