>_ DevTrendszh

语言

首页

语言

板块

前端 后端 移动端 DevOps AI / ML 游戏开发 区块链 嵌入式 安全
JavaScript

停止手动编写提示词:如何将 AI 代理变成自动化流水线

Anthropic 的 Claude Code 开发负责人 Boris Cherni 曾承认,他不再手动编写提示词。相反,他运行自动循环,为 Claude 形成任务、启动它并自动验证结果。写一次提示词不是问题。但如果你每天向 AI 助手输入相同的指令——无论是检查 CI 还是整理 bug——你就是在做重复性工作。

开发者 Kobus Greyling 在 GitHub 上发布了一个名为 loop-engineering 的项目,提出改变这种方法。不要再当聊天操作员,而是成为自主系统的设计者。该项目已获得超过 10,000 颗星,确实值得思考。

Loop Engineering

从一次性会话到闭环

与 Claude Code、Grok 或 Cursor 等编码代理的典型交互存在一个主要问题:上下文。每次你打开一个对话框,解释项目结构,给出任务,然后等待结果。会话关闭——上下文丢失。第二天,一切从头开始。

Loop Engineering 概念提议将流程闭合为一个无限循环。代理按计划运行,从一个特殊文件读取仓库状态,在隔离的分支中进行工作,运行测试,并更新状态。

flowchart LR
    A[Schedule / Automation] --> B[Triage Skill]
    B --> C[Read + Write STATE / Memory]
    C --> D[Isolated Worktree]
    D --> E[Implementer Sub-agent]
    E --> F[Verifier Sub-agent]
    F --> G[MCP / Git / Tickets]

Anatomy of a Loop

你不需要为此编写复杂的 Python 框架。循环架构由几个易于理解的元素构建:

  • 通过 cron、GitHub Actions 或 systemd 进行计划执行。
  • 项目状态存储在一个常规的 Markdown 文件 STATE.md 中,位于仓库根目录,在任何代理重启后都能保留。
  • 隔离的 Git worktree 分支,使代理的更改不会破坏当前工作副本。
  • 代理分为执行者和检查者(Maker / Checker)。一个写代码,第二个运行测试并检查 linter。

仓库内部结构

该项目由一组发布到 npm 的 CLI 工具和现成场景目录组成。所有工具都整合在一个包中,因此无需克隆任何东西。

Primitives Infographic

你可以通过一条命令将模板部署到现有项目:

npx @cobusgreyling/loop init . --pattern daily-triage --tool grok

初始化后,该工具会创建 skill 文件、状态存储结构,并输出项目的就绪指数——Loop Ready 分数。

要检查生成系统的健康状况,请使用 doctor 命令:

npx @cobusgreyling/loop doctor .

此命令会查找配置问题并输出三个主要改进步骤。例如,它会建议添加 token 预算限制或配置禁止编辑的路径。

工具包还包括用于估算 token 成本的实用工具 loop-cost、用于查找循环描述与状态文件之间差异的实用工具 loop-sync,以及用于安全地为每次修复尝试创建独立分支的实用工具 loop-worktree

七个现成模板

仓库中包含常见开发任务的模板。

Patterns Overview

每个模式都包含 token 成本分解和推荐的实现模式说明:

  1. 每日分类。每天扫描一次仓库,收集问题,并更新 STATE.md
  2. PR 保姆。监控开放的 pull request,检查测试状态,并为作者留下提示。
  3. CI 清洁工。拦截失败的 CI 构建,并尝试在独立分支中修复失败的测试。
  4. 依赖清洁工。更新依赖库并验证项目能正常构建。
  5. 变更日志起草器。在新版本发布前收集变更日志草稿。
  6. 合并后清理。在合并后删除过时的分支和临时文件。
  7. 问题分类。审查新的 tracker 提交内容,并建议标签或初步回复。

作者建议逐步实现循环。首先,以只读模式(L1)运行代理,它只生成报告。当你对它结论的准确性有信心后,可以进入确认模式(L2),然后才将次要例行任务交给完全自主模式(L3)。

自主的阴暗面

Kobus Greyling 坦诚地分析了自主代理的风险。如果你启动一个带有子代理的循环而没有限制,你的 LLM API 账单会令人惊讶地不愉快。无限循环中的重复请求可能在几个小时内烧掉数百美元。

第二个风险称为理解债务。如果代理自己写补丁、自己运行测试、自己将代码合并到 main,团队很快就会失去对架构的控制。项目变成一个黑盒。

此外,所有验证仍然是你的责任。代理缺乏常识,会不惜任何代价尝试关闭测试,即使这意味着删除测试本身。

谁应该尝试

该仓库对已经积极使用 Claude Code 或 Grok 等命令行 AI 工具并寻求将其系统化集成到 CI/CD 的团队很有用。

从小处开始。安装 loop init,选择一个场景 daily-triage,让代理花一周时间只向 STATE.md 写每日报告。这是一种安全的方式,可以在不危及代码库稳定性的情况下,了解这个概念与你的项目的契合程度。

相关项目