AI Coding Agent 怎么接项目才不乱:issue、repo、浏览器验证和测试要怎么分工
编辑标准与来源政策: 编辑标准, 团队. 内容均链至原始来源,见 方法论.
AI Coding Agent 接项目的核心不是“让它多写代码”,而是把任务拆成可检查的工程单元。issue、repo、coding、browser verification、tests 五层分开,agent 才不容易大范围乱改。
先用这张表定边界:
| 层级 | Agent 可以做什么 | 人保留什么 | 通过标准 |
|---|---|---|---|
| issue | 拆需求、列验收标准、找风险 | 决定业务优先级 | 输出可执行任务 |
| repo | 找文件、解释调用链、列修改点 | 控制改动范围 | 不编文件、不越界 |
| coding | 小步改代码、补测试、更新文档 | review diff | diff 小且可解释 |
| browser | 打开页面、截图、走低风险流程 | 判断体验和高风险操作 | 截图和步骤可复查 |
| tests | 跑指定测试、解释失败 | 决定是否扩大回归 | 测试命令和结果可复现 |
参考入口
| 工具 / 来源 | 看什么 | 用法 |
|---|---|---|
| GitHub Copilot coding agent docs | issue 到 PR 的 agent 工作流 | 判断 GitHub 内部协作怎么接 |
| Claude Code docs | terminal coding agent、权限、命令执行 | 适合本地 repo 任务 |
| OpenAI Codex docs | cloud / local coding workflow | 适合 agent 接工程任务 |
| Aider docs | git-aware pair programming | 适合小步提交和本地 diff |
| Playwright docs | 浏览器自动化和端到端验证 | 适合页面行为检查 |
一个标准任务怎么交给 Agent
坏任务:
优化文章页体验。
好任务:
移动端文章页标题区太高。只改 article template 和相关 CSS。验收标准:iPhone 宽度下首屏能看到标题、摘要、发布时间和正文第一段开头。不改数据层。不改桌面布局。跑现有页面渲染检查。
这类任务有 4 个好处:范围小、文件边界清楚、验收可见、失败能回滚。
repo 阶段先找路
进入仓库后,先让 Agent 输出定位表,不直接改代码。
| 文件 | 为什么相关 | 预计动作 | 风险 |
|---|---|---|---|
| article template | 页面结构在这里 | 调整标题区结构 | 可能影响所有文章 |
| CSS 文件 | 移动端间距在这里 | 加 media query | 可能影响桌面 |
| test / smoke script | 检查页面 200 和渲染 | 加目标 URL | 可能耗时增加 |
如果它找不到文件,或者列出不存在的路径,就停止。这个信号比生成代码更重要。
coding 阶段只允许小 diff
一次 agent 任务的健康 diff 通常有这些特征:
| 指标 | 健康范围 | 危险信号 |
|---|---|---|
| 文件数量 | 1 到 5 个 | 一次改 20 个文件 |
| 改动类型 | 样式、小逻辑、测试、文档 | 顺手重构架构 |
| 测试 | 有明确命令 | 只说“看起来可以” |
| 回滚 | 一个 commit 可撤回 | 多处无关改动混在一起 |
Coding Agent 最适合处理小而具体的工程任务:补测试、修文案、改 CSS、更新 README、修一个可复现 bug、解释遗留代码。它不适合无边界的大改、密钥目录操作、生产部署和跨系统迁移。
浏览器验证怎么做
有 UI 的任务必须用浏览器验证,不只看测试通过。
| 验证项 | 操作 | 通过标准 |
|---|---|---|
| 首屏 | 打开目标页面截图 | 标题、摘要、关键 CTA 不重叠 |
| 移动端 | 375px 或 390px 宽度 | 文本不溢出,按钮可点 |
| 关键流程 | 点 1 到 3 个核心路径 | 无 404,无 JS 错误 |
| 回归 | 对照一个不相关页面 | 没有全局样式误伤 |
Agent 可以跑 Playwright、截屏、读取 console error。体验判断仍然需要人看。
成本和性价比
Coding Agent 的成本不能只看模型价格。真正的成本是:模型调用 + 人工 review + 失败返工 + CI 时间。一个 agent 如果能把定位时间从 30 分钟降到 5 分钟,即使一次调用成本更高,也可能划算。反过来,如果它生成大 diff 让 reviewer 看 40 分钟,就不划算。
| 任务 | 价值来源 | 性价比判断 |
|---|---|---|
| 解释陌生代码 | 节省定位时间 | 很高 |
| 补小测试 | 节省样板时间 | 高 |
| 改 UI 小问题 | 节省查文件时间 | 中高 |
| 大重构 | 返工风险高 | 低 |
| 自动部署 | 风险高 | 不建议 |
结论
AI Coding Agent 可以接真实项目,但不能接一团模糊需求。先拆 issue,再读 repo,再小步 coding,再浏览器验证,最后跑测试。每一层都有通过标准,agent 才会成为工程助理,而不是不可控的改代码机器。