更多文章

AI 与开发者相关深度内容

AI Coding Agent 怎么接项目才不乱:issue、repo、浏览器验证和测试要怎么分工

AI Coding Agent 接项目的核心不是“让它多写代码”,而是把任务拆成可检查的工程单元。issue、repo、coding、browser verification、tests 五层分开,agent 才不容易大范围乱改。

先用这张表定边界:

层级 Agent 可以做什么 人保留什么 通过标准
issue 拆需求、列验收标准、找风险 决定业务优先级 输出可执行任务
repo 找文件、解释调用链、列修改点 控制改动范围 不编文件、不越界
coding 小步改代码、补测试、更新文档 review diff diff 小且可解释
browser 打开页面、截图、走低风险流程 判断体验和高风险操作 截图和步骤可复查
tests 跑指定测试、解释失败 决定是否扩大回归 测试命令和结果可复现

参考入口

工具 / 来源 看什么 用法
GitHub Copilot coding agent docs issue 到 PR 的 agent 工作流 判断 GitHub 内部协作怎么接
Claude Code docs terminal coding agent、权限、命令执行 适合本地 repo 任务
OpenAI Codex docs cloud / local coding workflow 适合 agent 接工程任务
Aider docs git-aware pair programming 适合小步提交和本地 diff
Playwright docs 浏览器自动化和端到端验证 适合页面行为检查

一个标准任务怎么交给 Agent

坏任务:

优化文章页体验。

好任务:

移动端文章页标题区太高。只改 article template 和相关 CSS。验收标准:iPhone 宽度下首屏能看到标题、摘要、发布时间和正文第一段开头。不改数据层。不改桌面布局。跑现有页面渲染检查。

这类任务有 4 个好处:范围小、文件边界清楚、验收可见、失败能回滚。

repo 阶段先找路

进入仓库后,先让 Agent 输出定位表,不直接改代码。

文件 为什么相关 预计动作 风险
article template 页面结构在这里 调整标题区结构 可能影响所有文章
CSS 文件 移动端间距在这里 加 media query 可能影响桌面
test / smoke script 检查页面 200 和渲染 加目标 URL 可能耗时增加

如果它找不到文件,或者列出不存在的路径,就停止。这个信号比生成代码更重要。

coding 阶段只允许小 diff

一次 agent 任务的健康 diff 通常有这些特征:

指标 健康范围 危险信号
文件数量 1 到 5 个 一次改 20 个文件
改动类型 样式、小逻辑、测试、文档 顺手重构架构
测试 有明确命令 只说“看起来可以”
回滚 一个 commit 可撤回 多处无关改动混在一起

Coding Agent 最适合处理小而具体的工程任务:补测试、修文案、改 CSS、更新 README、修一个可复现 bug、解释遗留代码。它不适合无边界的大改、密钥目录操作、生产部署和跨系统迁移。

浏览器验证怎么做

有 UI 的任务必须用浏览器验证,不只看测试通过。

验证项 操作 通过标准
首屏 打开目标页面截图 标题、摘要、关键 CTA 不重叠
移动端 375px 或 390px 宽度 文本不溢出,按钮可点
关键流程 点 1 到 3 个核心路径 无 404,无 JS 错误
回归 对照一个不相关页面 没有全局样式误伤

Agent 可以跑 Playwright、截屏、读取 console error。体验判断仍然需要人看。

成本和性价比

Coding Agent 的成本不能只看模型价格。真正的成本是:模型调用 + 人工 review + 失败返工 + CI 时间。一个 agent 如果能把定位时间从 30 分钟降到 5 分钟,即使一次调用成本更高,也可能划算。反过来,如果它生成大 diff 让 reviewer 看 40 分钟,就不划算。

任务 价值来源 性价比判断
解释陌生代码 节省定位时间 很高
补小测试 节省样板时间
改 UI 小问题 节省查文件时间 中高
大重构 返工风险高
自动部署 风险高 不建议

结论

AI Coding Agent 可以接真实项目,但不能接一团模糊需求。先拆 issue,再读 repo,再小步 coding,再浏览器验证,最后跑测试。每一层都有通过标准,agent 才会成为工程助理,而不是不可控的改代码机器。

← 返回更多文章