把 4 支团队各自做出的「立大志线索登记」应用真实启动、灌入演示数据、用 Chrome 实拍截图。每个应用都新增了数据可视化看板(这也是上一轮 BMAD 队的最大短板),并把上一轮评出的待补项逐条补齐。下面是它们运行起来的真实样子。
上一轮实测为每支团队列了具体短板。这一轮已逐条补齐,并给所有团队统一加了"数据可视化看板"与"交付物清单核对(DELIVERY_CHECKLIST)"两道收尾。所有改动后测试仍全部通过。
| 团队 | 本轮补全的待补项 | 单测变化 |
|---|---|---|
| 🥇 BMAD 文档瀑布 |
+数据看板(之前最大短板:无线索列表/统计前端页)· 删除 index.html 死代码、修复脆弱的按钮文本节点写法 · 补接口层 HTTP 测试(stats/404/路径穿越)· 额外发现并堵住一个源码泄露漏洞(静态路由可读 server.py/含明文手机号的 leads.json,已改后缀白名单)· +DELIVERY_CHECKLIST | 18 → 26 |
| 🥈 GPT-Pilot 真团队 |
+数据看板 · 修复 id 碰撞风险(len+1 → 取最大 id+1 持久游标,删除后不再重号)· 统一意向白名单单一来源(新增 GET /api/intents,前端动态拉取下拉,消除前后端双处硬编码)· 补测试(坏 JSON 400 / 未知路径 404 / id 空洞不碰撞)· +DELIVERY_CHECKLIST | 6 → 10 |
| 🥉 VoltAgent 扁平委派 |
+数据看板 · 补交 tests/__init__.py(上轮契约承诺却漏交)· POST 改返 201 Created(语义规范,前端改 2xx 即成功 + 同步测试断言)· 前端画布对齐 750px 设计基准(原 420px)· 清理残留 _smoke_leads.json/leads.json/__pycache__ · +DELIVERY_CHECKLIST | 13 → 13 |
| 单 Agent 基线 |
+数据看板 · 补 HTTP 层端到端测试(上轮只测纯函数:新增 do_POST/坏 JSON 400/未知路径 404/静态服务断言)· +DELIVERY_CHECKLIST · 清理 __pycache__ | 5 → 13 |
给 BMAD 队补测试时,验收 Agent 顺手发现并修复了一个真实安全漏洞:原静态路由能被 /server.py、/leads.json 直接读到源码和含明文手机号的线索数据。已改为后缀白名单堵死,并补了回归测试——这正是"多 Agent 团队加一道收尾核验"带来的价值。
下面每支团队展示两张真实运行截图:左为「线索登记表单页」,右为新增的「数据看板」(已灌入 7 条演示线索,姓名与手机号均做了脱敏)。四套 UI 风格各异——同一道题,不同团队审美不同。








① UI 审美各异:GPT-Pilot 用了蓝绿渐变 hero + 最规范的 750px 留白,看板柱状图带鎏金渐变最精致;BMAD/VoltAgent/单Agent 走深蓝+鎏金教育稳重风。② 功能都对齐了:四套看板都有"今日/累计数字卡 + 意向分布柱状图 + 脱敏线索表",数据一致(7 条演示线索)。③ 合规细节到位:表单文案均为"顾问/规划师稍后联系",无《广告法》禁用的效果保证承诺;看板线索表姓名与手机号已脱敏。
4 套应用在 /tmp/bakeoff/team{1..4}/,进任一目录 python3 server.py 即起,浏览器开 localhost:8080/(登记表单)与 localhost:8080/dashboard(数据看板),python3 -m unittest discover tests 跑测试。团队角色提示词在 ~/agent-dev-teams/,可 symlink 进 OpenClaw 复用。上方截图即为这些应用真实运行的实拍。