From dd335ccfe60ba391e2ecb83bb4b0e93da55594df Mon Sep 17 00:00:00 2001 From: Omar Sobh Date: Wed, 23 Sep 2026 07:49:10 -0500 Subject: [PATCH] =?UTF-8?q?docs:=20frontend=20team=20evidenced=20=E2=80=94?= =?UTF-8?q?=208=20of=2012,=20judged=20by=20the=20Kimi=20fallback?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Mission 01a0ce4c: offline npm install, GLM 1310, fallback to kimi-for-coding, suite re-run by the judge, MET and independent on the first pass. Co-Authored-By: Claude Opus 5.5 (1M context) --- docs/TEMPLATE-MATURITY.md | 9 ++++++++- 1 file changed, 8 insertions(+), 1 deletion(-) diff --git a/docs/TEMPLATE-MATURITY.md b/docs/TEMPLATE-MATURITY.md index 085b8c8..0bc45da 100644 --- a/docs/TEMPLATE-MATURITY.md +++ b/docs/TEMPLATE-MATURITY.md @@ -59,7 +59,7 @@ holding (it was 55 of 85 dangling once). | `topic_research` | lead_researcher evidence_checker report_writer | research_web_readonly | 4 | **yes** — measured | | `continuous_research` | paper_reader signal_ranker script_writer | research_readonly | 11 | **yes** — live runs | | `backend` | api_designer db_engineer coder tester committer | coding_readwrite | 20 | **yes** — first run 2026-09-22 | -| `frontend` | designer coder tester committer | coding_readwrite | 12 | **work verified by hand; judge cannot run npm** | +| `frontend` | designer coder tester committer | coding_readwrite | 12 | **yes** — first run 2026-09-23 (judged by the Kimi fallback) | | `mobile` | designer coder tester committer | coding_readwrite | 11 | no | | `gpu` | arch_analyst kernel_author bench_engineer coder committer | coding_readwrite | 13 | no | | `threejs` | scene_designer coder shader_author perf_engineer committer | coding_readwrite | 13 | no | @@ -262,6 +262,13 @@ its pass unspent, as designed. The agents' work was green again: 10 tests, `tsc -b` clean, +221 lines delivered. Evidenced once a judge with quota passes it. +**Evidenced (mission 01a0ce4c).** Run a third time once the Kimi fallback +judge was live (abfba83). The whole chain fired in order: the harness installed +dependencies offline, GLM refused with 1310, the evaluator fell back to +`kimi-for-coding`, and Kimi re-ran the suite itself (*"All claims verified by +direct inspection and test run"*). Verdict MET, `independent = true`, on +iteration 0. **Eight of twelve.** + ## One thing both runs showed: agents reach for Bash Cumulative tool calls across every mission since the policy shipped: