Dev-set score· Machine Unlearning · 2026-06-24
0.0877
+62.7%vs baseline
Best method reached 89.0% of human-best on the machine-unlearning task — found by an AnchorBreak counter-design after the council stalled on crash fixes.
+62.7%
Improvement
7
Experiments
2
Counter-designs
Position on benchmark
0.0539BASELINE
0.0877OURS
0.0985HUMAN BEST
GAP TO HUMAN−0.0108 (11.0%)
01
Score Trajectory — best so far
dev · 7 experiments
◆Breakthrough at Counter #2 — counter-design cleared 10 failed crash-fix attempts and jumped 0.0000 → 0.0877.
02
AnchorBreak — convergence monitor
τ=0.0 · trig@2
Convergence score per checkpoint. When the agent stalls (experiments-since-improvement ≥ trigger), a counter-design from a new family is forced.
Refine #1
0.400
refineRefine #2
0.267
▲ COUNTERRefine #3
0.228
▲ COUNTERRefine #4
0.165
refine2
Counters fired
1
Led to new best
03
Experiment Ledger
7 rows · evidence.jsonl
| # | CLOCK | STEP | FAMILY | MODEL | SCORE | Δ | BEST | RT(s) | |
|---|---|---|---|---|---|---|---|---|---|
| 0 | 08:51:34 | ◇ Initial design | baseline_design | gemma4:26b | 0.0000 | — | 0.0000 | 8 | REJECT |
| 1 | 08:52:10 | Refine #1 | bugfix | ministral-3:14b | 0.0000 | — | 0.0000 | 9 | REJECT |
| 2 | 08:52:48 | Refine #2 | bugfix | qwen3:32b | 0.0000 | — | 0.0000 | 29 | REJECT |
| 3 | 08:55:37 | ▲ Counter #1 | unknown | gemma4:26b + qwen3:32b | 0.0000 | — | 0.0000 | 163 | REJECT |
| 4 | 08:56:00 | Refine #3 | bugfix | ministral-3:14b | 0.0000 | — | 0.0000 | 9 | REJECT |
| 5 | 09:10:21 | ▲ Counter #2 | unknown | gemma4:26b + qwen3:32b | 0.0877 | +0.0877 | 0.0877 | 589 | RETAIN |
| 6 | 09:20:16 | Refine #4 | hyperparameter | ministral-3:14b | 0.0877 | — | 0.0877 | 583 | REJECT |
04
Council — capability routing
bneck 1.413 · Σfit 11.6
gemma4:26b
26BLead
qwen3:32b
32BEngineer
ministral-3:14b
14BRefiner
llama3.2-vision:11b
11BReserve
method_design
1.69
data_pipeline
1.41
model_impl
1.65
training_loop
1.78
eval_metrics
2.00
debug_and_fix
1.46
05
Hypothesis families & candidates
7tried
bugfix343%
unknown229%
baseline_design114%
hyperparameter114%
Top candidates · idea_evals.json
★ ITPS — Information-Theoretic Parameter Scrubbing0.0877
STEP 5+62.7%580scplx 46
ITPS + dynamic sensitivity-aware scaling0.0875
STEP 6+62.3%574scplx 54
06
Run phases
wall 29.7 min
P0Decomposition
28s
P1Task assignment
—
P2Roles
—
P3Design session
146s
P4Initial evaluation
8s
P5Refinement
1680s
P6Submit
1s