M
MLRC TERMINAL
--:--:-- UTC
MU.DEV0.0877+62.7%HUMAN.BEST0.0985BASELINE0.0539%HUMAN89.0%EXPMTS7COUNTERS2WALL29.7 minGEMMA4:26BLeadQWEN3:32BEngineerMINISTRAL-3:14BRefinerLLAMA3.2-VISION:11BReserve
Dev-set score· Machine Unlearning · 2026-06-24
0.0877
+62.7%vs baseline

Best method reached 89.0% of human-best on the machine-unlearning task — found by an AnchorBreak counter-design after the council stalled on crash fixes.

+62.7%
Improvement
7
Experiments
2
Counter-designs
Position on benchmark
0.0539BASELINE
0.0877OURS
0.0985HUMAN BEST
GAP TO HUMAN0.0108 (11.0%)
01

Score Trajectory — best so far

dev · 7 experiments
Breakthrough at Counter #2 — counter-design cleared 10 failed crash-fix attempts and jumped 0.0000 → 0.0877.
02

AnchorBreak — convergence monitor

τ=0.0 · trig@2

Convergence score per checkpoint. When the agent stalls (experiments-since-improvement ≥ trigger), a counter-design from a new family is forced.

Refine #1
0.400
refine
Refine #2
0.267
▲ COUNTER
Refine #3
0.228
▲ COUNTER
Refine #4
0.165
refine
2
Counters fired
1
Led to new best
03

Experiment Ledger

7 rows · evidence.jsonl
#CLOCKSTEPFAMILYMODELSCOREΔBESTRT(s)
008:51:34Initial designbaseline_designgemma4:26b0.00000.00008REJECT
108:52:10Refine #1bugfixministral-3:14b0.00000.00009REJECT
208:52:48Refine #2bugfixqwen3:32b0.00000.000029REJECT
308:55:37Counter #1unknowngemma4:26b + qwen3:32b0.00000.0000163REJECT
408:56:00Refine #3bugfixministral-3:14b0.00000.00009REJECT
509:10:21Counter #2unknowngemma4:26b + qwen3:32b0.0877+0.08770.0877589RETAIN
609:20:16Refine #4hyperparameterministral-3:14b0.08770.0877583REJECT
04

Council — capability routing

bneck 1.413 · Σfit 11.6
gemma4:26b
26BLead
qwen3:32b
32BEngineer
ministral-3:14b
14BRefiner
llama3.2-vision:11b
11BReserve
Maximin GAP assignment
method_design
1.69
data_pipeline
1.41
model_impl
1.65
training_loop
1.78
eval_metrics
2.00
debug_and_fix
1.46
05

Hypothesis families & candidates

7tried
bugfix343%
unknown229%
baseline_design114%
hyperparameter114%
Top candidates · idea_evals.json
ITPS — Information-Theoretic Parameter Scrubbing0.0877
STEP 5+62.7%580scplx 46
ITPS + dynamic sensitivity-aware scaling0.0875
STEP 6+62.3%574scplx 54
06

Run phases

wall 29.7 min
P0Decomposition
28s
P1Task assignment
P2Roles
P3Design session
146s
P4Initial evaluation
8s
P5Refinement
1680s
P6Submit
1s