Latest results

17 configurations · 72 tasks each · Publication pending

Scoring & evidence

Loading interactive configuration matrix

Ranking

Top configurations

Official calibrated estimates

Calibrated ability
  1. 1
    Sol mediumConditional 95% interval 65.0–86.6
    77.6
  2. 2
    Sol lowConditional 95% interval 63.5–85.7
    76.4
  3. 3
    Luna maxConditional 95% interval 63.4–85.7
    76.3
  4. 4
    Sol xhighConditional 95% interval 63.0–85.4
    75.9
  5. 5
    Luna xhighConditional 95% interval 62.8–85.3
    75.7
Evidence notesScoring, sensitivity, provenance, time, and cost

What this page claims

Official AIQ is a versioned 0–100 calibrated ability estimate. Its conditional 95% interval holds the estimated item bank fixed. Quality score, task-mix sensitivity, strict pass, time, and cost remain separate diagnostics. Synthetic previews expose quality only and are never ranked as Official.

Scoring version
Unavailable
Strict pass
Unavailable
Quality / task mix
Unavailable
Summed adapter time
Unavailable
API-equivalent cost
Unavailable
Evidence
Unavailable
Published evidence

Values come from RLS-protected public views. Inspect coverage, trust, scoring version, and run provenance before comparing entries.

Published evidence

Values come from RLS-protected public views. Inspect coverage, trust, scoring version, and run provenance before comparing entries.

Published evidence

Official efficiency: Values come from RLS-protected public reads.

Time, token, and cost table

Official efficiency is unavailable.

17 of 17 expected Official efficiency rows are Unavailable. 17 returned rows were rejected. Exact run, configuration, scoring-version, and provenance identity are required.

Loading run evidence

Loading method

Loading radar evidence