| Benchmark | Domain | Score | vs best recorded | Setting | Run | Source |
|---|---|---|---|---|---|---|
| FrontierCode | coding | 26.6% | 50% | unknown | — | External ↗ |
| CL-bench Life | long-context | 13.6% | 61% | unknown | — | External ↗ |
| CL-bench | long-context | 20.7% | 74% | unknown | — | External ↗ |
| Remote Labor Index | agents | 4.2% | 20% | unknown | — | External ↗ |
| GSO-Bench | coding | 33.3% | 71% | unknown | — | External ↗ |
| Terminal Bench | agents | 79.8% ±1.6 | 94% | agent: ForgeCode | 12 Mar 2026 | External ↗ |
| METR Time Horizons | agents | 78.9% | 93% | unknown | — | External ↗ |
| WeirdML | coding | 77.9% | 83% | unknown | — | External ↗ |
| Cybench | coding | 93.0% | 100% | unknown | — | External ↗ |
Source: Epoch AI Benchmarking Hub (CC BY 4.0). “External” rows are leaderboard results Epoch collects from third parties. Best reported setting per benchmark is shown.
0 observations (OpenRouter listing). History accumulates with every ingest run; a single point means no change has been observed yet.