Benchmark
Epoch AI evaluates Muse Spark 1.3
FrontierMath-Tiers-1-3-v2-Private 74.0% · FrontierMath-Tier-4-v2-Private 46.3% · Chess Puzzles 38.0% · Mystery Game Puzzles 25.0%
- Type
- BENCHMARK_RESULT
- Detection
- benchmark
- Confidence
- high
- Status
Related entities