AI news & updates
264 events
- BenchmarkEpoch AI evaluates Qwen3.5-Flash
FrontierMath-Tiers-1-3-v2-Private 18.2% · FrontierMath-Tiers-1-3-v2-Private 9.5%
- BenchmarkEpoch AI evaluates Qwen3.5 397B A17B
FrontierMath-Tiers-1-3-v2-Private 29.5%
- BenchmarkEpoch AI evaluates o1
FrontierMath-Tiers-1-3-v2-Private 14.7%
- BenchmarkEpoch AI evaluates DeepSeek LLM 67B
OTIS Mock AIME 2024-2025 0.8% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates seed-oss-36b-instruct
OTIS Mock AIME 2024-2025 67.5% · Chess Puzzles 13.0%
Epoch AI Benchmarking Hubseed-oss-36b-instruct - BenchmarkEpoch AI evaluates Qwen3.5-4B
OTIS Mock AIME 2024-2025 55.8%
- BenchmarkEpoch AI evaluates Qwen3 30B A3B
OTIS Mock AIME 2024-2025 62.8%
- BenchmarkEpoch AI evaluates Gemma 4 26B A4B
OTIS Mock AIME 2024-2025 82.2%
- BenchmarkEpoch AI evaluates GLM 4.7 Flash
OTIS Mock AIME 2024-2025 25.0% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates DeepSeek-R1-Distill-Qwen-14B
OTIS Mock AIME 2024-2025 50.6% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates GLM 5.3
SimpleQA Verified 41.0%
- BenchmarkEpoch AI evaluates Qwen3.5-2B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Phi 4
Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Llama 3-8B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Llama 2-13B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates GLM 5.3 Flash
Mystery Game Puzzles 8.0%
- BenchmarkEpoch AI evaluates Qwen3.7 Flash
Mystery Game Puzzles 15.0%
- BenchmarkEpoch AI evaluates GPT-5.6 Terra (medium)
Mystery Game Puzzles 10.0%
- BenchmarkEpoch AI evaluates GPT-5.2 (medium)
Mystery Game Puzzles 22.0%
- BenchmarkEpoch AI evaluates GPT-5.5 (low)
Mystery Game Puzzles 28.0%
- BenchmarkEpoch AI evaluates Qwen3.7 Plus
Mystery Game Puzzles 17.0%
- BenchmarkEpoch AI evaluates GPT-5.4 (medium)
Mystery Game Puzzles 28.0%
- BenchmarkEpoch AI evaluates GPT-4 (Jun 2023)
Mystery Game Puzzles 12.0%
- BenchmarkEpoch AI evaluates Llama 3.1-8B
GPQA diamond 27.0% · OTIS Mock AIME 2024-2025 1.7% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Qwen3.5-9B
GPQA diamond 78.9% · GPQA diamond 79.0% · OTIS Mock AIME 2024-2025 61.7% · OTIS Mock AIME 2024-2025 42.8%
- BenchmarkEpoch AI evaluates Qwen3 8B
GPQA diamond 47.5% · GPQA diamond 56.8% · OTIS Mock AIME 2024-2025 22.2% · OTIS Mock AIME 2024-2025 56.1%
- BenchmarkEpoch AI evaluates Gemma 3 27B
GPQA diamond 47.7% · OTIS Mock AIME 2024-2025 22.5% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates gpt-oss-20b
GPQA diamond 60.8% · GPQA diamond 53.2% · OTIS Mock AIME 2024-2025 50.8% · OTIS Mock AIME 2024-2025 65.3%
- BenchmarkEpoch AI evaluates o1 (low)
FrontierMath-Tiers-1-3-v2-Private 8.4%
- BenchmarkEpoch AI evaluates o1 (medium)
FrontierMath-Tiers-1-3-v2-Private 10.2%
- BenchmarkEpoch AI evaluates o3
FrontierMath-Tiers-1-3-v2-Private 33.3% · SimpleQA Verified 49.4% · Mystery Game Puzzles 29.0%
- BenchmarkEpoch AI evaluates o3 (medium)
FrontierMath-Tiers-1-3-v2-Private 29.8% · Mystery Game Puzzles 23.0%
- BenchmarkEpoch AI evaluates GPT-5 (low)
FrontierMath-Tiers-1-3-v2-Private 37.2% · Mystery Game Puzzles 16.0%
- BenchmarkEpoch AI evaluates GPT-4.1 Mini
FrontierMath-Tiers-1-3-v2-Private 6.7% · Mystery Game Puzzles 7.0%
- BenchmarkEpoch AI evaluates GPT-3.5 Turbo (Jan 2024)
FrontierMath-Tiers-1-3-v2-Private 0.0% · Mystery Game Puzzles 3.0%
- BenchmarkEpoch AI evaluates GPT-4o-mini
FrontierMath-Tiers-1-3-v2-Private 0.7% · Mystery Game Puzzles 12.0%
- BenchmarkEpoch AI evaluates o3 (low)
FrontierMath-Tiers-1-3-v2-Private 19.3%
- BenchmarkEpoch AI evaluates GPT-4.1
FrontierMath-Tiers-1-3-v2-Private 6.0%
- BenchmarkEpoch AI evaluates GPT-4 Turbo (Apr 2024)
FrontierMath-Tiers-1-3-v2-Private 0.7%
- BenchmarkEpoch AI evaluates GPT-4o (Aug 2024)
FrontierMath-Tiers-1-3-v2-Private 0.4%