AI news & updates
826 events
- Model launchMajorGoogle DeepMind releases Gemini 3.8 Flash (unknown)
- Model launchMajorMeta AI releases Muse Spark 1.3 (unknown)
- Model launchMajorGoogle DeepMind releases Gemini 3.8 Flash (medium)
- Model launchMajorGoogle DeepMind releases Gemini 3.8 Flash (low)
- BenchmarkEpoch AI evaluates Qwen3.8 Max (0902) (xhigh)
GPQA diamond 92.3% · FrontierMath-Tiers-1-3-v2-Private 65.6% · FrontierMath-Tier-4-v2-Private 34.1% · OTIS Mock AIME 2024-2025 100.0%
- BenchmarkEpoch AI evaluates Gemini 3.8 Flash
GPQA diamond 95.4% · FrontierMath-Tiers-1-3-v2-Private 68.4% · FrontierMath-Tier-4-v2-Private 22.0% · OTIS Mock AIME 2024-2025 98.9%
- Model launchMajorQwen releases Qwen3.8 Max (0902)
Qwen3.8 Max 0902 is an updated snapshot of Qwen3.8 Max from Alibaba's Qwen team. It is a 2.4-trillion-parameter mixture-of-experts model that accepts text, image, and video input and returns text,...
- Model launchMajorAnthropic releases Claude Fable 5.1
Claude Fable 5.1 improves on Claude Fable 5 across the board, with the biggest gains in agentic coding, long-running agentic workflows, and knowledge work: long code refactors, front-end and visual...
- Model launchMajorAnthropic releases Claude Fable 5.1 (batch)
Claude Fable 5.1 improves on Claude Fable 5 across the board, with the biggest gains in agentic coding, long-running agentic workflows, and knowledge work: long code refactors, front-end and visual...
- Model launchMajorAlibaba releases Qwen3.8 Max (0902) (xhigh)
- Model launchMajorAnthropic releases Claude Fable 5.1 (xhigh)
- Model launchMajorAnthropic releases Claude Fable 5.1 (medium)
- Model launchMajorAnthropic releases Claude Fable 5.1 (low)
- Model launchMajorAnthropic releases Claude Fable 5.1 (unknown)
- BenchmarkEpoch AI evaluates Claude Fable 5.1
FrontierMath-Tiers-1-3-v2-Private 90.2% · FrontierMath-Tier-4-v2-Private 87.8% · OTIS Mock AIME 2024-2025 100.0% · SimpleQA Verified 70.8%
- Open releaseIBM releases Granite 4.2 8B
Granite 4.2 8B is a dense reasoning model from IBM. It is suited for mathematics, code generation, multilingual dialogue, and agentic workflows that need multi-step reasoning. It supports full, low-effort,...
- BenchmarkEpoch AI evaluates GPT-4o-mini
SimpleQA Verified 8.3%
- BenchmarkEpoch AI evaluates GPT-4o (Aug 2024)
SimpleQA Verified 26.0%
- BenchmarkEpoch AI evaluates GPT-4.1 Nano
SimpleQA Verified 6.0%
- BenchmarkEpoch AI evaluates GPT-4.1 Mini
SimpleQA Verified 12.7%
- BenchmarkEpoch AI evaluates GPT-4.1
SimpleQA Verified 31.1%
- BenchmarkEpoch AI evaluates o3 Mini
SimpleQA Verified 15.3%
- BenchmarkEpoch AI evaluates o1
SimpleQA Verified 41.1%
- BenchmarkEpoch AI evaluates Muse Spark 1.1
SimpleQA Verified 57.8%
- BenchmarkEpoch AI evaluates Claude 3 Opus
SimpleQA Verified 12.6%
- BenchmarkEpoch AI evaluates Granite 4.0 Micro
GPQA diamond 28.3% · OTIS Mock AIME 2024-2025 2.8% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates seed-oss-36b-instruct
GPQA diamond 71.5%
Epoch AI Benchmarking Hubseed-oss-36b-instruct - BenchmarkEpoch AI evaluates Qwen3 32B
GPQA diamond 54.1% · OTIS Mock AIME 2024-2025 23.1% · OTIS Mock AIME 2024-2025 66.9%
- BenchmarkEpoch AI evaluates Qwen3-30B-A3B-Thinking (Jul 2025)
GPQA diamond 70.1% · OTIS Mock AIME 2024-2025 70.3% · Chess Puzzles 8.0%
- BenchmarkEpoch AI evaluates Qwen3-30B-A3B-Instruct (Jul 2025)
GPQA diamond 55.6% · OTIS Mock AIME 2024-2025 62.2% · Chess Puzzles 2.0%
- BenchmarkEpoch AI evaluates Qwen3 30B A3B
GPQA diamond 50.4% · GPQA diamond 61.7% · OTIS Mock AIME 2024-2025 25.6% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Qwen2.5-7B
GPQA diamond 35.5% · OTIS Mock AIME 2024-2025 2.5% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Mistral Small 3.1
GPQA diamond 41.9% · OTIS Mock AIME 2024-2025 3.9% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Mistral Small 3
GPQA diamond 47.3% · OTIS Mock AIME 2024-2025 6.7% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Magistral Small 1.2
GPQA diamond 47.6% · OTIS Mock AIME 2024-2025 28.1% · Chess Puzzles 3.0%
- BenchmarkEpoch AI evaluates Llama 3.2 1B
GPQA diamond 23.9% · OTIS Mock AIME 2024-2025 0.6% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates GLM 4.7 Flash
GPQA diamond 45.1% · GPQA diamond 60.5% · OTIS Mock AIME 2024-2025 58.3%
- BenchmarkEpoch AI evaluates GPT-6 Astra
GPQA diamond 95.8% · FrontierMath-Tiers-1-3-v2-Private 93.7% · FrontierMath-Tier-4-v2-Private 97.6% · OTIS Mock AIME 2024-2025 100.0%
- BenchmarkEpoch AI evaluates Gemini 3.1 Flash Lite
FrontierMath-Tiers-1-3-v2-Private 22.5% · FrontierMath-Tiers-1-3-v2-Private 27.7%
- BenchmarkEpoch AI evaluates Qwen3.6 35B A3B
FrontierMath-Tiers-1-3-v2-Private 20.4%