AI news & updates
826 events
- BenchmarkEpoch AI evaluates Gemini 3.6 Flash
Furniture Assembly 23.3%
- BenchmarkEpoch AI evaluates Gemini 3.8 Flash
Furniture Assembly 31.7%
- BenchmarkEpoch AI evaluates Gemini 3.1 Pro Preview
Furniture Assembly 26.7%
- BenchmarkEpoch AI evaluates Claude Fable 5
Furniture Assembly 35.8%
- BenchmarkEpoch AI evaluates Claude Opus 5
Furniture Assembly 60.8%
- BenchmarkEpoch AI evaluates Claude Opus 4.8
Furniture Assembly 42.5%
- BenchmarkEpoch AI evaluates Claude Opus 4.7
Furniture Assembly 33.3%
- BenchmarkEpoch AI evaluates Claude Opus 4.6
Furniture Assembly 28.3%
- BenchmarkEpoch AI evaluates Claude Opus 4.5 (64k thinking)
Furniture Assembly 28.3%
- BenchmarkEpoch AI evaluates GPT-5.6 Luna
Furniture Assembly 42.5%
- BenchmarkEpoch AI evaluates GPT-6 Astra
Furniture Assembly 80.0%
- BenchmarkEpoch AI evaluates GPT-5.6 Sol
Furniture Assembly 56.7%
- BenchmarkEpoch AI evaluates GPT-5.6 Terra
Furniture Assembly 54.2%
- BenchmarkEpoch AI evaluates GPT-5.5 (xhigh)
Furniture Assembly 44.2%
- BenchmarkEpoch AI evaluates GPT-5.2 (xhigh)
Furniture Assembly 38.3%
- BenchmarkEpoch AI evaluates GPT-5.4 (xhigh)
Furniture Assembly 37.5%
- Open releaseMajorDeepSeek releases DeepSeek V4.1 Flash
DeepSeek V4.1 Flash is a sparse mixture-of-experts model from DeepSeek, and the first built on the company's Causal Encoder-Decoder (CED) architecture. It activates 8B parameters on input and 16B on...
- Open releaseMajorDeepSeek releases DeepSeek V4.1 Flash (unknown)
- Model launchInception releases Mercury 2.5
Mercury 2.5 is the fastest reasoning LLM, and the latest diffusion LLM (dLLM) from Inception. Instead of generating tokens sequentially, Mercury 2.5 produces and refines multiple tokens in parallel, achieving...
- Model launchInception Labs releases Mercury 2.5 (unknown)
- BenchmarkEpoch AI evaluates Claude Fable 5.1
EBR-bench 57.1%
- Open releaseNex AGI releases Nex-N2.5-Pro
Nex-N2.5 is an agentic model built to turn goals into working, verified outcomes. Its core strength is agentic coding within a visual feedback loop: it can explore codebases, implement multi-file...
- Open releaseNex AGI releases Nex-N2.5-Mini
Nex-N2.5 is an agentic model built to turn goals into working, verified outcomes. Its core strength is agentic coding within a visual feedback loop: it can explore codebases, implement multi-file...
- BenchmarkEpoch AI evaluates Claude Opus 5
EBR-bench 45.7%
- Model launchMajorOpenAI releases GPT-6 Astra Pro
GPT-6 Astra Pro is the same underlying model as [GPT-6 Astra](https://openrouter.ai/openai/gpt-6-astra), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks. Learn more in OpenAI's do
- Model launchMajorOpenAI releases GPT-6 Astra (batch)
GPT-6 Astra is OpenAI's flagship model for demanding end-to-end work. It is suited for advanced analysis, software engineering, deep research, scientific work, and document creation, with particular strengths in long-hor
- Model launchMajorOpenAI releases GPT-6 Astra Pro (batch)
GPT-6 Astra Pro is the same underlying model as [GPT-6 Astra](https://openrouter.ai/openai/gpt-6-astra), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks. Learn more in OpenAI's do
- BenchmarkEpoch AI evaluates GPT-5.6 Sol
EBR-bench 44.8%
- Model launchMajorOpenAI releases GPT-6 Astra
GPT-6 Astra is OpenAI's flagship model for demanding end-to-end work. It is suited for advanced analysis, software engineering, deep research, scientific work, and document creation, with particular strengths in long-hor
- Model launchMajorOpenAI releases GPT-6 Astra (none)
- Model launchMajorOpenAI releases GPT-6 Astra (low)
- Model launchMajorOpenAI releases GPT-6 Astra (medium)
- Model launchMajorOpenAI releases GPT-6 Astra (xhigh)
- Model launchMajorOpenAI releases GPT-6 Astra (pro, max)
- Model launchMajorOpenAI releases GPT-6 Astra (unknown thinking)
- Model launchMajorMeta releases Muse Spark 1.3
Muse Spark 1.3 is a multimodal reasoning model from Meta for long-running agentic, multi-agent, and coding workflows. It is designed to keep track of information across extended tasks, work through...
- Model launchMajorGoogle releases Gemini 3.8 Flash
Gemini 3.8 Flash is Google's most intelligent Flash model with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning.
- Model launchMajorGoogle releases Gemini 3.8 Flash (batch)
Gemini 3.8 Flash is Google's most intelligent Flash model with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning.
- Model launchMajorMeta releases Muse Spark 1.3 Contributor
Muse Spark 1.3 Contributor is the cost-efficient contributor tier of Meta’s multimodal reasoning model for experimentation, learning, and early-stage agentic, multi-agent, and coding workflows. It is designed to track in
- Model launchMajorMeta AI releases Muse Spark 1.3 (xhigh)