# LLM Weather Report — 2026-08-26T10-15-16

gemini-2.5-flash failing causality-1. gpt-5.4-mini, claude-haiku-4-5, gemini-2.5-pro, gemini-2.5-pro, gemini-2.5-pro, gemini-2.5-pro, gemini-2.5-pro, gemini-2.5-pro, gemini-2.5-pro, gemini-2.5-flash, gemini-2.5-flash, gemini-2.5-flash, gemini-2.5-flash, gemini-2.5-flash, gemini-2.5-flash, gemini-2.5-flash recovering.

## Drift Alerts
- IMPROVEMENT: openai/gpt-5.4-mini on spatial-1
- IMPROVEMENT: anthropic/claude-haiku-4-5 on common-sense-1
- IMPROVEMENT: gemini/gemini-2.5-pro on logic-1
- IMPROVEMENT: gemini/gemini-2.5-pro on math-1
- IMPROVEMENT: gemini/gemini-2.5-pro on spatial-1
- IMPROVEMENT: gemini/gemini-2.5-pro on causality-1
- IMPROVEMENT: gemini/gemini-2.5-pro on code-1
- IMPROVEMENT: gemini/gemini-2.5-pro on ambiguity-1
- IMPROVEMENT: gemini/gemini-2.5-pro on common-sense-1
- IMPROVEMENT: gemini/gemini-2.5-flash on logic-1
- IMPROVEMENT: gemini/gemini-2.5-flash on math-1
- IMPROVEMENT: gemini/gemini-2.5-flash on spatial-1
- IMPROVEMENT: gemini/gemini-2.5-flash on causality-1
- IMPROVEMENT: gemini/gemini-2.5-flash on code-1
- IMPROVEMENT: gemini/gemini-2.5-flash on ambiguity-1
- IMPROVEMENT: gemini/gemini-2.5-flash on common-sense-1

## Scorecard

| Model | ambiguity-1 | causality-1 | code-1 | common-sense-1 | logic-1 | math-1 | spatial-1 | 
|-------|------|------|------|------|------|------|------|
| anthropic/claude-haiku-4-5 | ✓ (4.33) | ✓ (4.67) | ✓ (4.67) | ✓ (3.33) | ✓ (5) | ✓ (5) | ✓ (5) | 
| anthropic/claude-opus-4-6 | ✓ (4.83) | ✓ (4.83) | ✓ (4.67) | ✓ (4.33) | ✓ (5) | ✓ (5) | ✓ (5) | 
| anthropic/claude-sonnet-4-6 | ✓ (4.33) | ✓ (4.67) | ✓ (4.33) | ✓ (4) | ✓ (5) | ✓ (5) | ✓ (5) | 
| gemini/gemini-2.5-flash | ✓ (4.83) | ✗ (2.33) | ✓ (4.83) | ✓ (4.67) | ✓ (5) | ✓ (5) | ✓ (5) | 
| gemini/gemini-2.5-pro | ✓ (4.67) | ✓ (4.83) | ✓ (4.67) | ✓ (5) | ✓ (5) | ✓ (4.83) | ✓ (5) | 
| ollama/llama3 | — | — | — | — | — | — | — | 
| openai/gpt-5.4 | ✓ (4.5) | ✓ (5) | ✓ (4.67) | ✓ (4.33) | ✓ (4.67) | ✓ (3.67) | ✓ (5) | 
| openai/gpt-5.4-mini | ✓ (4.67) | ✓ (4.83) | ✓ (4.67) | ✓ (4.5) | ✓ (5) | ✓ (4.67) | ✓ (5) | 


## Model Status
- ↑ **anthropic/claude-haiku-4-5**: up
- → **anthropic/claude-opus-4-6**: stable
- → **anthropic/claude-sonnet-4-6**: stable
- ↑ **gemini/gemini-2.5-flash**: up
- ↑ **gemini/gemini-2.5-pro**: up
- → **openai/gpt-5.4**: stable
- ↑ **openai/gpt-5.4-mini**: up

