⚡ August 30, 2026¶
Generated: 2026-08-30 02:48 UTC
Total Duration: 24m 36s
Iterations: 1
Judge (classifier) model: gpt-4.1
Fast Benchmark
Markers: regression or benchmark
Schedule: Weekly (Sunday 2 AM UTC)
Purpose: Quick regression tests to catch breaking changes
HolmesGPT is continuously evaluated against real-world Kubernetes and cloud troubleshooting scenarios.
If you find scenarios that HolmesGPT does not perform well on, please consider adding them as evals to the benchmark.
Model Accuracy Comparison¶
| Model | Pass | Fail | Skip/Error | Total | Success Rate |
|---|---|---|---|---|---|
| deepseek-r1-reasoner | 16 | 5 | 0 | 21 | 🟡 76% (16/21) |
| deepseek-v3.2-chat | 16 | 5 | 0 | 21 | 🟡 76% (16/21) |
| gemini-3.1-pro-preview | 19 | 2 | 0 | 21 | 🟡 90% (19/21) |
| gpt-5.3-codex | 0 | 21 | 0 | 21 | 🔴 0% (0/21) |
| gpt-5.4 | 17 | 4 | 0 | 21 | 🟡 81% (17/21) |
| gpt-5.5 | 18 | 3 | 0 | 21 | 🟡 86% (18/21) |
| haiku-4.5 | 0 | 21 | 0 | 21 | 🔴 0% (0/21) |
| opus-4.6 | 0 | 21 | 0 | 21 | 🔴 0% (0/21) |
| opus-4.7 | 0 | 21 | 0 | 21 | 🔴 0% (0/21) |
| opus-4.8 | 0 | 21 | 0 | 21 | 🔴 0% (0/21) |
| qwen-next-80B-instruct | 0 | 21 | 0 | 21 | 🔴 0% (0/21) |
| qwen-next-80B-thinking | 0 | 21 | 0 | 21 | 🔴 0% (0/21) |
| sonnet-4.6 | 0 | 21 | 0 | 21 | 🔴 0% (0/21) |
Model Cost Comparison¶
| Model | Tests | Avg Cost | Min Cost | Max Cost | Total Cost |
|---|---|---|---|---|---|
| deepseek-r1-reasoner | 18 | $0.02 | $0.00 | $0.08 | $0.31 |
| deepseek-v3.2-chat | 18 | $0.04 | $0.00 | $0.21 | $0.67 |
| gemini-3.1-pro-preview | 21 | $0.12 | $0.01 | $0.38 | $2.55 |
| gpt-5.4 | 21 | $0.06 | $0.01 | $0.10 | $1.17 |
| gpt-5.5 | 21 | $0.29 | $0.01 | $1.08 | $5.99 |
Model Latency Comparison¶
| Model | Avg (s) | Min (s) | Max (s) | P50 (s) | P95 (s) |
|---|---|---|---|---|---|
| deepseek-r1-reasoner | 54.5 | 1.3 | 345.9 | 29.2 | 147.4 |
| deepseek-v3.2-chat | 62.8 | 1.4 | 337.8 | 22.0 | 286.7 |
| gemini-3.1-pro-preview | 43.2 | 9.8 | 111.3 | 30.9 | 82.0 |
| gpt-5.3-codex | 1.3 | 0.6 | 7.9 | 0.8 | 1.7 |
| gpt-5.4 | 14.8 | 4.2 | 27.4 | 15.0 | 21.8 |
| gpt-5.5 | 47.2 | 4.8 | 199.0 | 26.3 | 163.1 |
| haiku-4.5 | 1.3 | 0.9 | 6.6 | 1.0 | 1.4 |
| opus-4.6 | 1.5 | 0.9 | 6.5 | 1.3 | 1.8 |
| opus-4.7 | 1.6 | 0.9 | 6.6 | 1.4 | 1.9 |
| opus-4.8 | 1.4 | 1.3 | 1.7 | 1.3 | 1.7 |
| qwen-next-80B-instruct | 1.0 | 0.8 | 2.2 | 0.9 | 1.3 |
| qwen-next-80B-thinking | 1.0 | 0.6 | 2.2 | 0.9 | 1.2 |
| sonnet-4.6 | 1.4 | 0.9 | 6.5 | 1.0 | 2.0 |
Performance by Tag¶
Success rate by test category and model:
| Tag | deepseek-r1-reasoner | deepseek-v3.2-chat | gemini-3.1-pro-preview | gpt-5.3-codex | gpt-5.4 | gpt-5.5 | haiku-4.5 | opus-4.6 | opus-4.7 | opus-4.8 | qwen-next-80B-instruct | qwen-next-80B-thinking | sonnet-4.6 | Warnings |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| benchmark | 🟡 83% (⅚) | 🟡 83% (⅚) | 🟡 83% (⅚) | 🔴 0% (0/6) | 🟡 67% (4/6) | 🟡 83% (⅚) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | |
| context_window | 🟢 100% (2/2) | 🟢 100% (2/2) | 🟢 100% (2/2) | 🔴 0% (0/2) | 🟢 100% (2/2) | 🟢 100% (2/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | |
| counting | 🟡 50% (½) | 🟡 50% (½) | 🟢 100% (2/2) | 🔴 0% (0/2) | 🟡 50% (½) | 🟡 50% (½) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | |
| datetime | 🟢 100% (3/3) | 🟢 100% (3/3) | 🟢 100% (3/3) | 🔴 0% (0/3) | 🟢 100% (3/3) | 🟢 100% (3/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | |
| easy | 🟡 88% (⅞) | 🟡 88% (⅞) | 🟢 100% (8/8) | 🔴 0% (0/8) | 🟡 75% (6/8) | 🟡 75% (6/8) | 🔴 0% (0/8) | 🔴 0% (0/8) | 🔴 0% (0/8) | 🔴 0% (0/8) | 🔴 0% (0/8) | 🔴 0% (0/8) | 🔴 0% (0/8) | |
| elasticsearch | 🔴 0% (0/3) | 🔴 0% (0/3) | 🟡 67% (⅔) | 🔴 0% (0/3) | 🟢 100% (3/3) | 🟢 100% (3/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | |
| grafana | 🟢 100% (1/1) | 🟢 100% (1/1) | 🟢 100% (1/1) | 🔴 0% (0/1) | 🟢 100% (1/1) | 🟢 100% (1/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | |
| hard | 🟡 50% (½) | 🟡 50% (½) | 🟡 50% (½) | 🔴 0% (0/2) | 🟡 50% (½) | 🟡 50% (½) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | |
| kubernetes | 🟢 100% (10/10) | 🟢 100% (10/10) | 🟢 100% (10/10) | 🔴 0% (0/10) | 🟡 80% (8/10) | 🟡 90% (9/10) | 🔴 0% (0/10) | 🔴 0% (0/10) | 🔴 0% (0/10) | 🔴 0% (0/10) | 🔴 0% (0/10) | 🔴 0% (0/10) | 🔴 0% (0/10) | |
| logs | 🟡 83% (⅚) | 🟡 83% (⅚) | 🟡 83% (⅚) | 🔴 0% (0/6) | 🟡 67% (4/6) | 🟡 83% (⅚) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | 🔴 0% (0/6) | |
| loki | 🟢 100% (2/2) | 🟢 100% (2/2) | 🟢 100% (2/2) | 🔴 0% (0/2) | 🟡 50% (½) | 🟢 100% (2/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | |
| medium | 🟡 67% (6/9) | 🟡 67% (6/9) | 🟡 89% (8/9) | 🔴 0% (0/9) | 🟡 89% (8/9) | 🟢 100% (9/9) | 🔴 0% (0/9) | 🔴 0% (0/9) | 🔴 0% (0/9) | 🔴 0% (0/9) | 🔴 0% (0/9) | 🔴 0% (0/9) | 🔴 0% (0/9) | |
| metrics | 🟢 100% (1/1) | 🟢 100% (1/1) | 🟢 100% (1/1) | 🔴 0% (0/1) | 🟢 100% (1/1) | 🟢 100% (1/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | |
| multi-cluster | 🔴 0% (0/3) | 🔴 0% (0/3) | 🟡 67% (⅔) | 🔴 0% (0/3) | 🟢 100% (3/3) | 🟢 100% (3/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | |
| network | 🟢 100% (1/1) | 🟢 100% (1/1) | 🟢 100% (1/1) | 🔴 0% (0/1) | 🟢 100% (1/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | |
| one-test | 🟢 100% (1/1) | 🟢 100% (1/1) | 🟢 100% (1/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🟢 100% (1/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | 🔴 0% (0/1) | |
| port-forward | 🟢 100% (3/3) | 🟢 100% (3/3) | 🟢 100% (3/3) | 🔴 0% (0/3) | 🟡 67% (⅔) | 🟢 100% (3/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | |
| question-answer | 🟢 100% (2/2) | 🟢 100% (2/2) | 🟢 100% (2/2) | 🔴 0% (0/2) | 🟢 100% (2/2) | 🟢 100% (2/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | 🔴 0% (0/2) | |
| regression | 🟡 73% (11/15) | 🟡 73% (11/15) | 🟡 93% (14/15) | 🔴 0% (0/15) | 🟡 87% (13/15) | 🟡 87% (13/15) | 🔴 0% (0/15) | 🔴 0% (0/15) | 🔴 0% (0/15) | 🔴 0% (0/15) | 🔴 0% (0/15) | 🔴 0% (0/15) | 🔴 0% (0/15) | |
| skills | 🟡 92% (11/12) | 🟡 92% (11/12) | 🟢 100% (12/12) | 🔴 0% (0/12) | 🟡 83% (10/12) | 🟡 83% (10/12) | 🔴 0% (0/12) | 🔴 0% (0/12) | 🔴 0% (0/12) | 🔴 0% (0/12) | 🔴 0% (0/12) | 🔴 0% (0/12) | 🔴 0% (0/12) | |
| transparency | 🔴 0% (0/3) | 🔴 0% (0/3) | 🟡 67% (⅔) | 🔴 0% (0/3) | 🟢 100% (3/3) | 🟢 100% (3/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | 🔴 0% (0/3) | |
| Overall | 🟡 76% (16/21) | 🟡 76% (16/21) | 🟡 90% (19/21) | 🔴 0% (0/21) | 🟡 81% (17/21) | 🟡 86% (18/21) | 🔴 0% (0/21) | 🔴 0% (0/21) | 🔴 0% (0/21) | 🔴 0% (0/21) | 🔴 0% (0/21) | 🔴 0% (0/21) | 🔴 0% (0/21) |
Raw Results¶
Status of all evaluations across models. Color coding:
- 🟢 Passing 100% (stable)
- 🟡 Passing 1-99%
- 🔴 Passing 0% (failing)
- 🔧 Mock data failure (missing or invalid test data)
- ⚠️ Setup failure (environment/infrastructure issue)
- ⏱️ Timeout or rate limit error
- ⏭️ Test skipped (e.g., known issue or precondition not met)
Detailed Raw Results¶
| Eval ID | deepseek-r1-reasoner | deepseek-v3.2-chat | gemini-3.1-pro-preview | gpt-5.3-codex | gpt-5.4 | gpt-5.5 | haiku-4.5 | opus-4.6 | opus-4.7 | opus-4.8 | qwen-next-80B-instruct | qwen-next-80B-thinking | sonnet-4.6 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 09_crashpod 🔗 | 🟢 100% (1/1) / ⏱️ 36.6s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 23.6s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 25.5s / 💰 $0.06 | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 13.3s / 💰 $0.04 | 🟢 100% (1/1) / ⏱️ 18.8s / 💰 $0.09 | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 1.0s |
| 100a_loki_historical_logs 🔗 | 🟢 100% (1/1) / ⏱️ 147.4s / 💰 $0.04 | 🟢 100% (1/1) / ⏱️ 337.8s / 💰 $0.21 | 🟢 100% (1/1) / ⏱️ 30.9s / 💰 $0.07 | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 16.2s / 💰 $0.05 | 🟢 100% (1/1) / ⏱️ 48.5s / 💰 $0.30 | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 1.7s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.9s |
| 101_loki_historical_logs_pod_deleted 🔗 | 🟢 100% (1/1) / ⏱️ 57.2s / 💰 $0.02 | 🟢 100% (1/1) / ⏱️ 286.7s / 💰 $0.14 | 🟢 100% (1/1) / ⏱️ 24.8s / 💰 $0.05 | 🔴 0% (0/1) / ⏱️ 0.7s | 🟢 100% (1/1) / ⏱️ 19.5s / 💰 $0.07 | 🟢 100% (1/1) / ⏱️ 43.1s / 💰 $0.23 | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 1.6s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.2s |
| 108_logs_nearby_lines 🔗 | 🔴 0% (0/1) / ⏱️ 345.9s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 278.8s / 💰 $0.16 | 🔴 0% (0/1) / ⏱️ 111.3s / 💰 $0.38 | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 15.0s / 💰 $0.07 | 🔴 0% (0/1) / ⏱️ 44.1s / 💰 $0.37 | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.6s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.7s | 🔴 0% (0/1) / ⏱️ 0.9s |
| 112_find_pvcs_by_uuid 🔗 | 🟢 100% (1/1) / ⏱️ 23.8s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 8.4s / 💰 $0.00 | 🟢 100% (1/1) / ⏱️ 23.8s / 💰 $0.05 | 🔴 0% (0/1) / ⏱️ 7.9s | 🟢 100% (1/1) / ⏱️ 9.6s / 💰 $0.03 | 🟢 100% (1/1) / ⏱️ 18.8s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 1.1s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.6s | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.9s |
| 12_job_crashing 🔗 | 🟢 100% (1/1) / ⏱️ 41.6s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 31.1s / 💰 $0.02 | 🟢 100% (1/1) / ⏱️ 26.0s / 💰 $0.05 | 🔴 0% (0/1) / ⏱️ 0.6s | 🟢 100% (1/1) / ⏱️ 11.0s / 💰 $0.04 | 🟢 100% (1/1) / ⏱️ 15.9s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.1s | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.6s | 🔴 0% (0/1) / ⏱️ 1.0s |
| 176_network_policy_blocking_traffic_no_skills 🔗 | 🟢 100% (1/1) / ⏱️ 52.8s / 💰 $0.02 | 🟢 100% (1/1) / ⏱️ 39.1s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 43.7s / 💰 $0.11 | 🔴 0% (0/1) / ⏱️ 0.6s | 🟢 100% (1/1) / ⏱️ 19.5s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 43.7s / 💰 $0.51 | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.1s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.2s |
| 179_grafana_big_dashboard_query 🔗 | 🟢 100% (1/1) / ⏱️ 12.3s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 9.4s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 24.8s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 1.1s | 🟢 100% (1/1) / ⏱️ 9.5s / 💰 $0.08 | 🟢 100% (1/1) / ⏱️ 9.1s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.1s |
| 227_count_configmaps_per_namespace[0] 🔗 | 🟢 100% (1/1) / ⏱️ 19.4s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 14.4s / 💰 $0.00 | 🟢 100% (1/1) / ⏱️ 74.5s / 💰 $0.19 | 🔴 0% (0/1) / ⏱️ 0.6s | 🟢 100% (1/1) / ⏱️ 13.0s / 💰 $0.06 | 🟢 100% (1/1) / ⏱️ 18.9s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 1.1s | 🔴 0% (0/1) / ⏱️ 1.0s |
| 243_pod_names_contain_service 🔗 | 🟢 100% (1/1) / ⏱️ 29.2s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 20.5s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 36.4s / 💰 $0.09 | 🔴 0% (0/1) / ⏱️ 1.1s | 🟢 100% (1/1) / ⏱️ 15.8s / 💰 $0.06 | 🟢 100% (1/1) / ⏱️ 23.0s / 💰 $0.13 | 🔴 0% (0/1) / ⏱️ 6.6s | 🔴 0% (0/1) / ⏱️ 6.5s | 🔴 0% (0/1) / ⏱️ 6.6s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 2.2s | 🔴 0% (0/1) / ⏱️ 2.2s | 🔴 0% (0/1) / ⏱️ 6.5s |
| 24_misconfigured_pvc 🔗 | 🟢 100% (1/1) / ⏱️ 36.4s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 22.0s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 28.8s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 1.0s | 🟢 100% (1/1) / ⏱️ 17.4s / 💰 $0.06 | 🟢 100% (1/1) / ⏱️ 26.3s / 💰 $0.13 | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 1.6s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 1.1s |
| 254_elasticsearch_dr_test_log_check 🔗 | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 68.5s / 💰 $0.16 | 🔴 0% (0/1) / ⏱️ 1.3s | 🟢 100% (1/1) / ⏱️ 21.8s / 💰 $0.08 | 🟢 100% (1/1) / ⏱️ 163.1s / 💰 $0.94 | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 1.7s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 1.1s | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 2.0s |
| 259_wrong_cluster_logs_confusion 🔗 | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.4s | 🟢 100% (1/1) / ⏱️ 65.0s / 💰 $0.18 | 🔴 0% (0/1) / ⏱️ 1.4s | 🟢 100% (1/1) / ⏱️ 16.4s / 💰 $0.05 | 🟢 100% (1/1) / ⏱️ 159.2s / 💰 $0.90 | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 1.8s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 1.7s | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 1.5s |
| 260_global_es_remote_cluster_logs 🔗 | 🔴 0% (0/1) / ⏱️ 1.7s | 🔴 0% (0/1) / ⏱️ 1.8s | 🟢 100% (1/1) / ⏱️ 49.6s / 💰 $0.12 | 🔴 0% (0/1) / ⏱️ 1.3s | 🟢 100% (1/1) / ⏱️ 27.4s / 💰 $0.08 | 🟢 100% (1/1) / ⏱️ 199.0s / 💰 $1.08 | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 1.7s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 1.1s | 🔴 0% (0/1) / ⏱️ 1.1s | 🔴 0% (0/1) / ⏱️ 1.7s |
| 283_todowrite_multistep_audit 🔗 | 🟢 100% (1/1) / ⏱️ 15.0s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 15.9s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 29.7s / 💰 $0.08 | 🔴 0% (0/1) / ⏱️ 0.7s | 🟢 100% (1/1) / ⏱️ 11.7s / 💰 $0.05 | 🟢 100% (1/1) / ⏱️ 21.8s / 💰 $0.12 | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.0s |
| 43_current_datetime_from_prompt 🔗 | 🟢 100% (1/1) / ⏱️ 5.8s / 💰 $0.00 | 🟢 100% (1/1) / ⏱️ 3.5s / 💰 $0.00 | 🟢 100% (1/1) / ⏱️ 9.8s / 💰 $0.01 | 🔴 0% (0/1) / ⏱️ 0.7s | 🟢 100% (1/1) / ⏱️ 4.2s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 4.8s / 💰 $0.01 | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 1.1s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 0.9s |
| 51_logs_summarize_errors 🔗 | 🟢 100% (1/1) / ⏱️ 20.2s / 💰 $0.00 | 🟢 100% (1/1) / ⏱️ 24.4s / 💰 $0.01 | 🟢 100% (1/1) / ⏱️ 17.1s / 💰 $0.05 | 🔴 0% (0/1) / ⏱️ 0.7s | 🟢 100% (1/1) / ⏱️ 10.1s / 💰 $0.03 | 🟢 100% (1/1) / ⏱️ 15.5s / 💰 $0.07 | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.6s | 🔴 0% (0/1) / ⏱️ 1.6s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.9s |
| 61_exact_match_counting 🔗 | 🔴 0% (0/1) / ⏱️ 11.1s / 💰 $0.00 | 🔴 0% (0/1) / ⏱️ 5.4s / 💰 $0.00 | 🟢 100% (1/1) / ⏱️ 10.3s / 💰 $0.03 | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 5.1s / 💰 $0.01 | 🔴 0% (0/1) / ⏱️ 6.7s / 💰 $0.02 | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.9s | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 1.3s |
| 73a_time_window_anomaly 🔗 | 🟢 100% (1/1) / ⏱️ 101.5s / 💰 $0.03 | 🟢 100% (1/1) / ⏱️ 77.6s / 💰 $0.03 | 🟢 100% (1/1) / ⏱️ 52.4s / 💰 $0.19 | 🔴 0% (0/1) / ⏱️ 0.7s | 🟢 100% (1/1) / ⏱️ 18.9s / 💰 $0.09 | 🟢 100% (1/1) / ⏱️ 31.3s / 💰 $0.21 | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.4s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 0.9s | 🔴 0% (0/1) / ⏱️ 1.2s |
| 73b_time_window_anomaly 🔗 | 🟢 100% (1/1) / ⏱️ 66.3s / 💰 $0.02 | 🟢 100% (1/1) / ⏱️ 53.2s / 💰 $0.02 | 🟢 100% (1/1) / ⏱️ 73.3s / 💰 $0.24 | 🔴 0% (0/1) / ⏱️ 0.7s | 🟢 100% (1/1) / ⏱️ 14.2s / 💰 $0.06 | 🟢 100% (1/1) / ⏱️ 33.7s / 💰 $0.28 | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 0.9s |
| 96_no_matching_skill 🔗 | 🟢 100% (1/1) / ⏱️ 117.0s / 💰 $0.03 | 🟢 100% (1/1) / ⏱️ 62.4s / 💰 $0.02 | 🟢 100% (1/1) / ⏱️ 82.0s / 💰 $0.28 | 🔴 0% (0/1) / ⏱️ 1.7s | 🟢 100% (1/1) / ⏱️ 21.6s / 💰 $0.10 | 🟢 100% (1/1) / ⏱️ 45.4s / 💰 $0.29 | 🔴 0% (0/1) / ⏱️ 1.2s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 1.3s | 🔴 0% (0/1) / ⏱️ 1.5s | 🔴 0% (0/1) / ⏱️ 1.0s | 🔴 0% (0/1) / ⏱️ 0.8s | 🔴 0% (0/1) / ⏱️ 1.0s |
Results are automatically generated and updated weekly. View full traces and detailed analysis in Braintrust experiment: ci-benchmark-33287706351.