Skip to content

⚡ August 30, 2026

Generated: 2026-08-30 02:48 UTC
Total Duration: 24m 36s
Iterations: 1
Judge (classifier) model: gpt-4.1

Fast Benchmark

Markers: regression or benchmark
Schedule: Weekly (Sunday 2 AM UTC)
Purpose: Quick regression tests to catch breaking changes

HolmesGPT is continuously evaluated against real-world Kubernetes and cloud troubleshooting scenarios.

If you find scenarios that HolmesGPT does not perform well on, please consider adding them as evals to the benchmark.

Model Accuracy Comparison

Model Pass Fail Skip/Error Total Success Rate
deepseek-r1-reasoner 16 5 0 21 🟡 76% (16/21)
deepseek-v3.2-chat 16 5 0 21 🟡 76% (16/21)
gemini-3.1-pro-preview 19 2 0 21 🟡 90% (19/21)
gpt-5.3-codex 0 21 0 21 🔴 0% (0/21)
gpt-5.4 17 4 0 21 🟡 81% (17/21)
gpt-5.5 18 3 0 21 🟡 86% (18/21)
haiku-4.5 0 21 0 21 🔴 0% (0/21)
opus-4.6 0 21 0 21 🔴 0% (0/21)
opus-4.7 0 21 0 21 🔴 0% (0/21)
opus-4.8 0 21 0 21 🔴 0% (0/21)
qwen-next-80B-instruct 0 21 0 21 🔴 0% (0/21)
qwen-next-80B-thinking 0 21 0 21 🔴 0% (0/21)
sonnet-4.6 0 21 0 21 🔴 0% (0/21)

Model Cost Comparison

Model Tests Avg Cost Min Cost Max Cost Total Cost
deepseek-r1-reasoner 18 $0.02 $0.00 $0.08 $0.31
deepseek-v3.2-chat 18 $0.04 $0.00 $0.21 $0.67
gemini-3.1-pro-preview 21 $0.12 $0.01 $0.38 $2.55
gpt-5.4 21 $0.06 $0.01 $0.10 $1.17
gpt-5.5 21 $0.29 $0.01 $1.08 $5.99

Model Latency Comparison

Model Avg (s) Min (s) Max (s) P50 (s) P95 (s)
deepseek-r1-reasoner 54.5 1.3 345.9 29.2 147.4
deepseek-v3.2-chat 62.8 1.4 337.8 22.0 286.7
gemini-3.1-pro-preview 43.2 9.8 111.3 30.9 82.0
gpt-5.3-codex 1.3 0.6 7.9 0.8 1.7
gpt-5.4 14.8 4.2 27.4 15.0 21.8
gpt-5.5 47.2 4.8 199.0 26.3 163.1
haiku-4.5 1.3 0.9 6.6 1.0 1.4
opus-4.6 1.5 0.9 6.5 1.3 1.8
opus-4.7 1.6 0.9 6.6 1.4 1.9
opus-4.8 1.4 1.3 1.7 1.3 1.7
qwen-next-80B-instruct 1.0 0.8 2.2 0.9 1.3
qwen-next-80B-thinking 1.0 0.6 2.2 0.9 1.2
sonnet-4.6 1.4 0.9 6.5 1.0 2.0

Performance by Tag

Success rate by test category and model:

Tag deepseek-r1-reasoner deepseek-v3.2-chat gemini-3.1-pro-preview gpt-5.3-codex gpt-5.4 gpt-5.5 haiku-4.5 opus-4.6 opus-4.7 opus-4.8 qwen-next-80B-instruct qwen-next-80B-thinking sonnet-4.6 Warnings
benchmark 🟡 83% (⅚) 🟡 83% (⅚) 🟡 83% (⅚) 🔴 0% (0/6) 🟡 67% (4/6) 🟡 83% (⅚) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6)
context_window 🟢 100% (2/2) 🟢 100% (2/2) 🟢 100% (2/2) 🔴 0% (0/2) 🟢 100% (2/2) 🟢 100% (2/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2)
counting 🟡 50% (½) 🟡 50% (½) 🟢 100% (2/2) 🔴 0% (0/2) 🟡 50% (½) 🟡 50% (½) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2)
datetime 🟢 100% (3/3) 🟢 100% (3/3) 🟢 100% (3/3) 🔴 0% (0/3) 🟢 100% (3/3) 🟢 100% (3/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3)
easy 🟡 88% (⅞) 🟡 88% (⅞) 🟢 100% (8/8) 🔴 0% (0/8) 🟡 75% (6/8) 🟡 75% (6/8) 🔴 0% (0/8) 🔴 0% (0/8) 🔴 0% (0/8) 🔴 0% (0/8) 🔴 0% (0/8) 🔴 0% (0/8) 🔴 0% (0/8)
elasticsearch 🔴 0% (0/3) 🔴 0% (0/3) 🟡 67% (⅔) 🔴 0% (0/3) 🟢 100% (3/3) 🟢 100% (3/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3)
grafana 🟢 100% (1/1) 🟢 100% (1/1) 🟢 100% (1/1) 🔴 0% (0/1) 🟢 100% (1/1) 🟢 100% (1/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1)
hard 🟡 50% (½) 🟡 50% (½) 🟡 50% (½) 🔴 0% (0/2) 🟡 50% (½) 🟡 50% (½) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2)
kubernetes 🟢 100% (10/10) 🟢 100% (10/10) 🟢 100% (10/10) 🔴 0% (0/10) 🟡 80% (8/10) 🟡 90% (9/10) 🔴 0% (0/10) 🔴 0% (0/10) 🔴 0% (0/10) 🔴 0% (0/10) 🔴 0% (0/10) 🔴 0% (0/10) 🔴 0% (0/10)
logs 🟡 83% (⅚) 🟡 83% (⅚) 🟡 83% (⅚) 🔴 0% (0/6) 🟡 67% (4/6) 🟡 83% (⅚) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6) 🔴 0% (0/6)
loki 🟢 100% (2/2) 🟢 100% (2/2) 🟢 100% (2/2) 🔴 0% (0/2) 🟡 50% (½) 🟢 100% (2/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2)
medium 🟡 67% (6/9) 🟡 67% (6/9) 🟡 89% (8/9) 🔴 0% (0/9) 🟡 89% (8/9) 🟢 100% (9/9) 🔴 0% (0/9) 🔴 0% (0/9) 🔴 0% (0/9) 🔴 0% (0/9) 🔴 0% (0/9) 🔴 0% (0/9) 🔴 0% (0/9)
metrics 🟢 100% (1/1) 🟢 100% (1/1) 🟢 100% (1/1) 🔴 0% (0/1) 🟢 100% (1/1) 🟢 100% (1/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1)
multi-cluster 🔴 0% (0/3) 🔴 0% (0/3) 🟡 67% (⅔) 🔴 0% (0/3) 🟢 100% (3/3) 🟢 100% (3/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3)
network 🟢 100% (1/1) 🟢 100% (1/1) 🟢 100% (1/1) 🔴 0% (0/1) 🟢 100% (1/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1)
one-test 🟢 100% (1/1) 🟢 100% (1/1) 🟢 100% (1/1) 🔴 0% (0/1) 🔴 0% (0/1) 🟢 100% (1/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1) 🔴 0% (0/1)
port-forward 🟢 100% (3/3) 🟢 100% (3/3) 🟢 100% (3/3) 🔴 0% (0/3) 🟡 67% (⅔) 🟢 100% (3/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3)
question-answer 🟢 100% (2/2) 🟢 100% (2/2) 🟢 100% (2/2) 🔴 0% (0/2) 🟢 100% (2/2) 🟢 100% (2/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2) 🔴 0% (0/2)
regression 🟡 73% (11/15) 🟡 73% (11/15) 🟡 93% (14/15) 🔴 0% (0/15) 🟡 87% (13/15) 🟡 87% (13/15) 🔴 0% (0/15) 🔴 0% (0/15) 🔴 0% (0/15) 🔴 0% (0/15) 🔴 0% (0/15) 🔴 0% (0/15) 🔴 0% (0/15)
skills 🟡 92% (11/12) 🟡 92% (11/12) 🟢 100% (12/12) 🔴 0% (0/12) 🟡 83% (10/12) 🟡 83% (10/12) 🔴 0% (0/12) 🔴 0% (0/12) 🔴 0% (0/12) 🔴 0% (0/12) 🔴 0% (0/12) 🔴 0% (0/12) 🔴 0% (0/12)
transparency 🔴 0% (0/3) 🔴 0% (0/3) 🟡 67% (⅔) 🔴 0% (0/3) 🟢 100% (3/3) 🟢 100% (3/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3) 🔴 0% (0/3)
Overall 🟡 76% (16/21) 🟡 76% (16/21) 🟡 90% (19/21) 🔴 0% (0/21) 🟡 81% (17/21) 🟡 86% (18/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21)

Raw Results

Status of all evaluations across models. Color coding:

  • 🟢 Passing 100% (stable)
  • 🟡 Passing 1-99%
  • 🔴 Passing 0% (failing)
  • 🔧 Mock data failure (missing or invalid test data)
  • ⚠️ Setup failure (environment/infrastructure issue)
  • ⏱️ Timeout or rate limit error
  • ⏭️ Test skipped (e.g., known issue or precondition not met)
Eval ID deepseek-r1-reasoner deepseek-v3.2-chat gemini-3.1-pro-preview gpt-5.3-codex gpt-5.4 gpt-5.5 haiku-4.5 opus-4.6 opus-4.7 opus-4.8 qwen-next-80B-instruct qwen-next-80B-thinking sonnet-4.6
09_crashpod 🔗 🟢 🟢 🟢 🔴 🔴 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
100a_loki_historical_logs 🔗 🟢 🟢 🟢 🔴 🔴 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
101_loki_historical_logs_pod_deleted 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
108_logs_nearby_lines 🔗 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴
112_find_pvcs_by_uuid 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
12_job_crashing 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
176_network_policy_blocking_traffic_no_skills 🔗 🟢 🟢 🟢 🔴 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴
179_grafana_big_dashboard_query 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
227_count_configmaps_per_namespace[0] 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
243_pod_names_contain_service 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
24_misconfigured_pvc 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
254_elasticsearch_dr_test_log_check 🔗 🔴 🔴 🔴 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
259_wrong_cluster_logs_confusion 🔗 🔴 🔴 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
260_global_es_remote_cluster_logs 🔗 🔴 🔴 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
283_todowrite_multistep_audit 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
43_current_datetime_from_prompt 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
51_logs_summarize_errors 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
61_exact_match_counting 🔗 🔴 🔴 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴 🔴
73a_time_window_anomaly 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
73b_time_window_anomaly 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
96_no_matching_skill 🔗 🟢 🟢 🟢 🔴 🟢 🟢 🔴 🔴 🔴 🔴 🔴 🔴 🔴
SUMMARY 🟡 76% (16/21) 🟡 76% (16/21) 🟡 90% (19/21) 🔴 0% (0/21) 🟡 81% (17/21) 🟡 86% (18/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21) 🔴 0% (0/21)

Detailed Raw Results

Eval ID deepseek-r1-reasoner deepseek-v3.2-chat gemini-3.1-pro-preview gpt-5.3-codex gpt-5.4 gpt-5.5 haiku-4.5 opus-4.6 opus-4.7 opus-4.8 qwen-next-80B-instruct qwen-next-80B-thinking sonnet-4.6
09_crashpod 🔗 🟢 100% (1/1) / ⏱️ 36.6s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 23.6s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 25.5s / 💰 $0.06 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 13.3s / 💰 $0.04 🟢 100% (1/1) / ⏱️ 18.8s / 💰 $0.09 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 1.0s
100a_loki_historical_logs 🔗 🟢 100% (1/1) / ⏱️ 147.4s / 💰 $0.04 🟢 100% (1/1) / ⏱️ 337.8s / 💰 $0.21 🟢 100% (1/1) / ⏱️ 30.9s / 💰 $0.07 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 16.2s / 💰 $0.05 🟢 100% (1/1) / ⏱️ 48.5s / 💰 $0.30 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 1.7s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.9s
101_loki_historical_logs_pod_deleted 🔗 🟢 100% (1/1) / ⏱️ 57.2s / 💰 $0.02 🟢 100% (1/1) / ⏱️ 286.7s / 💰 $0.14 🟢 100% (1/1) / ⏱️ 24.8s / 💰 $0.05 🔴 0% (0/1) / ⏱️ 0.7s 🟢 100% (1/1) / ⏱️ 19.5s / 💰 $0.07 🟢 100% (1/1) / ⏱️ 43.1s / 💰 $0.23 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 1.6s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.2s
108_logs_nearby_lines 🔗 🔴 0% (0/1) / ⏱️ 345.9s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 278.8s / 💰 $0.16 🔴 0% (0/1) / ⏱️ 111.3s / 💰 $0.38 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 15.0s / 💰 $0.07 🔴 0% (0/1) / ⏱️ 44.1s / 💰 $0.37 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.6s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.7s 🔴 0% (0/1) / ⏱️ 0.9s
112_find_pvcs_by_uuid 🔗 🟢 100% (1/1) / ⏱️ 23.8s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 8.4s / 💰 $0.00 🟢 100% (1/1) / ⏱️ 23.8s / 💰 $0.05 🔴 0% (0/1) / ⏱️ 7.9s 🟢 100% (1/1) / ⏱️ 9.6s / 💰 $0.03 🟢 100% (1/1) / ⏱️ 18.8s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 1.1s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.6s 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.9s
12_job_crashing 🔗 🟢 100% (1/1) / ⏱️ 41.6s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 31.1s / 💰 $0.02 🟢 100% (1/1) / ⏱️ 26.0s / 💰 $0.05 🔴 0% (0/1) / ⏱️ 0.6s 🟢 100% (1/1) / ⏱️ 11.0s / 💰 $0.04 🟢 100% (1/1) / ⏱️ 15.9s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.1s 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.6s 🔴 0% (0/1) / ⏱️ 1.0s
176_network_policy_blocking_traffic_no_skills 🔗 🟢 100% (1/1) / ⏱️ 52.8s / 💰 $0.02 🟢 100% (1/1) / ⏱️ 39.1s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 43.7s / 💰 $0.11 🔴 0% (0/1) / ⏱️ 0.6s 🟢 100% (1/1) / ⏱️ 19.5s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 43.7s / 💰 $0.51 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.1s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.2s
179_grafana_big_dashboard_query 🔗 🟢 100% (1/1) / ⏱️ 12.3s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 9.4s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 24.8s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 1.1s 🟢 100% (1/1) / ⏱️ 9.5s / 💰 $0.08 🟢 100% (1/1) / ⏱️ 9.1s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.1s
227_count_configmaps_per_namespace[0] 🔗 🟢 100% (1/1) / ⏱️ 19.4s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 14.4s / 💰 $0.00 🟢 100% (1/1) / ⏱️ 74.5s / 💰 $0.19 🔴 0% (0/1) / ⏱️ 0.6s 🟢 100% (1/1) / ⏱️ 13.0s / 💰 $0.06 🟢 100% (1/1) / ⏱️ 18.9s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 1.1s 🔴 0% (0/1) / ⏱️ 1.0s
243_pod_names_contain_service 🔗 🟢 100% (1/1) / ⏱️ 29.2s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 20.5s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 36.4s / 💰 $0.09 🔴 0% (0/1) / ⏱️ 1.1s 🟢 100% (1/1) / ⏱️ 15.8s / 💰 $0.06 🟢 100% (1/1) / ⏱️ 23.0s / 💰 $0.13 🔴 0% (0/1) / ⏱️ 6.6s 🔴 0% (0/1) / ⏱️ 6.5s 🔴 0% (0/1) / ⏱️ 6.6s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 2.2s 🔴 0% (0/1) / ⏱️ 2.2s 🔴 0% (0/1) / ⏱️ 6.5s
24_misconfigured_pvc 🔗 🟢 100% (1/1) / ⏱️ 36.4s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 22.0s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 28.8s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 1.0s 🟢 100% (1/1) / ⏱️ 17.4s / 💰 $0.06 🟢 100% (1/1) / ⏱️ 26.3s / 💰 $0.13 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 1.6s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 1.1s
254_elasticsearch_dr_test_log_check 🔗 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 68.5s / 💰 $0.16 🔴 0% (0/1) / ⏱️ 1.3s 🟢 100% (1/1) / ⏱️ 21.8s / 💰 $0.08 🟢 100% (1/1) / ⏱️ 163.1s / 💰 $0.94 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 1.7s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 1.1s 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 2.0s
259_wrong_cluster_logs_confusion 🔗 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.4s 🟢 100% (1/1) / ⏱️ 65.0s / 💰 $0.18 🔴 0% (0/1) / ⏱️ 1.4s 🟢 100% (1/1) / ⏱️ 16.4s / 💰 $0.05 🟢 100% (1/1) / ⏱️ 159.2s / 💰 $0.90 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 1.8s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 1.7s 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 1.5s
260_global_es_remote_cluster_logs 🔗 🔴 0% (0/1) / ⏱️ 1.7s 🔴 0% (0/1) / ⏱️ 1.8s 🟢 100% (1/1) / ⏱️ 49.6s / 💰 $0.12 🔴 0% (0/1) / ⏱️ 1.3s 🟢 100% (1/1) / ⏱️ 27.4s / 💰 $0.08 🟢 100% (1/1) / ⏱️ 199.0s / 💰 $1.08 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 1.7s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 1.1s 🔴 0% (0/1) / ⏱️ 1.1s 🔴 0% (0/1) / ⏱️ 1.7s
283_todowrite_multistep_audit 🔗 🟢 100% (1/1) / ⏱️ 15.0s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 15.9s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 29.7s / 💰 $0.08 🔴 0% (0/1) / ⏱️ 0.7s 🟢 100% (1/1) / ⏱️ 11.7s / 💰 $0.05 🟢 100% (1/1) / ⏱️ 21.8s / 💰 $0.12 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.0s
43_current_datetime_from_prompt 🔗 🟢 100% (1/1) / ⏱️ 5.8s / 💰 $0.00 🟢 100% (1/1) / ⏱️ 3.5s / 💰 $0.00 🟢 100% (1/1) / ⏱️ 9.8s / 💰 $0.01 🔴 0% (0/1) / ⏱️ 0.7s 🟢 100% (1/1) / ⏱️ 4.2s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 4.8s / 💰 $0.01 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 1.1s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 0.9s
51_logs_summarize_errors 🔗 🟢 100% (1/1) / ⏱️ 20.2s / 💰 $0.00 🟢 100% (1/1) / ⏱️ 24.4s / 💰 $0.01 🟢 100% (1/1) / ⏱️ 17.1s / 💰 $0.05 🔴 0% (0/1) / ⏱️ 0.7s 🟢 100% (1/1) / ⏱️ 10.1s / 💰 $0.03 🟢 100% (1/1) / ⏱️ 15.5s / 💰 $0.07 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.6s 🔴 0% (0/1) / ⏱️ 1.6s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.9s
61_exact_match_counting 🔗 🔴 0% (0/1) / ⏱️ 11.1s / 💰 $0.00 🔴 0% (0/1) / ⏱️ 5.4s / 💰 $0.00 🟢 100% (1/1) / ⏱️ 10.3s / 💰 $0.03 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 5.1s / 💰 $0.01 🔴 0% (0/1) / ⏱️ 6.7s / 💰 $0.02 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.9s 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 1.3s
73a_time_window_anomaly 🔗 🟢 100% (1/1) / ⏱️ 101.5s / 💰 $0.03 🟢 100% (1/1) / ⏱️ 77.6s / 💰 $0.03 🟢 100% (1/1) / ⏱️ 52.4s / 💰 $0.19 🔴 0% (0/1) / ⏱️ 0.7s 🟢 100% (1/1) / ⏱️ 18.9s / 💰 $0.09 🟢 100% (1/1) / ⏱️ 31.3s / 💰 $0.21 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.4s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 0.9s 🔴 0% (0/1) / ⏱️ 1.2s
73b_time_window_anomaly 🔗 🟢 100% (1/1) / ⏱️ 66.3s / 💰 $0.02 🟢 100% (1/1) / ⏱️ 53.2s / 💰 $0.02 🟢 100% (1/1) / ⏱️ 73.3s / 💰 $0.24 🔴 0% (0/1) / ⏱️ 0.7s 🟢 100% (1/1) / ⏱️ 14.2s / 💰 $0.06 🟢 100% (1/1) / ⏱️ 33.7s / 💰 $0.28 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 0.9s
96_no_matching_skill 🔗 🟢 100% (1/1) / ⏱️ 117.0s / 💰 $0.03 🟢 100% (1/1) / ⏱️ 62.4s / 💰 $0.02 🟢 100% (1/1) / ⏱️ 82.0s / 💰 $0.28 🔴 0% (0/1) / ⏱️ 1.7s 🟢 100% (1/1) / ⏱️ 21.6s / 💰 $0.10 🟢 100% (1/1) / ⏱️ 45.4s / 💰 $0.29 🔴 0% (0/1) / ⏱️ 1.2s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 1.3s 🔴 0% (0/1) / ⏱️ 1.5s 🔴 0% (0/1) / ⏱️ 1.0s 🔴 0% (0/1) / ⏱️ 0.8s 🔴 0% (0/1) / ⏱️ 1.0s

Results are automatically generated and updated weekly. View full traces and detailed analysis in Braintrust experiment: ci-benchmark-33287706351.