| Idavidrein/gpqa |
Task diamondMetric diamondSetup GPQA DiamondComparison conditions not established |
58.5859 |
EvalEval Reported by a third party |
Evaluated revision not stated |
2026-04-19 |
| Idavidrein/gpqa |
Task diamondMetric diamondSetup Reasoning: mediumComparison conditions not established |
66 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| Idavidrein/gpqa |
Task diamondMetric diamondSetup Reasoning: high, With toolsComparison conditions not established |
74.2 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| Idavidrein/gpqa |
Task diamondMetric diamondSetup Reasoning: highComparison conditions not established |
71.5 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| Idavidrein/gpqa |
Task diamondMetric diamondSetup Reasoning: low, With toolsComparison conditions not established |
58 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| Idavidrein/gpqa |
Task diamondMetric diamondSetup Reasoning: medium, With toolsComparison conditions not established |
67.1 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| Idavidrein/gpqa |
Task diamondMetric diamondSetup Reasoning: lowComparison conditions not established |
56.8 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| LEXam-Benchmark/LEXam |
Task mcq_4_choicesMetric mcq_4_choicesComparison conditions not established |
40.78 |
LEXam Leaderboard Reported by a third party |
Evaluated revision not stated |
2026-06-02 |
| LEXam-Benchmark/LEXam |
Task open_questionMetric open_questionComparison conditions not established |
32.12 |
LEXam Leaderboard Reported by a third party |
Evaluated revision not stated |
2026-06-02 |
| LiquidAI/ifstruct-v1.0 |
Task ifstruct_v1Metric ifstruct_v1Comparison conditions not established |
91.95 |
Liquid AI — IFStruct v1.0 blog (gpt-oss-20b) Reported by a third party |
Evaluated revision not stated |
2026-06-30 |
| SWE-bench/SWE-bench_Verified |
Task swe_bench_%_resolvedMetric swe_bench_%_resolvedSetup Reasoning: lowComparison conditions not established |
37.4 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| SWE-bench/SWE-bench_Verified |
Task swe_bench_%_resolvedMetric swe_bench_%_resolvedSetup Reasoning: mediumComparison conditions not established |
53.2 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| SWE-bench/SWE-bench_Verified |
Task swe_bench_%_resolvedMetric swe_bench_%_resolvedSetup Reasoning: highComparison conditions not established |
60.7 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| TIGER-Lab/MMLU-Pro |
Task mmlu_proMetric mmlu_proComparison conditions not established |
73.6 |
EvalEval Reported by a third party |
Evaluated revision not stated |
2026-06-30 |
| cais/hle |
Task hleMetric hleSetup Reasoning: lowComparison conditions not established |
4.2 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| cais/hle |
Task hleMetric hleSetup Reasoning: medium, With toolsComparison conditions not established |
8.8 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| cais/hle |
Task hleMetric hleSetup Reasoning: mediumComparison conditions not established |
7 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| cais/hle |
Task hleMetric hleSetup Reasoning: highComparison conditions not established |
10.9 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| cais/hle |
Task hleMetric hleSetup Reasoning: high, With toolsComparison conditions not established |
17.3 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |
| cais/hle |
Task hleMetric hleSetup Reasoning: low, With toolsComparison conditions not established |
6.3 |
GPT-OSS Model Card Reported by a third party |
Evaluated revision not stated |
2025-08-05 |