JEV-27B-VL
KNOWNTechnische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.
Alle bekannten Varianten dieser Familie. Ein direkter Artikel-Link springt exakt zur genannten Variante.
Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.
Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.
| Benchmark | Wert | Beleg |
|---|---|---|
| Independent benchmark — answers changed by option order alone (teacher: 7.0 %)Score | 11.5 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| KL to ground-truth labels, unseen task families (OOD)Score | 0.234 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Independent benchmark, 16 options — % of teacher accuracyScore | 90 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Top-1 flips under option shuffle (test set)Score | 3.9 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| System 1 — mean KL to TypeSafe Jev 1.13, Jev-labelled rowsScore | ≈ 0.019 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Benchmark | Wert | Beleg |
|---|---|---|
| Calibration error (ECE)Score | 0.0007 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Choice top-1 agreement with Jev, Jev-labelled rowsScore | 90.2 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Rating error (`score` MAE, all Jev-labelled)Score | 0.103 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Top-1 accuracy, unseen task families (OOD)Score | 0.918 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Yes/no AUROC (`noul`), Jev-labelled rowsScore | 0.994 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| System 2 — HumanEval pass@1 (greedy)Score | 70.7 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Mean KL to all test targetsScore | 0.021 | Quelle ↗Model Card · abgerufen 2026-10-11 |
Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.
| Benchmark | Wert | Beleg |
|---|---|---|
| Mean KL to all test targetsScore | 0.019 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Rating error (`score` MAE, all Jev-labelled)Score | 0.098 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Independent benchmark, 16 options — % of teacher accuracyScore | 96 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| System 2 — HumanEval pass@1 (greedy)Score | 78.0 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Calibration error (ECE)Score | 0.0009 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Benchmark | Wert | Beleg |
|---|---|---|
| Top-1 accuracy, unseen task families (OOD)Score | 0.942 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Yes/no AUROC (`noul`), Jev-labelled rowsScore | 0.995 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Choice top-1 agreement with Jev, Jev-labelled rowsScore | 90.5 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| KL to ground-truth labels, unseen task families (OOD)Score | 0.104 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Top-1 flips under option shuffle (test set)Score | 2.9 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
| System 1 — mean KL to TypeSafe Jev 1.13, Jev-labelled rowsScore | ≈ 0.017 | Quelle ↗Model Card · abgerufen 2026-10-11 |
| Independent benchmark — answers changed by option order alone (teacher: 7.0 %)Score | 7.4 % | Quelle ↗Model Card · abgerufen 2026-10-11 |
Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.
Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.
Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.
Alle verbundenen Artikel, neueste zuerst.
Noch keine verbundenen Artikel.