← Alle LLMs
LLM · Autotrust

JEV

Eine Modellfamilie als lebendes Objekt: Varianten, ausgewählte Leistungsdaten und alle verbundenen BrunoSan-Quellensignale.

Erwähnungen
in 30 Tagen
Quellen
6Varianten
Im Universe erkunden →History öffnen →

Modelle

Alle bekannten Varianten dieser Familie. Ein direkter Artikel-Link springt exakt zur genannten Variante.

Autotrust · JEV

JEV-27B-VL

KNOWN

Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.

—Kontext
—Max. Output
—Input
—Output
—Input / 1M
—Output / 1M
—Tools
—Reasoning
—Structured
HF · Lizenz apache-2.0 · 27.8B Parameter Erwähnungen →Universe →Hugging Face ↗

Benchmarks

BenchmarkWertBeleg
computer use: numbered boxes + element text (60 tasks)Score95%Quelle ↗Model Card · abgerufen 2026-10-10
computer use: numbered boxes onlyScore10%Quelle ↗Model Card · abgerufen 2026-10-10
robot arm: pick and place (20 scenes)Score75%Quelle ↗Model Card · abgerufen 2026-10-10
Autotrust · JEV

JEV-9B

KNOWN

Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.

—Kontext
—Max. Output
—Input
—Output
—Input / 1M
—Output / 1M
—Tools
—Reasoning
—Structured
HF · Lizenz apache-2.0 · 9B Parameter Erwähnungen →Universe →Hugging Face ↗

Benchmarks

BenchmarkWertBeleg
Independent benchmark — answers changed by option order alone (teacher: 7.0 %)Score11.5 %Quelle ↗Model Card · abgerufen 2026-10-11
KL to ground-truth labels, unseen task families (OOD)Score0.234Quelle ↗Model Card · abgerufen 2026-10-11
Independent benchmark, 16 options — % of teacher accuracyScore90 %Quelle ↗Model Card · abgerufen 2026-10-11
Top-1 flips under option shuffle (test set)Score3.9 %Quelle ↗Model Card · abgerufen 2026-10-11
System 1 — mean KL to TypeSafe Jev 1.13, Jev-labelled rowsScore≈ 0.019Quelle ↗Model Card · abgerufen 2026-10-11
Weitere 7 Ergebnisse
BenchmarkWertBeleg
Calibration error (ECE)Score0.0007Quelle ↗Model Card · abgerufen 2026-10-11
Choice top-1 agreement with Jev, Jev-labelled rowsScore90.2 %Quelle ↗Model Card · abgerufen 2026-10-11
Rating error (`score` MAE, all Jev-labelled)Score0.103Quelle ↗Model Card · abgerufen 2026-10-11
Top-1 accuracy, unseen task families (OOD)Score0.918Quelle ↗Model Card · abgerufen 2026-10-11
Yes/no AUROC (`noul`), Jev-labelled rowsScore0.994Quelle ↗Model Card · abgerufen 2026-10-11
System 2 — HumanEval pass@1 (greedy)Score70.7 %Quelle ↗Model Card · abgerufen 2026-10-11
Mean KL to all test targetsScore0.021Quelle ↗Model Card · abgerufen 2026-10-11
Autotrust · JEV

JEV-27B

KNOWN

Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.

—Kontext
—Max. Output
—Input
—Output
—Input / 1M
—Output / 1M
—Tools
—Reasoning
—Structured
HF · Lizenz apache-2.0 · 26.9B Parameter Erwähnungen →Universe →Hugging Face ↗

Benchmarks

BenchmarkWertBeleg
Mean KL to all test targetsScore0.019Quelle ↗Model Card · abgerufen 2026-10-11
Rating error (`score` MAE, all Jev-labelled)Score0.098Quelle ↗Model Card · abgerufen 2026-10-11
Independent benchmark, 16 options — % of teacher accuracyScore96 %Quelle ↗Model Card · abgerufen 2026-10-11
System 2 — HumanEval pass@1 (greedy)Score78.0 %Quelle ↗Model Card · abgerufen 2026-10-11
Calibration error (ECE)Score0.0009Quelle ↗Model Card · abgerufen 2026-10-11
Weitere 7 Ergebnisse
BenchmarkWertBeleg
Top-1 accuracy, unseen task families (OOD)Score0.942Quelle ↗Model Card · abgerufen 2026-10-11
Yes/no AUROC (`noul`), Jev-labelled rowsScore0.995Quelle ↗Model Card · abgerufen 2026-10-11
Choice top-1 agreement with Jev, Jev-labelled rowsScore90.5 %Quelle ↗Model Card · abgerufen 2026-10-11
KL to ground-truth labels, unseen task families (OOD)Score0.104Quelle ↗Model Card · abgerufen 2026-10-11
Top-1 flips under option shuffle (test set)Score2.9 %Quelle ↗Model Card · abgerufen 2026-10-11
System 1 — mean KL to TypeSafe Jev 1.13, Jev-labelled rowsScore≈ 0.017Quelle ↗Model Card · abgerufen 2026-10-11
Independent benchmark — answers changed by option order alone (teacher: 7.0 %)Score7.4 %Quelle ↗Model Card · abgerufen 2026-10-11
Autotrust · JEV

JEV-35B-NVFP4

KNOWN

Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.

—Kontext
—Max. Output
—Input
—Output
—Input / 1M
—Output / 1M
—Tools
—Reasoning
—Structured
Benchmarks werden ergänzt, sobald Werte vorliegen.
Autotrust · JEV

JEV-35B

KNOWN

Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.

—Kontext
—Max. Output
—Input
—Output
—Input / 1M
—Output / 1M
—Tools
—Reasoning
—Structured
Benchmarks werden ergänzt, sobald Werte vorliegen.
Autotrust · JEV

JEV-Gemma4-26B-A4B

KNOWN

Technische Leistungsdaten sind für diese Variante noch nicht vollständig bestätigt.

—Kontext
—Max. Output
—Input
—Output
—Input / 1M
—Output / 1M
—Tools
—Reasoning
—Structured
Benchmarks werden ergänzt, sobald Werte vorliegen.

BrunoSan Chronik

Alle verbundenen Artikel, neueste zuerst.

Noch keine verbundenen Artikel.

Modelldaten und Nachrichten aus BrunoSan AI-News, OpenRouter und Hugging Face. Benchmark-Werte stammen aus den jeweils verlinkten Quellen; Testbedingungen können abweichen. Modelle bleiben auch ohne Benchmark-Werte sichtbar.