Evaluation Overview
2
Overview
All Runs
New Evaluation
Notifications
Run #481 finished — Accuracy 0.82
Aurora-7B · 2h ago
Regression detected on TruthfulQA
−12% vs last run · 6h ago
Model Quality Scores
Overall
78
/100
Accuracy
82
/100
Robustness
71
/100
Recent Evaluation Runs
View All Runs
Regressions
Borealis-13B on TruthfulQA
Robustness dropped below threshold
−12%
vs last run
Shortcuts
New Evaluation
View All Runs
Evaluation Runs
All statuses
All models
All datasets
Newest first
Run Details
Export report
Re-run evaluation
Metrics
Dataset
Model
Failures
Logs
Key Metrics
Dataset
Model Version
Version
v2.3.1
Artifact
gs://models/aurora
Failures
3
Failed Test Cases
New Evaluation
Select Model
Choose a model…
Aurora-7B · text generation
Borealis-13B · instruction tuned
Cirrus-3B · edge / fast
Select Dataset
Choose a dataset…
HellaSwag-v2 · 39,905 examples
MMLU-mini · 14,042 examples
GSM8K-train · 7,473 examples
TruthfulQA · 817 examples
Metric Suite
Accuracy
Exact-match scoring on held-out labels
F1 Score
Token-level precision & recall
Robustness
Perturbation & adversarial suites
Done