Measuring Language ModelsMetrics From Classic Machine LearningPre-Training MeasurementSupervised Fine-Tuning MeasurementAlignment MeasurementTask MeasurementUsing BenchmarksMMLU-ProGPQAHELMTask-specific BenchmarksCreating Custom Data Sets for Your TasksTask DefinitionRepurposing DatasetsSynthetic DataHuman LabelingLLM-as-a-JudgeComparing Small Language Model Familiesopenai/gpt-oss-20b (low)Qwen/Qwen3-4B-Instruct-2507meta-llama/Llama-3.2-3Bmicrosoft/Phi-4-mini-instructGPT-5-mini