Project 2 · Evaluation systems0/5 completeMetrics Lab
An imbalanced bug/question dataset demands metrics that do not lie. The learner builds the confusion matrix, precision/recall/F1, baselines, slices, and an evaluation gate.
requires artifacts from: document-intelligence
- L1Confusion Matrixdefine the contract · ~10 minstart →
- L2Precision, Recall, F1preserve an invariant · ~12 minlocked
- L3Majority + Keyword Baselinesmeasure behavior · ~15 minlocked
- L4Slices + Thresholdsbound a failure · ~18 minlocked
- L5Evaluation Gatemake an operational decision · ~22 minlocked
Artifacts this project producesL1 · Confusion Matrixoutputs: metrics-lab:l1-confusion-matrix:artifact
L2 · Precision, Recall, F1outputs: metrics-lab:l2-precision-recall-f1:artifact
L3 · Majority + Keyword Baselinesoutputs: metrics-lab:l3-baselines:artifact
L4 · Slices + Thresholdsoutputs: metrics-lab:l4-slices-thresholds:artifact
L5 · Evaluation Gateoutputs: metrics-lab:l5-evaluation-gate:artifact