Files
aituner/runs/frontier-multicase-sufficiency-v0/results/qwen30-baseline/metrics.json

45 lines
1.2 KiB
JSON

{
"calibration": {
"fit_fixture": "coder_200_ts2",
"fitted_a_tp": {
"1": 0.7234810457606639,
"2": 0.4680889959260082,
"4": 0.3521372005220769
},
"holdout_fixture": "coder_200_ts3",
"loss": "[log(G_raw_rerun(tp,scale2;a)/F_raw(tp,scale2))]^2 per TP",
"refit_on_holdout": false
},
"rows": [
{
"agreement": 37,
"false_feasible": 0,
"false_infeasible": 55,
"kendall_tau_b": 0.0,
"mode": "uncalibrated/SLO-gated",
"optimistic_real_regret": 0.25634517766497456,
"pairwise_exact_sign_accuracy": 0.3787878787878788,
"selected_cells": [
"tp4_mns32",
"tp4_mns64"
],
"worst_case_real_regret": 0.25634517766497456
},
{
"agreement": 64,
"false_feasible": 21,
"false_infeasible": 7,
"kendall_tau_b": 0.9668009539030813,
"mode": "frozen-calibrated/SLO-gated",
"optimistic_real_regret": 0.0,
"pairwise_exact_sign_accuracy": 0.9393939393939394,
"selected_cells": [
"tp2_mns32",
"tp2_mns64"
],
"worst_case_real_regret": 0.0076142131979695165
}
],
"schema": "frontier-qwen30-calibration-audit-v0"
}