En esta página
- 15.212 14.8.2 Principios normativos
- 15.212.1 BEN-P01 — Evaluate components and the full chain separately
- 15.212.2 BEN-P02 — Freeze the protocol before opening the test set
- 15.212.3 BEN-P03 — Use grouped and quarantined test data
- 15.212.4 BEN-P04 — No single aggregate score is sufficient
- 15.212.5 BEN-P05 — Report uncertainty for every material result
- 15.212.6 BEN-P06 — Compare models on paired test units
- 15.212.7 BEN-P07 — Separate in-distribution from distribution-shift performance
- 15.212.8 BEN-P08 — Measure abstention and unknown handling
- 15.212.9 BEN-P09 — Keep metric semantics explicit
- 15.212.10 BEN-P10 — Accuracy floors precede speed claims
- 15.212.11 BEN-P11 — Trace every end-to-end error to upstream evidence
- 15.212.12 BEN-P12 — Human utility requires a human study
- 15.212.13 BEN-P13 — Preserve negative and inconclusive results
- 15.212.14 BEN-P14 — Benchmark versions are immutable
15.212 14.8.2 Principios normativos
15.212.1 BEN-P01 —
Evaluate components and the full chain separately
Pose, escena, contactos, fases, cinemática y clasificación conservan métricas propias; el benchmark end-to-end mide además propagación de errores e integración.
15.212.2 BEN-P02 —
Freeze the protocol before opening the test set
Tareas, métricas, tolerancias, exclusiones, seeds, hardware y reglas de decisión se fijan mediante un benchmark profile versionado.
15.212.3 BEN-P03 —
Use grouped and quarantined test data
Atleta, problema, sesión, gimnasio, revisión de escena y dispositivo se agrupan antes del split; el test final no participa en desarrollo.
15.212.4 BEN-P04 —
No single aggregate score is sufficient
El sistema publica un vector de calidad: exactitud, calibración, cobertura, robustez, latencia, trazabilidad, seguridad y utilidad humana.
15.212.5 BEN-P05 —
Report uncertainty for every material result
Todo score principal incluye soporte, intervalo de confianza y unidad de remuestreo coherente con la dependencia de los datos.
15.212.6 BEN-P06 —
Compare models on paired test units
Las comparaciones reutilizan exactamente los mismos intentos y emplean diferencias pareadas, no intervalos independientes interpretados visualmente.
15.212.7 BEN-P07 —
Separate in-distribution from distribution-shift performance
El resultado IID no sustituye validación cruzada por atleta, ruta, gimnasio, cámara, tiempo o condiciones visuales.
15.212.8 BEN-P08 —
Measure abstention and unknown handling
Cobertura, riesgo selectivo, open-set y prediction sets forman parte del benchmark; forzar una clase conocida cuenta como fallo.
15.212.9 BEN-P09 —
Keep metric semantics explicit
MPJPE, PA-MPJPE, PCK, OKS, PQ, HOTA, F1 temporal y métricas de carga no se sustituyen entre sí ni se mezclan sin declarar transformaciones.
15.212.10 BEN-P10 —
Accuracy floors precede speed claims
Latencia, throughput y consumo sólo son comparables cuando el sistema satisface el perfil mínimo de calidad predeterminado.
15.212.11 BEN-P11 —
Trace every end-to-end error to upstream evidence
Cada fallo conserva entradas, outputs intermedios, quality gates y evidencia para localizar propagación desde captura hasta clasificación.
15.212.12 BEN-P12 —
Human utility requires a human study
La utilidad para entrenadores no se infiere desde F1; requiere protocolo ciego, tareas, resultados, tiempo y análisis de aceptación errónea.
15.212.13 BEN-P13 —
Preserve negative and inconclusive results
Ablaciones sin mejora, clases sin soporte y condiciones fallidas permanecen en el reporte y no se eliminan después de observar el test.
15.212.14 BEN-P14 —
Benchmark versions are immutable
Cambios de dataset, ontología, métrica o código producen una nueva versión; resultados de versiones incompatibles no comparten ranking.
Normativa: DEBE indica requisito;
DEBERÍA, recomendación fuerte; PUEDE,
extensión opcional.