15.211 14.8.1 Objetivo
Definir un benchmark reproducible y auditable para medir componentes, integración, generalización, incertidumbre, robustez, rendimiento operativo y utilidad humana del pipeline de visión artificial de escalada.
La evaluación se concibe como TEVV: test, evaluación, verificación y validación. NIST subraya que la medición de IA depende del contexto y debe cubrir no sólo exactitud, sino también robustez, seguridad, interpretabilidad, privacidad y otras propiedades relevantes [P48-R1, P47-R20].
Esta entrega define el contrato del benchmark. No contiene resultados empíricos ni declara que exista un sistema capaz de superar los gates.
15.211.1 Alcance
- Evaluación de pose, escena, tracking, contactos, carga, fases, cinemática, clasificación y patrones de fallo.
- Validación end-to-end del intento completo con propagación de errores.
- Generalización entre atletas, problemas, gimnasios, cámaras, tiempo y condiciones.
- Calibración, open-set, abstención, conformal prediction, robustez y rendimiento del sistema.
- Validación prospectiva y humana cuando se formulen claims de despliegue o apoyo al entrenador.
15.211.2 Fuera de alcance
- Declarar un modelo ganador sin dataset, run y test oficial ejecutados.
- Reducir toda la calidad a accuracy o a un leaderboard score único.
- Usar el test para elegir thresholds, clases, features o hiperparámetros.
- Interpretar velocidad de inferencia como calidad biomecánica.
- Inferir utilidad clínica, prevención de lesiones o causalidad de entrenamiento.
- Fijar umbrales universales independientes del perfil y del riesgo.