Inicio · Capítulos · 14. Señales para visión artificial
14.8.17 Contrato de
ejecución reproducible
benchmarkRunId |
immutable UUID |
benchmarkProfileId |
versioned task/metric/gate contract |
benchmarkVersion |
semantic version |
datasetReleaseId |
immutable dataset release |
splitManifestHash |
SHA-256 |
ontologyVersion |
classification ontology version |
guidelineVersion |
annotation guideline version |
referencePolicyVersion |
ground-truth and scoring policy |
modelArtifactId |
model registry identifier |
modelArtifactHash |
weights/package SHA-256 |
sourceCommit |
git commit and dirty-state=false |
containerDigest |
OCI image digest |
evaluationCodeHash |
scoring code SHA-256 |
preprocessingHash |
full preprocessing graph hash |
calibrationArtifactHash |
probability/conformal calibration artifact |
hardwareProfile |
CPU/GPU/NPU/RAM and power mode |
runtimeProfile |
OS, drivers, CUDA/TensorRT/OpenVINO/DepthAI versions |
randomSeeds |
all seeds or deterministic declaration |
submissionMode |
development|official|audit |
testAccessEventId |
quarantine audit event |
startEndTimestamp |
UTC timestamps |
operatorOrServiceId |
pseudonymous executor |
inputAvailabilityPolicy |
modalities required/optional |
failurePolicy |
timeout, crash and unscorable handling |
resultArtifactHash |
signed result bundle hash |
La reproducibilidad exige más que publicar un número. Deben fijarse
código, datos, preprocessing, weights, ambiente y evaluación; las
recomendaciones de reproducibilidad en ML enfatizan checklists y
artefactos verificables [P48-R18].
Salida del benchmark
summaryVector |
primary metrics without hidden weighted collapse |
taskResults |
per task, tier, track and dataset view |
classResults |
per 344 labels with support and intervals |
contrastResults |
per 28 high-priority contrast sets |
groupResults |
prespecified athlete/problem/gym/camera/wall groups |
riskCoverageCurves |
full curves and operating points |
calibrationArtifacts |
reliability data, binning and classwise results |
openSetResults |
known/unknown/insufficient states |
robustnessCurves |
condition by severity and clean baseline |
ablationResults |
paired deltas and confidence intervals |
systemResults |
latency distribution, throughput, memory, energy and failures |
excludedUnits |
IDs and reason codes |
errorTaxonomy |
counts and examples by attributed stage |
evidenceAudit |
sampled evidence ledger fidelity results |
reproducibilityAudit |
rerun deltas and environment match |
humanStudyResults |
separate protocol and analysis; never mixed into technical
leaderboard |
decisionGateResults |
pass/fail/not-estimable with rationale |
limitations |
known gaps, unsupported classes and external validity limits |