Enciclopedia Boulder v1.0

Inicio · Capítulos · 14. Señales para visión artificial

15.227 14.8.17 Contrato de ejecución reproducible

Campo Definición
benchmarkRunId immutable UUID
benchmarkProfileId versioned task/metric/gate contract
benchmarkVersion semantic version
datasetReleaseId immutable dataset release
splitManifestHash SHA-256
ontologyVersion classification ontology version
guidelineVersion annotation guideline version
referencePolicyVersion ground-truth and scoring policy
modelArtifactId model registry identifier
modelArtifactHash weights/package SHA-256
sourceCommit git commit and dirty-state=false
containerDigest OCI image digest
evaluationCodeHash scoring code SHA-256
preprocessingHash full preprocessing graph hash
calibrationArtifactHash probability/conformal calibration artifact
hardwareProfile CPU/GPU/NPU/RAM and power mode
runtimeProfile OS, drivers, CUDA/TensorRT/OpenVINO/DepthAI versions
randomSeeds all seeds or deterministic declaration
submissionMode development|official|audit
testAccessEventId quarantine audit event
startEndTimestamp UTC timestamps
operatorOrServiceId pseudonymous executor
inputAvailabilityPolicy modalities required/optional
failurePolicy timeout, crash and unscorable handling
resultArtifactHash signed result bundle hash

La reproducibilidad exige más que publicar un número. Deben fijarse código, datos, preprocessing, weights, ambiente y evaluación; las recomendaciones de reproducibilidad en ML enfatizan checklists y artefactos verificables [P48-R18].

15.227.1 Salida del benchmark

Campo Contenido
summaryVector primary metrics without hidden weighted collapse
taskResults per task, tier, track and dataset view
classResults per 344 labels with support and intervals
contrastResults per 28 high-priority contrast sets
groupResults prespecified athlete/problem/gym/camera/wall groups
riskCoverageCurves full curves and operating points
calibrationArtifacts reliability data, binning and classwise results
openSetResults known/unknown/insufficient states
robustnessCurves condition by severity and clean baseline
ablationResults paired deltas and confidence intervals
systemResults latency distribution, throughput, memory, energy and failures
excludedUnits IDs and reason codes
errorTaxonomy counts and examples by attributed stage
evidenceAudit sampled evidence ledger fidelity results
reproducibilityAudit rerun deltas and environment match
humanStudyResults separate protocol and analysis; never mixed into technical leaderboard
decisionGateResults pass/fail/not-estimable with rationale
limitations known gaps, unsupported classes and external validity limits