De la pregunta clínica a la evidencia reproducible
Martin Munive
Médico general
Analista y programador de software
Un libro ejecutable para aprender a transformar observaciones incompletas en afirmaciones cuantitativas defendibles, sin confundir precisión matemática con certeza clínica.
- Edición web: https://martin-munive.github.io/Estadistica-con-Python/
- Primera sección: De la inquietud clínica a una decisión
- Código y contenido: https://github.com/Martin-Munive/Estadistica-con-Python
Estadística con Python para Medicina y Ciencias de la Salud es un libro
técnico-científico sobre bioestadística, epidemiología, investigación clínica,
medicina basada en evidencia y decisiones reproducibles.
No está organizado como un catálogo de pruebas. La unidad de aprendizaje es una pregunta que debe defenderse: qué queremos saber, qué población observamos, qué cantidad estimamos, qué supuestos aceptamos, qué incertidumbre permanece y qué acción sería proporcionada.
Python funciona como laboratorio de evidencia. El código permite inspeccionar, simular, estimar, diagnosticar y reconstruir el trayecto de una conclusión.
La estadística no elimina la incertidumbre. La mide, localiza sus fuentes y evita que se convierta silenciosamente en certeza.
Una cifra puede ser reproducible y todavía estar equivocada por selección, medición, confusión, pérdida de seguimiento o una pregunta mal formulada. Por eso el libro comienza antes del cálculo y termina después del modelo: en la decisión y sus límites.
Todo el libro desarrolla el Sistema de evidencia oncológica VITAL:
Vigilancia, Investigación, Tecnología y Análisis Longitudinal.
VITAL es una red oncológica ficticia que integra cinco hilos:
- vigilancia poblacional de carga, tendencias y desigualdades;
- cohortes clínicas longitudinales;
- biomarcadores, multiomica, imágenes y patología digital;
- ensayos convencionales, adaptativos y protocolos maestros;
- síntesis viva y evaluación de tecnologías sanitarias.
El cáncer de pulmón no microcítico será el primer caso trazador de oncología de precisión, no el límite de la obra. Mama, cérvix, colorrectal, neoplasias hematológicas, tumores raros y cohortes pan-cáncer aparecerán cuando permitan enseñar un problema estadístico que no deba forzarse dentro de una sola enfermedad.
La continuidad reside en los artefactos comunes: contratos de datos, manifiesto de fuentes, estimadores, simulaciones, pruebas, modelos, registros de supuestos y un dossier final.
| Capítulo | Pregunta estadística | Pieza del Dossier VITAL |
|---|---|---|
| 1. Pregunta estudiable | ¿qué cantidad respondería la decisión? | cartera y protocolo |
| 2. Datos con historia | ¿qué representa cada observación y con qué derechos? | contrato y manifiesto |
| 3. Carga poblacional | ¿cómo comparar tasas, tendencias y brechas? | observatorio oncológico |
| 4. Incertidumbre | ¿cuánto varía una estimación? | biblioteca de simulación |
| 5. Experimentos | ¿qué efecto pretende estimar un ensayo? | plan estadístico |
| 6. Causalidad observacional | ¿qué comparación hipotética es defendible? | emulación y sensibilidad |
| 7. Pruebas y biomarcadores | ¿qué consecuencias tiene un umbral? | expediente de prueba |
| 8. Datos longitudinales | ¿cómo cambian función, síntomas y toxicidad? | módulo de trayectorias |
| 9. Supervivencia | ¿cómo representar censura, competencia y estados? | módulo temporal |
| 10. Multiomica | ¿cómo descubrir sin multiplicar falsos hallazgos? | laboratorio molecular |
| 11. Imagen y radiomica | ¿una señal se repite y se transporta? | estudio de validación |
| 12. Predicción e IA | ¿el modelo calibra, ayuda y conserva validez? | ficha de modelo |
| 13. Protocolos maestros | ¿cómo aprender entre subgrupos y durante el ensayo? | simulador adaptativo |
| 14. Evidencia viva | ¿cómo sintetizar y actualizar estudios heterogéneos? | revisión versionada |
| 15. HTA y decisión | ¿qué opción produce valor y qué información falta? | dossier reproducible |
Al final, el lector tendrá un Dossier VITAL de evidencia oncológica que se puede reconstruir desde la pregunta hasta la decisión.
La primera edición comprende 5 partes, 15 capítulos y 60 secciones:
- Medir el cáncer antes de modelarlo: pregunta, datos, carga poblacional, tendencias y desigualdades.
- Estimar y comparar futuros: probabilidad, experimentos, estimandos y causalidad observacional.
- Pruebas, trayectorias y tiempo: detección, biomarcadores, longitudinalidad y supervivencia.
- Datos oncológicos de frontera: multiomica, radiomica, patología digital, predicción e IA.
- De estudios a decisiones: protocolos maestros, evidencia viva, HTA y dossier reproducible.
MMD enseña a representar el mundo clínico mediante datos, estructuras, funciones, validaciones, pruebas y flujos. Este libro reutiliza esas competencias para construir cohortes, estimandos, estimadores, diagnósticos y decisiones bajo incertidumbre. Cada sección incluirá un Puente MMD cuando una pieza de pensamiento computacional se convierta en una pieza de razonamiento estadístico.
Cada sección debe contener:
- una pregunta o decisión del Sistema VITAL;
- un artefacto previo que se reutiliza;
- intuición estadística y formalización proporcional;
- código ejecutable con resultado esperado;
- supuesto, diagnóstico y escenario donde el método falla;
- interpretación estadística, científica y decisional separadas;
- fuente, versión, licencia y límite de reutilización;
- una pieza nueva del dossier.
- El núcleo ejecutable usa datos sintéticos con proceso generador documentado.
- Las ventanas a datos reales usan fuentes públicas u abiertas con licencia verificada por conjunto o archivo.
- “Gratuito” y “open access” no se interpretan automáticamente como permiso de reutilización.
- Las fuentes con copyright pueden citarse y sintetizarse; sus textos, tablas, figuras o estructuras no se copian.
- Datos controlados, referencias privadas, credenciales y datos clínicos no se incorporan al repositorio público.
- Las afirmaciones científicas importantes se apoyan en fuentes primarias, técnicas o regulatorias y se versionan cuando pueden cambiar.
- profesionales y estudiantes de medicina o ciencias de la salud;
- investigadores clínicos, epidemiólogos y analistas de salud pública;
- programadores que quieren comprender el razonamiento detrás de la estadística biomédica;
- lectores con Python básico que prefieren aprender construyendo evidencia.
Estado actual: rediseño editorial activo.
Implementado localmente:
- tesis acumulativa multitumoral y Sistema VITAL definidos;
- arquitectura de 5 partes, 15 capítulos y 60 secciones;
- protocolo de fuentes, licencias e integridad heredado de MMD;
- Jupyter Book con publicación en GitHub Pages;
- portada, prefacio, contenedores de capítulos y primera sección;
- pruebas de estructura y guardia de frontera pública.
La edición pública puede ir por detrás del rediseño local hasta que la revisión sea validada y autorizada para publicación.
python -m pip install -r requirements.txt
python scripts/build_book.pyEl resultado se genera en _build/html/.
python -m unittest discover -s tests -v
python scripts/check_publication_boundary.py- VITAL es un sistema ficticio y sus datos nucleares son sintéticos.
- Los medicamentos, biomarcadores y tecnologías se usan para enseñar métodos y se fechan contra fuentes vigentes; no forman una guía terapéutica.
- Los ejemplos no constituyen recomendaciones clínicas ni validación de una herramienta o programa asistencial.
- Una guía de reporte mejora transparencia, pero no corrige por sí sola un diseño inadecuado.
- La auditoría interna no sustituye revisión metodológica, clínica, por pares o jurídica cuando sea necesaria.
Martin Munive
Médico general. Analista y programador de software.
La licencia del texto, el código y los activos se definirá antes de la primera versión estable. Hasta entonces, el contenido conserva todos los derechos que no hayan sido concedidos expresamente.