1. Propósito
Este laboratorio muestra cómo una red convolucional puede graduar retinopatía diabética en una fotografía de fondo de ojo. Trabaja exclusivamente con ejemplos desidentificados del conjunto de prueba RetinaMNIST, derivado de DeepDRiD.
2. Los cinco grados
- Sin retinopatía aparente.
- RD no proliferativa leve: microaneurismas únicamente.
- RD no proliferativa moderada.
- RD no proliferativa severa.
- RD proliferativa: neovascularización o hemorragia vítrea/prerretiniana.
Es un problema ordinal: confundir 2 con 3 es menos distante que confundir 0 con 4.
3. Cómo usar la demostración
- Seleccione una imagen sin ver su grado real.
- Pulse “Analizar”.
- Compare el grado estimado con la referencia.
- Observe las cinco probabilidades, no solo la clase ganadora.
- Discuta si el error fue exacto, vecino o distante.
Las predicciones fueron calculadas por el modelo entrenado; la web las conserva para realizar la demostración sin cargar TensorFlow en el pequeño VPS.
4. Datos y entrenamiento
RetinaMNIST contiene 1,600 imágenes RGB de 224×224: 1080 de entrenamiento, 120 de validación y 400 de prueba. El modelo es MobileNetV3-Small con transferencia desde ImageNet, aumento de datos, ponderación de clases y ajuste fino final.
El grado 4 solo aporta 66 imágenes de entrenamiento, frente a 486 de grado 0. Esta desigualdad limita el aprendizaje y obliga a mirar resultados por clase.
5. Resultados honestos
En las 400 imágenes oficiales de prueba obtuvo 57.2% de exactitud, AUC macro 0.839, error absoluto medio de 0.57 grados y kappa cuadrática 0.726.
La exactitud cuenta coincidencias exactas. El AUC evalúa separación entre clases. El error medio conserva distancia ordinal. La kappa cuadrática penaliza más los errores lejanos y descuenta parte del acuerdo esperado por azar.
6. Limitaciones
- Cohorte pequeña y desequilibrada.
- Una sola fotografía recortada no reproduce un protocolo clínico completo.
- No evalúa calidad de imagen ni edema macular.
- Una prueba interna no demuestra generalización a otras cámaras, centros o poblaciones.
- Las probabilidades no están calibradas para prevalencia clínica.
- Los modelos pueden apoyarse en artefactos o señales no causales.