Capítulo 262. Inteligencia artificial en neurooftalmología
Sinopsis
Sección titulada «Sinopsis»La neurooftalmología es una de las áreas donde la inteligencia artificial ha producido resultados más sólidos, y la razón es concreta: el diagnóstico del papiledema es una tarea de clasificación de imágenes que un algoritmo puede aprender y que la mayoría de los médicos no oftalmólogos no sabe hacer. Este capítulo desarrolla la detección automatizada del papiledema y del disco anómalo, el análisis del campo visual y de la tomografía con aprendizaje automático, el análisis automático de los movimientos oculares, la validación con sus sesgos y su generalización, el marco regulatorio y la responsabilidad, y la integración realista en la consulta. La tesis es que el valor de estos sistemas no está en sustituir al especialista sino en llevar su criterio a donde no está, y que la pregunta útil no es si el algoritmo iguala al experto sino si mejora lo que hoy hace quien no lo es.
Objetivos de aprendizaje
Sección titulada «Objetivos de aprendizaje»Al finalizar este capítulo, el lector será capaz de:
- Describir el estado de la detección automatizada del papiledema y del disco anómalo.
- Situar el aprendizaje automático aplicado al campo visual y a la tomografía de coherencia óptica.
- Valorar el análisis automático de los movimientos oculares y de la pupila.
- Evaluar críticamente la validación, los sesgos y la generalización de un modelo.
- Conocer el marco regulatorio y las implicaciones de responsabilidad.
- Plantear una integración realista de estas herramientas en su propia consulta.
Introducción
Sección titulada «Introducción»El caso de la neurooftalmología es especialmente favorable y conviene entender por qué, porque explica tanto los éxitos como los límites.
Primero, el problema clínico es real y está cuantificado. La oftalmoscopia fuera de la oftalmología se practica poco y con resultados pobres, y esa carencia se ha abordado sustituyendo la habilidad por la tecnología: fotografiar el fondo de ojo en urgencias es factible, mejora la detección y no requiere entrenamiento oftalmoscópico.[1,2]
Segundo, la tarea es idónea para el aprendizaje profundo: clasificación de imágenes bidimensionales estandarizadas con categorías bien definidas.
Tercero, existe una necesidad asistencial concreta: el paciente con cefalea en un servicio de urgencias sin oftalmólogo de guardia.
Las revisiones sobre inteligencia artificial en oftalmología[3] y específicamente en neurooftalmología[4,5] sitúan el campo, y las revisiones de imagen del nervio óptico incorporan estas herramientas entre las técnicas disponibles.[6]
Y una advertencia de método que recorre el capítulo: los mismos criterios de lectura crítica que el capítulo 261 aplicó a los ensayos se aplican aquí, con dos añadidos propios —la generalización a poblaciones distintas y el sesgo de los datos de entrenamiento.
262.1 · Detección automatizada del papiledema y del disco anómalo
Sección titulada «262.1 · Detección automatizada del papiledema y del disco anómalo»El resultado que estableció el campo
Sección titulada «El resultado que estableció el campo»Un sistema de aprendizaje profundo entrenado con retinografías clasificó los discos ópticos en normales, con papiledema y con otras anomalías, con un rendimiento elevado, y el trabajo se publicó en una revista general de máxima difusión.[7] Ese resultado hizo dos cosas: demostró la viabilidad técnica y situó la neurooftalmología en el mapa de la inteligencia artificial médica.
La comparación con expertos es el estudio que más importa clínicamente. Se comparó la clasificación del disco por aprendizaje profundo con la de neurooftalmólogos expertos, con resultados equiparables en la tarea evaluada.[8] Y conviene leer bien lo que eso significa: el sistema iguala al experto en una tarea concreta y acotada, no reproduce su criterio clínico.
El desarrollo posterior
Sección titulada «El desarrollo posterior»La clasificación de la gravedad del papiledema se ha evaluado con precisión, lo que amplía la utilidad desde la detección hasta la gradación.[9]
La discriminación entre drusas del disco y papiledema, que es el diagnóstico diferencial más difícil de esta obra y el que produce más punciones lumbares innecesarias, se ha abordado específicamente con aprendizaje profundo.[10] Es probablemente la aplicación con mayor valor añadido, porque resuelve un problema que los propios oftalmólogos generales encuentran difícil.
La detección de anomalías del disco en general, más allá del papiledema.[11] Y como estudio de método, la detección automática de la lateralidad del disco, cuyo interés no es clínico sino demostrativo: sirvió para caracterizar el comportamiento del aprendizaje profundo y del aprendizaje por transferencia en tareas neurooftalmológicas.[12]
La aplicación al edema de papila en población pediátrica, con el sistema evaluado en niños.[13]
La aplicación a volúmenes tomográficos, con sistemas capaces de separar papiledema, neuropatía óptica isquémica anterior no arterítica y ojos sanos a partir de tomografías no segmentadas.[14]
La validación en el entorno real
Sección titulada «La validación en el entorno real»Y esto es lo que distingue una demostración de una herramienta. Se ha evaluado la aplicación de un sistema de aprendizaje profundo a retinografías no midriáticas obtenidas en un servicio de urgencias, es decir, en las condiciones y con la calidad de imagen reales.[15]
El contexto asistencial en que se inserta está también documentado: la metodología de implantación de una cámara no midriática en urgencias,[16] el efecto sobre el tiempo hasta la resolución en pacientes remitidos por sospecha de papiledema,[17] el cambio en el perfil de las interconsultas neurooftalmológicas cuando la cámara está disponible,[18] y la implantación en planta con residentes de neurología como usuarios.[19]
La conclusión razonable: la detección automatizada del papiledema es la aplicación más madura de la inteligencia artificial en neurooftalmología, con validación en entorno real y con un problema asistencial identificado al que responde.
Lo que sigue necesitando al clínico
Sección titulada «Lo que sigue necesitando al clínico»Tres cosas, y conviene enunciarlas porque delimitan el papel del algoritmo:
Decidir si el edema de papila es papiledema, neuritis o isquemia. El algoritmo detecta el edema; la etiología es clínica.
Decidir qué se hace. Un papiledema detectado obliga a una secuencia —imagen con venografía, punción lumbar— que el algoritmo no indica.
Interpretar los casos discordantes, que son precisamente los que importan.
262.2 · Análisis del campo visual y de la OCT con aprendizaje automático
Sección titulada «262.2 · Análisis del campo visual y de la OCT con aprendizaje automático»Campo visual
Sección titulada «Campo visual»Es un terreno con menos madurez que la imagen del disco y con un problema propio: el campo visual es una prueba subjetiva con ruido considerable, y separar progresión real de variabilidad es difícil incluso con series largas.
Lo que se ha desarrollado:
Predicción de progresión. Los métodos existentes y las aproximaciones basadas en inteligencia artificial para predecir la progresión del campo visual en el glaucoma están revisados,[20] y se han desarrollado sistemas que predicen incidencia y progresión a partir de retinografías.[21]
Y la advertencia que corresponde a esta obra: la mayor parte de ese desarrollo es glaucomatoso, y su traslación a los defectos campimétricos de origen neurológico no está establecida. Los patrones neurológicos —hemianopsias, defectos quiasmáticos, constricciones concéntricas— son distintos y están infrarrepresentados en los conjuntos de entrenamiento.
Una aplicación específica del campo con más potencial en neurooftalmología es la de las alternativas digitales y de realidad virtual a la perimetría, evaluadas sobre todo en población pediátrica, donde la campimetría convencional es poco fiable.[22,23]
Tomografía de coherencia óptica
Sección titulada «Tomografía de coherencia óptica»El aprendizaje automático ha avanzado más en la segmentación que en el diagnóstico, y esa distinción importa.
Segmentación automática. Se han desarrollado métodos semiautomáticos de segmentación de los tejidos de la cabeza del nervio óptico en imágenes tomográficas,[24] y métodos híbridos que combinan aprendizaje profundo con búsqueda de grafo óptimo para la segmentación de capas en enfermedad.[25]
Por qué eso importa clínicamente: la segmentación automática es la fuente de los espesores que se usan a diario, y sus errores son la causa más frecuente de interpretación equivocada de una tomografía. Mejorar la segmentación mejora todos los diagnósticos que dependen de ella.
Diagnóstico a partir de la tomografía. Los sistemas que clasifican patología del nervio óptico a partir de volúmenes tomográficos son la línea más reciente,[14] y la distinción entre papiledema y pseudopapiledema mediante parámetros tomográficos —con métodos convencionales— es el problema que intentan automatizar.[26,27,28]
262.3 · Análisis automático de los movimientos oculares
Sección titulada «262.3 · Análisis automático de los movimientos oculares»Por qué es un terreno prometedor
Sección titulada «Por qué es un terreno prometedor»Porque los movimientos oculares son señales cuantificables con alta frecuencia de muestreo y con alteraciones características de enfermedades concretas, y porque su exploración clínica es cualitativa y depende del observador.
Lo desarrollado
Sección titulada «Lo desarrollado»Cuantificación del nistagmo con dispositivos accesibles. Se ha desarrollado y evaluado la cuantificación del nistagmo inducido mediante una aplicación de seguimiento ocular en teléfono móvil,[29] y analizadores computarizados del nistagmo optocinético para la estimación de la agudeza visual pediátrica.[30]
Estimación de la agudeza visual mediante seguimiento de la mirada, con sistemas que no requieren calibración explícita,[31] y aplicaciones de realidad virtual con seguimiento ocular en oftalmología pediátrica, revisadas sistemáticamente.[32]
Pupilometría cuantitativa, que es el ejemplo más consolidado de medida automatizada en este territorio: su uso en el entorno neurocrítico está descrito[33] y su valor pronóstico se ha evaluado de forma prospectiva y multicéntrica.[34]
Lo que falta
Sección titulada «Lo que falta»- Validación clínica frente a la exploración del especialista en cuadros concretos.
- Estandarización de los parámetros medidos, que difieren entre dispositivos.
- Datos normativos por edad, especialmente en población pediátrica.
- Demostración de que la cuantificación cambia decisiones, que es el paso que separa la medida del beneficio.
Y una observación que conviene hacer: este es el terreno donde la inteligencia artificial podría aportar más a la neurooftalmología, precisamente porque automatiza una exploración que hoy se hace mal y de forma subjetiva. Su desarrollo, sin embargo, está mucho menos avanzado que el de la imagen del disco.
262.4 · Validación, sesgos y generalización de los modelos
Sección titulada «262.4 · Validación, sesgos y generalización de los modelos»Las siete preguntas para leer un estudio de inteligencia artificial
Sección titulada «Las siete preguntas para leer un estudio de inteligencia artificial»Análogas a las del capítulo 261 y con la misma intención de durar más que las herramientas que describen:
Primera: ¿con qué se comparó? Un rendimiento elevado frente a una etiqueta de referencia no dice nada si esa etiqueta la generó el propio grupo. La comparación con expertos independientes es lo que importa.[8]
Segunda: ¿en qué población se validó? La validación interna con partición de los mismos datos es el requisito mínimo; la validación externa en otra población es lo que demuestra utilidad. Los estudios de generalización entre poblaciones muestran caídas de rendimiento apreciables, como se ha documentado en la detección de retinopatía diabética.[35]
Tercera: ¿con qué equipos se obtuvieron las imágenes? Un modelo entrenado con un tipo de cámara puede fallar con otro, y ese es un problema práctico de primer orden en neurooftalmología, donde la calidad de la retinografía no midriática es variable.
Cuarta: ¿cuál es la prevalencia en el entorno de aplicación? Un valor predictivo positivo excelente en una serie enriquecida se degrada en una población con prevalencia baja, que es la del servicio de urgencias.
Quinta: ¿qué pasa con los casos que el modelo no sabe clasificar? Un sistema que fuerza una categoría en cada imagen es peor que uno que declara incertidumbre.
Sexta: ¿se ha medido el efecto sobre decisiones y sobre resultados? Es la pregunta que casi nunca tiene respuesta, y la única que importa de verdad.
Séptima: ¿el estudio sigue una guía de comunicación? Existen extensiones específicas de las guías de comunicación para intervenciones con inteligencia artificial en ensayos clínicos[36] y guías actualizadas para modelos de predicción clínica que emplean aprendizaje automático.[37] Su seguimiento es un indicador razonable de calidad.
Los sesgos, con sus mecanismos
Sección titulada «Los sesgos, con sus mecanismos»El sesgo no es un defecto moral del algoritmo: es una propiedad de sus datos, y conviene entender los mecanismos porque son predecibles.
Sesgo de composición del conjunto de entrenamiento. Si el conjunto sobrerrepresenta un grupo étnico, una franja de edad o un tipo de cámara, el rendimiento cae fuera de ese perfil. Las implicaciones éticas de la inteligencia artificial en la atención sanitaria están revisadas.[38]
Sesgo de la etiqueta. El modelo aprende del criterio de quien etiquetó, incluidos sus errores. En neurooftalmología eso significa que un modelo entrenado con etiquetas de un centro terciario aprende el criterio de ese centro.
Sesgo de indicación. Las imágenes disponibles son las que alguien decidió obtener, y esa decisión no es aleatoria.
Sesgo de espectro. Los casos incluidos suelen ser los claros; los dudosos —que son los que necesitan ayuda— están infrarrepresentados.
Y la consecuencia de equidad, que hay que nombrar: un modelo que funciona peor en el grupo con menos representación en los datos empeora la desigualdad existente en lugar de corregirla, y ese riesgo es mayor precisamente en los entornos con menos acceso a especialista, que son los que más se beneficiarían de la herramienta.
262.5 · Marco regulatorio y responsabilidad
Sección titulada «262.5 · Marco regulatorio y responsabilidad»El marco regulatorio
Sección titulada «El marco regulatorio»Estos sistemas son productos sanitarios y están regulados como tales. El panorama de aprobaciones de productos sanitarios basados en inteligencia artificial y aprendizaje automático se ha analizado de forma comparativa entre jurisdicciones,[39] y su lectura muestra dos hechos relevantes:
Primero: el número de aprobaciones ha crecido de forma acelerada, con predominio de aplicaciones de imagen.
Segundo: los requisitos de evidencia para la aprobación son sustancialmente menores que los de un fármaco, y en muchos casos se basan en rendimiento diagnóstico y no en resultado clínico.
La consecuencia práctica para el clínico: la aprobación regulatoria no equivale a demostración de beneficio clínico, y esa distinción es la más importante de este apartado. Un sistema aprobado puede no haber demostrado que mejore ningún resultado en ningún paciente.
Los problemas regulatorios específicos
Sección titulada «Los problemas regulatorios específicos»- Los modelos que aprenden de forma continua plantean un problema de fondo: lo aprobado deja de ser lo que se usa.
- La transparencia del funcionamiento, con modelos cuya lógica interna no es interpretable.
- La actualización y el mantenimiento, porque el rendimiento se degrada cuando cambia la población o el equipamiento.
- La vigilancia posterior a la comercialización, mucho menos desarrollada que en farmacovigilancia.
La responsabilidad
Sección titulada «La responsabilidad»Es la pregunta que más preocupa y la que menos respuesta definida tiene. La discusión sobre la responsabilidad del clínico frente a las recomendaciones de un sistema automatizado está abierta y su marco ético revisado.[38]
Lo que sí puede afirmarse con generalidad, y es lo que el capítulo debe dejar establecido:
La decisión clínica sigue siendo del clínico. Un sistema de apoyo no transfiere la responsabilidad, y actuar contra el propio criterio porque el algoritmo lo indica no exime.
El clínico debe conocer los límites del sistema que usa: en qué población se validó, con qué equipos y con qué rendimiento. Usar una herramienta cuyos límites no se conocen es la posición más difícil de defender.
Hay que documentar cuándo se usó y qué se decidió, igual que con cualquier otra prueba.
Y la discrepancia debe justificarse en ambas direcciones: cuando se sigue al algoritmo contra el propio criterio y cuando se hace lo contrario.
262.6 · Integración realista en la consulta
Sección titulada «262.6 · Integración realista en la consulta»Dónde aporta hoy
Sección titulada «Dónde aporta hoy»Y conviene ser concreto, porque la respuesta genérica —«ayudará al diagnóstico»— no es utilizable.
En el cribado por personal no especializado. Es el caso de uso con mejor fundamento: la detección de papiledema en un servicio de urgencias sin oftalmólogo, con retinografía no midriática y lectura asistida por algoritmo.[15,16,17] Aquí el comparador no es el especialista: es la ausencia de exploración.
En la priorización de la agenda. Un sistema que ordena las retinografías pendientes de lectura por probabilidad de anomalía adelanta los casos urgentes.
En la segmentación tomográfica, que ya está integrada en los equipos y cuya mejora es invisible pero real.[24,25]
En la detección en la comunidad, donde los instrumentos de cribado del daño visual tras un daño cerebral por médicos generales muestran el tipo de problema que la automatización podría abordar.[40]
Dónde no aporta todavía
Sección titulada «Dónde no aporta todavía»- En el diagnóstico etiológico, que sigue siendo clínico.
- En el paciente complejo, que es el que más consume tiempo del especialista.
- En la decisión terapéutica.
- En la valoración funcional y en la comunicación, que son el contenido de la Parte Quinta de esta obra.
Los modelos de lenguaje
Sección titulada «Los modelos de lenguaje»Merecen un apartado propio porque su irrupción ha sido reciente y su valoración exige cautela. Su impacto en oftalmología se ha revisado,[41] existen evaluaciones sistemáticas de las aplicaciones sanitarias de los modelos de lenguaje de gran tamaño,[42] y se han desarrollado marcos específicos con recuperación aumentada para oftalmología.[43]
Lo que conviene tener presente: su rendimiento en tareas de conocimiento es notable y su fiabilidad factual es variable; no son sistemas de diagnóstico validados, y su uso más razonable hoy es de apoyo documental y administrativo, no de decisión clínica.
Las condiciones para que la integración funcione
Sección titulada «Las condiciones para que la integración funcione»Los obstáculos de implantación están estudiados y son organizativos más que técnicos: las barreras a la implantación de modelos en la práctica y las estrategias para su despliegue a gran escala están descritas.[44,45]
Cinco condiciones prácticas:
Primera: que resuelva un problema que el centro tenga. La variabilidad de práctica documentada entre oftalmólogos en otros terrenos[46] recuerda que las necesidades difieren entre centros.
Segunda: que esté integrado en el flujo de trabajo y no en una aplicación aparte.
Tercera: que su resultado llegue a quien decide y en el momento en que decide.
Cuarta: que exista un circuito para el caso positivo. Un algoritmo que detecta papiledema en un centro sin vía de derivación no mejora nada.
Quinta: que alguien mantenga el sistema y vigile su rendimiento a lo largo del tiempo.
Aplicación clínica
Sección titulada «Aplicación clínica»Caso 1. Servicio de urgencias de un hospital sin oftalmólogo de guardia que plantea instalar una cámara no midriática con lectura asistida. Conducta: es el escenario con mejor fundamento; hay que asegurar además el circuito de derivación para el positivo y la formación del personal que obtiene la imagen.[15,16,17]
Caso 2. Sistema comercial que ofrece detección de papiledema con rendimiento excelente publicado en una población de otro país y con otra cámara. Conducta: preguntar por la validación externa con el propio equipamiento y en la propia población, porque la caída de rendimiento entre poblaciones está documentada.[35,39]
Caso 3. Paciente con retinografía clasificada como normal por el algoritmo y con cefalea, vómitos y diplopía. Conducta: la clínica manda. Un resultado negativo del algoritmo no descarta, y la decisión sigue siendo del clínico.[8,38]
Caso 4. Residente que consulta un modelo de lenguaje para orientar un caso complejo. Conducta: utilizable como apoyo documental, no como fuente de decisión; verificar toda afirmación factual y toda referencia.[41,42]
Controversias y lagunas de evidencia
Sección titulada «Controversias y lagunas de evidencia»La ausencia de estudios de resultado clínico. Prácticamente toda la evidencia disponible mide rendimiento diagnóstico y no efecto sobre decisiones o sobre desenlaces visuales.[7,15]
La generalización entre poblaciones y entre equipos, con caídas de rendimiento documentadas.[35]
La aplicación al campo visual de origen neurológico, donde el desarrollo es glaucomatoso y su traslación no está establecida.[20,21]
El análisis automático de los movimientos oculares, prometedor y con validación clínica escasa.[29,31]
El marco de responsabilidad, sin doctrina consolidada.[38,39]
Los modelos de lenguaje, con evaluación sistemática incipiente y fiabilidad factual variable.[42,43]
Puntos clave
Sección titulada «Puntos clave»- El valor está en llevar el criterio del especialista a donde no está, no en sustituirlo.
- La pregunta útil no es si iguala al experto, sino si mejora lo que hoy hace quien no lo es.
- La detección automatizada del papiledema es la aplicación más madura, con validación en urgencias.
- La discriminación entre drusas y papiledema es probablemente la de mayor valor añadido.
- El algoritmo detecta el edema; la etiología sigue siendo clínica.
- La aprobación regulatoria no equivale a demostración de beneficio clínico.
- Los estudios de campo visual con aprendizaje automático son glaucomatosos: no se extrapolan al defecto neurológico.
- La mejora de la segmentación tomográfica es invisible y muy relevante, porque sus errores causan interpretaciones equivocadas.
- El sesgo es una propiedad de los datos, y puede aumentar la desigualdad en lugar de corregirla.
- La decisión sigue siendo del clínico, y usar una herramienta cuyos límites no se conocen es indefendible.
- Un algoritmo sin circuito de derivación para el positivo no mejora nada.
Conclusiones
Sección titulada «Conclusiones»La inteligencia artificial ha entrado en neurooftalmología por la puerta correcta. No ha empezado sustituyendo el juicio del especialista en los casos difíciles, sino resolviendo un problema concreto y documentado: que el fondo de ojo no se explora donde no hay oftalmólogo. Ese encuadre es el que da valor a los resultados existentes y el que conviene mantener al evaluar los que vengan, porque el comparador correcto en ese escenario no es el neurooftalmólogo experto: es la ausencia de exploración.
Con la misma claridad hay que señalar lo que falta, y es lo mismo que faltaba en el capítulo anterior: casi ningún estudio mide el efecto sobre decisiones o sobre resultados visuales. Se ha demostrado que los sistemas clasifican bien; no se ha demostrado que los pacientes vean mejor por ello. Esa diferencia es exactamente la que separaba, en el capítulo 261, lo que un ensayo demuestra de lo que se le atribuye.
Y queda una consideración de equidad que merece cerrar el capítulo. Estas herramientas prometen llevar criterio especializado a los entornos que no lo tienen, y ese es el mejor argumento a su favor. Pero funcionan peor precisamente en las poblaciones menos representadas en los datos con que se entrenaron, que con frecuencia son las mismas. Vigilar ese desajuste no es una precaución teórica: es la condición para que la promesa se cumpla.
El capítulo siguiente aborda la organización asistencial que hace posible —o imposible— que todo lo desarrollado en esta obra llegue al paciente.
Bibliografía
Sección titulada «Bibliografía»Estilo Vancouver, numeración por orden de aparición en el texto. Referencias verificadas contra NCBI E-utilities. PMID y, cuando está indexado, DOI.
-
Bruce BB. Nonmydriatic Ocular Fundus Photography in the Emergency Department: How It Can Benefit Neurologists. Semin Neurol. 2015;35(5):491-5. PMID: 26444394 · DOI: 10.1055/s-0035-1563576
-
Vasseneix C, Bruce BB, Bidot S, Newman NJ, Biousse V. Nonmydriatic Fundus Photography in Patients with Acute Vision Loss. Telemed J E Health. 2019;25(10):911-916. PMID: 30575447 · DOI: 10.1089/tmj.2018.0209
-
Ting DSW, Pasquale LR, Peng L, Campbell JP, Lee AY, Raman R, et al. Artificial intelligence and deep learning in ophthalmology. Br J Ophthalmol. 2019;103(2):167-175. PMID: 30361278 · DOI: 10.1136/bjophthalmol-2018-313173
-
Leong YY, Vasseneix C, Finkelstein MT, Milea D, Najjar RP. Artificial Intelligence Meets Neuro-Ophthalmology. Asia Pac J Ophthalmol (Phila). 2022;11(2):111-125. PMID: 35533331 · DOI: 10.1097/APO.0000000000000512
-
Lapka M, Straňák Z. The Current State of Artificial Intelligence in Neuro-Ophthalmology. A Review. Cesk Slov Oftalmol. 2024;80(4):179-186. PMID: 38538291 · DOI: 10.31348/2023/33
-
Biousse V, Danesh-Meyer HV, Saindane AM, Lamirel C, Newman NJ. Imaging of the optic nerve: technological advances and future prospects. Lancet Neurol. 2022;21(12):1135-1150. PMID: 36155662 · DOI: 10.1016/S1474-4422(22)00173-9
-
Milea D, Najjar RP, Zhubo J, Ting D, Vasseneix C, Xu X, et al. Artificial Intelligence to Detect Papilledema from Ocular Fundus Photographs. N Engl J Med. 2020;382(18):1687-1695. PMID: 32286748 · DOI: 10.1056/NEJMoa1917130
-
Biousse V, Newman NJ, Najjar RP, Vasseneix C, Xu X, Ting DS, et al. Optic Disc Classification by Deep Learning versus Expert Neuro-Ophthalmologists. Ann Neurol. 2020;88(4):785-795. PMID: 32621348 · DOI: 10.1002/ana.25839
-
Vasseneix C, Najjar RP, Xu X, Tang Z, Loo JL, Singhal S, et al. Accuracy of a Deep Learning System for Classification of Papilledema Severity on Ocular Fundus Photographs. Neurology. 2021;97(4):e369-e377. PMID: 34011570 · DOI: 10.1212/WNL.0000000000012226
-
Sathianvichitr K, Najjar RP, Zhiqun T, Fraser JA, Yau CWL, Girard MJA, et al. A Deep Learning Approach for Accurate Discrimination Between Optic Disc Drusen and Papilledema on Fundus Photographs. J Neuroophthalmol. 2024;44(4):454-461. PMID: 39090774 · DOI: 10.1097/WNO.0000000000002223
-
Liu TYA, Wei J, Zhu H, Subramanian PS, Myung D, Yi PH, et al. Detection of Optic Disc Abnormalities in Color Fundus Photographs Using Deep Learning. J Neuroophthalmol. 2021;41(3):368-374. PMID: 34415271 · DOI: 10.1097/WNO.0000000000001358
-
Liu TYA, Ting DSW, Yi PH, Wei J, Zhu H, Subramanian PS, et al. Deep Learning and Transfer Learning for Optic Disc Laterality Detection: Implications for Machine Learning in Neuro-Ophthalmology. J Neuroophthalmol. 2020;40(2):178-184. PMID: 31453913 · DOI: 10.1097/WNO.0000000000000827
-
Lin MY, Najjar RP, Tang Z, Cioplean D, Dragomir M, Chia A, et al. The BONSAI (Brain and Optic Nerve Study with Artificial Intelligence) deep learning system can accurately identify pediatric papilledema on standard ocular fundus photographs. J AAPOS. 2024;28(1):103803. PMID: 38216117 · DOI: 10.1016/j.jaapos.2023.10.005
-
Szanto D, Wang JK, Woods B, Garvin MK, Johnson BA, Kardon RH, et al. Deep Learning Differentiates Papilledema, NAION, and Healthy Eyes With Unsegmented 3D OCT Volumes. Am J Ophthalmol. 2025;277:249-259. PMID: 40447246 · DOI: 10.1016/j.ajo.2025.05.036
-
Biousse V, Najjar RP, Tang Z, Lin MY, Wright DW, Keadey MT, et al. Application of a Deep Learning System to Detect Papilledema on Nonmydriatic Ocular Fundus Photographs in an Emergency Department. Am J Ophthalmol. 2024;261:199-207. PMID: 37926337 · DOI: 10.1016/j.ajo.2023.10.025
-
Berman G, Pendley AM, Wright DW, Silverman R, Kelley C, Duran MR, et al. Breaking the barriers: Methodology of implementation of a non-mydriatic ocular fundus camera in an emergency department. Surv Ophthalmol. 2025;70(1):153-161. PMID: 39357747 · DOI: 10.1016/j.survophthal.2024.09.012
-
Lin MY, Ray HJ, Pendley AM, Bénard-Séguin É, Okrent Smolar AL, Duran MR, et al. Emergency Department Nonmydriatic Fundus Photography Expedites Care for Patients Referred for Papilledema. Ophthalmology. 2025;132(7):823-829. PMID: 39894060 · DOI: 10.1016/j.ophtha.2025.01.024
-
Lin MY, Dattilo M, Pendley AM, Yan KY, Keadey MT, Wright DW, et al. Neuro-ophthalmology Consultations in an Academic Medical Center with an Emergency Department Equipped with Nonmydriatic Fundus Imaging. Ophthalmology. 2026;133(1):31-38. PMID: 40849090 · DOI: 10.1016/j.ophtha.2025.08.013
-
Schwartz NU, Silverman A, Beres S, Moss HE, Kvam K, Galetta K. Inpatient Implementation of Portable Ocular Fundus Photography Among Neurology Residents. Neurohospitalist. 2025;15(3):275-280. PMID: 39895825 · DOI: 10.1177/19418744251317260
-
Asaoka R, Murata H. Prediction of visual field progression in glaucoma: existing methods and artificial intelligence. Jpn J Ophthalmol. 2023;67(5):546-559. PMID: 37540325 · DOI: 10.1007/s10384-023-01009-3
-
Li F, Su Y, Lin F, Li Z, Song Y, Nie S, et al. A deep-learning system predicts glaucoma incidence and progression using retinal photographs. J Clin Invest. 2022;132(11). PMID: 35642636 · DOI: 10.1172/JCI157968
-
Riaz M, Ross NC, Mayer DL. The diagnostic accuracy and feasibility of paediatric visual field tests: A systematic review. Ophthalmic Physiol Opt. 2025;45(3):726-741. PMID: 39873237 · DOI: 10.1111/opo.13449
-
Mesfin Y, Kong A, Backus BT, Deiner M, Ou Y, Oatts JT. Pilot study comparing a new virtual reality-based visual field test to standard perimetry in children. J AAPOS. 2024;28(3):103933. PMID: 38729256 · DOI: 10.1016/j.jaapos.2024.103933
-
Clingo KA, Czerpak CA, Quigley HA, Nguyen TD. Deep learning method for semi-automated segmentation of optic nerve head tissues in optical coherence tomography images. Exp Eye Res. 2025;261:110678. PMID: 41038371 · DOI: 10.1016/j.exer.2025.110678
-
Chen Z, Zhang H, Linton EF, Johnson BA, Choi YJ, Kupersmith MJ, et al. Hybrid deep learning and optimal graph search method for optical coherence tomography layer segmentation in diseases affecting the optic nerve. Biomed Opt Express. 2024;15(6):3681-3698. PMID: 38867777 · DOI: 10.1364/BOE.516045
-
Rebolleda G, Kawasaki A, de Juan V, Oblanca N, Muñoz-Negrete FJ. Optical Coherence Tomography to Differentiate Papilledema from Pseudopapilledema. Curr Neurol Neurosci Rep. 2017;17(10):74. PMID: 28819712 · DOI: 10.1007/s11910-017-0790-6
-
Pardon LP, Cheng H, Tang RA, Saenz R, Frishman LJ, Patel NB. Custom Optical Coherence Tomography Parameters for Distinguishing Papilledema from Pseudopapilledema. Optom Vis Sci. 2019;96(8):599-608. PMID: 31318797 · DOI: 10.1097/OPX.0000000000001408
-
Sibony PA, Kupersmith MJ, Kardon RH. Optical Coherence Tomography Neuro-Toolbox for the Diagnosis and Management of Papilledema, Optic Disc Edema, and Pseudopapilledema. J Neuroophthalmol. 2021;41(1):77-92. PMID: 32909979 · DOI: 10.1097/WNO.0000000000001078
-
Bastani PB, Rieiro H, Badihian S, Otero-Millan J, Farrell N, Parker M, et al. Quantifying Induced Nystagmus Using a Smartphone Eye Tracking Application (EyePhone). J Am Heart Assoc. 2024;13(2):e030927. PMID: 38226513 · DOI: 10.1161/JAHA.123.030927
-
Zhu B, Yang M, Liu X, Yuan B, Yin Y, Cheng C, et al. Assessing pediatric visual acuity with a computerized optokinetic nystagmus analyzer. Clinics (Sao Paulo). 2025;80:100671. PMID: 40311375 · DOI: 10.1016/j.clinsp.2025.100671
-
Murata N, Toda H, Ubukata H, Takagi M, Tanaka C, Machinaga A, et al. Development of Automated Visual Acuity Measurement Using a Calibration-Free Eye-Tracking System. Cureus. 2024;16(7):e64401. PMID: 39130869 · DOI: 10.7759/cureus.64401
-
Nikolaidou A, Sandali A, Chatzidimitriou E, Pantelaki D, Gianni T, Lamprogiannis L. Virtual Reality With Eye Tracking for Pediatric Ophthalmology: A Systematic Review. J Pediatr Ophthalmol Strabismus. 2024;61(6):381-390. PMID: 39141772 · DOI: 10.3928/01913913-20240620-03
-
Lussier BL, Olson DM, Aiyagari V. Automated Pupillometry in Neurocritical Care: Research and Practice. Curr Neurol Neurosci Rep. 2019;19(10):71. PMID: 31440851 · DOI: 10.1007/s11910-019-0994-z
-
Oddo M, Taccone FS, Petrosino M, Badenes R, Blandino-Ortiz A, Bouzat P, et al. The Neurological Pupil index for outcome prognostication in people with acute brain injury (ORANGE): a prospective, observational, multicentre cohort study. Lancet Neurol. 2023;22(10):925-933. PMID: 37652068 · DOI: 10.1016/S1474-4422(23)00271-5
-
Engin CD, Selver MA, Köksaldı S, Kayabaşı M. GENERALIZABILITY OF DEEP LEARNING MODELS FOR REFERABLE DIABETIC RETINOPATHY DETECTION: A CROSS-POPULATION STUDY. Retina. 2026. PMID: 42479603 · DOI: 10.1097/IAE.0000000000004924
-
Liu X, Cruz Rivera S, Moher D, Calvert MJ, Denniston AK. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: the CONSORT-AI extension. Lancet Digit Health. 2020;2(10):e537-e548. PMID: 33328048 · DOI: 10.1016/S2589-7500(20)30218-1
-
Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, et al. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024;385:e078378. PMID: 38626948 · DOI: 10.1136/bmj-2023-078378
-
Elendu C, Amaechi DC, Elendu TC, Jingwa KA, Okoye OK, John Okah M, et al. Ethical implications of AI and robotics in healthcare: A review. Medicine (Baltimore). 2023;102(50):e36671. PMID: 38115340 · DOI: 10.1097/MD.0000000000036671
-
Muehlematter UJ, Daniore P, Vokinger KN. Approval of artificial intelligence and machine learning-based medical devices in the USA and Europe (2015-20): a comparative analysis. Lancet Digit Health. 2021;3(3):e195-e203. PMID: 33478929 · DOI: 10.1016/S2589-7500(20)30292-2
-
Abbas Farishta R, Farivar R. Montreal Brain Injury Vision Screening Test for General Practitioners. Front Hum Neurosci. 2022;16:858378. PMID: 35911590 · DOI: 10.3389/fnhum.2022.858378
-
Betzler BK, Chen H, Cheng CY, Lee CS, Ning G, Song SJ, et al. Large language models and their impact in ophthalmology. Lancet Digit Health. 2023;5(12):e917-e924. PMID: 38000875 · DOI: 10.1016/S2589-7500(23)00201-7
-
Bedi S, Liu Y, Orr-Ewing L, Dash D, Koyejo S, Callahan A, et al. Testing and Evaluation of Health Care Applications of Large Language Models: A Systematic Review. JAMA. 2025;333(4):319-328. PMID: 39405325 · DOI: 10.1001/jama.2024.21700
-
Luo MJ, Pang J, Bi S, Lai Y, Zhao J, Shang Y, et al. Development and Evaluation of a Retrieval-Augmented Large Language Model Framework for Ophthalmology. JAMA Ophthalmol. 2024;142(9):798-805. PMID: 39023885 · DOI: 10.1001/jamaophthalmol.2024.2513
-
Baxter SL, Bass JS, Sitapati AM. Barriers to Implementing an Artificial Intelligence Model for Unplanned Readmissions. ACI open. 2020;4(2):e108-e113. PMID: 33274314 · DOI: 10.1055/s-0040-1716748
-
Esmaeilzadeh P. Challenges and strategies for wide-scale artificial intelligence (AI) deployment in healthcare practices: A perspective for healthcare organizations. Artif Intell Med. 2024;151:102861. PMID: 38555850 · DOI: 10.1016/j.artmed.2024.102861
-
Laginaf M, Costello H, Price G. How do ophthalmologists manage functional visual symptoms? A UK survey of ophthalmologists’ experience. Graefes Arch Clin Exp Ophthalmol. 2022;260(4):1307-1313. PMID: 34633521 · DOI: 10.1007/s00417-021-05433-4