IA en salud: reflexiones desde Stanford
Un hospital incorpora inteligencia artificial para organizar turnos, analizar estudios o asistir a sus profesionales. Los procesos se aceleran, pero surge una pregunta decisiva: ¿quién puede detener el sistema y quién responde si causa un daño?
Invitado como profesor visitante en la Escuela de Medicina de la Universidad de Stanford, planteé en mi disertación sobre IA en Salud que la supervisión humana sólo protege cuando quien supervisa puede actuar. Un médico ante una pantalla ofrece pocas garantías si carece de información, tiempo o autoridad para cuestionar el resultado. Debe poder comprender el problema, apartarse de la recomendación y activar una respuesta alternativa.
El informe de la OMS Artificial intelligence-related health research: ethics review and oversight, publicado el 21 de julio, advierte que los mecanismos habituales de evaluación pueden resultar insuficientes y propone distribuir responsabilidades entre investigadores, comités de ética, instituciones, financiadores y reguladores. El problema no es sólo si la IA acierta, sino si existe una estructura capaz de detectar errores, intervenir y responder por sus consecuencias.
Desde la Ética del Límite, marco conceptual que desarrollo, sostengo que la posibilidad técnica de hacer algo no basta para justificarlo. El poder sólo es legítimo cuando existen límites efectivos a su ejercicio. En IA clínica, no basta con declarar que “el médico tiene la última palabra”, debe demostrarse que dispone de información, tiempo, autoridad y alternativas para ejercerla.
Aquí aparece una distinción central: autoridad nominal no equivale a capacidad efectiva de intervención. Si aceptar una recomendación automática requiere un clic, pero cuestionarla obliga a reconstruir información, completar trámites o asumir costos administrativos, la autonomía profesional puede existir en el organigrama y desaparecer en la práctica. Luego, no puede atribuirse plena responsabilidad a quien carece de poder real para modificar una decisión.
Por eso propongo que la supervisión humana sea verificable. Antes de incorporar una herramienta capaz de influir en decisiones clínicas, la institución debería realizar simulaciones para comprobar si sus profesionales detectan errores, cuestionan recomendaciones y pueden continuar la atención de manera segura cuando el sistema falla. Las pruebas también deberían incluir recomendaciones correctas de la IA porque rechazar una buena asistencia puede causar daño. No se trata de demostrar que el humano siempre tiene razón, sino de verificar si el sistema completo permite decidir adecuadamente.
La evidencia reciente muestra por qué esto importa. Un ensayo aleatorizado publicado en Nature Medicine en 2025, con 92 médicos, encontró mejores resultados en tareas clínicas simuladas entre quienes utilizaron GPT-4 junto con recursos convencionales. Pero otro, publicado en junio de 2026 en la misma revista, con 9.691 pacientes en 16 centros de atención primaria de Kenia, mostró que la IA generativa mejoró la documentación clínica sin demostrar una mejora significativa en la evolución de los pacientes durante los 14 días posteriores a la consulta. Tampoco se identificaron eventos adversos graves atribuibles a la intervención.
Mejorar un proceso no equivale necesariamente a mejorar el resultado para el paciente. Por eso no alcanza con preguntar si una herramienta es precisa o eficiente; hay que establecer qué se mide: documentación, desempeño profesional, tiempos, acceso, decisiones clínicas o resultados sanitarios.
Tampoco debería evaluarse sólo el software. Debe evaluarse el sistema sociotécnico completo: herramienta, profesionales y condiciones institucionales de uso. Un fracaso puede deberse al modelo, pero también a una interfaz deficiente, falta de tiempo, información insuficiente, cargas administrativas o escasa autoridad para intervenir. No todo problema se resuelve con “más capacitación” para el médico.
El principio de no delegación de la responsabilidad exige conservar responsables humanos e institucionales identificables. Esto no significa cargar todas las consecuencias sobre quien utiliza la herramienta. Debe examinarse quién diseñó el sistema, qué limitaciones informó el proveedor, qué pruebas se realizaron, quién decidió adquirirlo y bajo qué condiciones se implementó.
También conviene distinguir tres facultades: apartarse de una recomendación para un paciente, suspender una función o el sistema completo y autorizar su retorno al uso. Cada nivel exige responsables identificables, procedimientos claros y una alternativa segura para continuar la atención.
La cuestión tampoco se agota en la precisión promedio. Zehui Xue, en un trabajo publicado en septiembre en el Journal of Medical Internet Research, propone un marco centrado en la equidad para integrar IA generativa en promoción de la salud, atendiendo a acceso, sesgos y privacidad. Una reflexión convergente apareció en el 4º Foro Mundial sobre la Ética de la IA de UNESCO, concluyendo que digitalizar puede ampliar derechos, pero también profundizar desigualdades si no se comprueba quién queda efectivamente incluido.
Un ejemplo sencillo lo muestra. Una institución incorpora un sistema para priorizar turnos. Los tiempos promedio mejoran, pero una persona mayor no logra cargar un documento, otra describe sus síntomas con términos que el sistema interpreta mal y una tercera necesita asistencia para completar el trámite. Si esas dificultades alteran la prioridad asignada, la modernización puede demorar a quienes más apoyo necesitan. Medir sólo el promedio oculta quién espera menos y quién termina esperando más.
Cuando una clasificación automática condiciona una prestación, la institución debe poder explicar qué información influyó y cómo solicitar una revisión. La frase “es lo que dice el sistema” no puede cerrar la conversación. Corregir el algoritmo tampoco repara por sí solo el perjuicio ya causado: detectar a las personas afectadas, revisar sus casos y ofrecer una respuesta son obligaciones distintas. El límite no sólo previene el abuso del poder tecnológico; también exige capacidad de corrección y reparación.
La gobernanza de los datos añade otra dimensión. Una comunicación reciente de la OMS sobre medicina tradicional e IA, en el marco de un encuentro en la Organización Mundial de la Propiedad Intelectual, subrayó cuestiones de consentimiento, reconocimiento de aportes y distribución de beneficios. Obtener información no elimina las obligaciones hacia quienes la aportaron o custodiaron.
Desde la Ética del Límite, estas dimensiones pueden ordenarse mediante cinco preguntas:
La última pregunta suele revelar si la supervisión es real. Antes de adoptar IA, la institución debería demostrar cómo revisará una decisión, quién podrá modificarla, quién podrá detener el sistema, cómo reparará un perjuicio y qué alternativa recibirá la persona afectada. Esa capacidad debería probarse mediante simulaciones y revisarse cuando cambien el software o las condiciones de uso.
Así, la Ética del Límite funciona como un criterio para legitimar y gobernar la IA en salud. Una institución no controla una IA porque declare mecanismos de supervisión, sino demostrando que esos mecanismos funcionan cuando son necesarios.
Argentina tiene la oportunidad, mediante equipos médicos, tecnológicos, jurídicos y bioéticos, de traducir estos criterios en contratos, protocolos y procedimientos de revisión. La pregunta decisiva ya no es cuánto puede hacer la IA, sino cuánto control real conserva la institución sobre aquello que decide delegarle.