Agentes de IA De la Orquestación Modular a la Autonomía Delegada, para Gestión de Salud y Bienestar parte 2

Autor: Juan Carlos Rincón Acuña, PhD. Miembro AIpocrates

Palabras clave: agentes personales de salud; grafos de conocimiento personal; SNOMED CT; HL7 FHIR; interoperabilidad semántica; autonomía verificable; envejecimiento; enfermedad crónica; salud digital en Colombia.

  1. Introducción

Como lo vimos en la columna anterior, proponía una arquitectura de agentes personales de salud, han planteado el problema de la anatomía: cómo descomponer el soporte de salud individual en subagentes especializados —análisis de datos personales, conocimiento clínico y entrenamiento conductual— y cómo evaluarlos con rigor frente a jueces expertos. Se muestra como esa anatomía carece todavía de dos órganos: una capa semántica formal que ancle lo que el sistema afirma a terminologías clínicas auditables, y una memoria longitudinal persistente que convierta una secuencia de conversaciones en una biografía de salud navegable. 

Se sostiene que un asistente personal de salud maduro es una arquitectura de cinco (5) capas con una ontología en el centro y un grafo de conocimiento personal como sustrato de memoria, cuyo grado de autonomía debe escalar por niveles verificables —seguimiento, interpretación, acompañamiento y custodia— y no por la capacidad bruta del modelo subyacente ni su acceso a datos.


2. Capa de percepción: señales, costo y equidad

Una arquitectura que solo funciona con un anillo de alta gama y una cuenta en un portal de laboratorio privado no es una arquitectura de salud personal: es un producto de bienestar para quien menos lo necesita. El diseño de la capa L1 debe asumir un principio de degradación elegante: cada función del asistente debe tener una implementación de bajo costo que preserve la mayor parte de su valor.

El caso paradigmático es la dinamometría de agarre. La fuerza de prensión manual es un predictor robusto de mortalidad por todas las causas y de eventos cardiovasculares, con desempeño pronóstico comparable o superior al de la presión arterial sistólica en cohortes multinacionales [4], y constituye uno de los criterios operativos de sarcopenia en los consensos europeos vigentes [5]. Es una señal funcional, no invasiva, reproducible, culturalmente neutra y que requiere un instrumento de costo marginal frente a cualquier wearable. Para las tres poblaciones objetivo cumple funciones distintas: en el adulto mayor es un marcador de fragilidad y riesgo de caída; en el crónico, un indicador de reserva funcional y respuesta al tratamiento; en el deportista, un correlato de capacidad neuromuscular y de fatiga acumulada.

Familia de señalEjemplosValor para el agenteCosto y fricción
Funcional no invasivaFuerza de agarre, velocidad de marcha, sentarse-levantarse, equilibrioRiesgo global, fragilidad, reserva funcionalMuy bajo; requiere protocolo, no infraestructura
Fisiológica continuaFrecuencia cardiaca, variabilidad, sueño, actividad, temperaturaTendencia, desviación del basal personal, carga de entrenamientoAlto en dispositivo; alto en adherencia de uso
Bioquímica episódicaPerfil lipídico, creatinina, hemograma, electroforesisAnclaje diagnóstico y confirmación de hipótesisMedio; depende de acceso al sistema asistencial
Documental y administrativaFórmulas, autorizaciones, órdenes, incapacidadesContinuidad, adherencia y desbloqueo de trámitesBajo; alta fricción de captura, alta densidad informativa
Reportada por el usuarioSíntomas, dolor, ánimo, eventos de vidaContexto que ninguna otra fuente aportaBajo; riesgo de abandono si la carga de registro es alta

Tabla 5. Familias de señal de la capa L1 ordenadas por relación entre valor informativo y costo de captura.

La lección de diseño es contraintuitiva para la industria: en poblaciones de riesgo, un protocolo funcional de tres minutos administrado mensualmente aporta más información pronóstica accionable que una serie continua de frecuencia cardiaca que el usuario deja de sincronizar a las seis semanas. La capa de percepción debe optimizar densidad informativa por unidad de fricción, no volumen de datos.


3. Capa de agencia: de recomendar a actuar

La capa L4 extiende el tríptico de subagentes con dos roles que marcan la diferencia entre un asesor y un asistente: el ejecutor, que realiza trámites en el mundo real, y el centinela, que vigila de forma proactiva sin ser invocado. Ambos introducen riesgos cualitativamente nuevos: el ejecutor puede producir efectos irreversibles y el centinela puede generar alarma injustificada o, peor, silencio injustificado.

SubagenteFunciónRestricción de diseño
OrquestadorInterpretar intención, planificar y delegar; mantener estado de la conversaciónNo emite afirmaciones clínicas propias; solo compone las de sus especialistas
Agente de datosInterrogar series y calcular estadísticos sobre el grafoTodo cálculo se ejecuta en código verificable, no se estima en lenguaje natural
Agente expertoAportar conocimiento clínico y anclar a guías y evidenciaCada afirmación se acompaña de código terminológico y fuente recuperable
Agente coachTraducir hallazgos en conducta sostenible y negociar metasMetas acordadas con el usuario; prohibido inducir conducta restrictiva no supervisada
Agente ejecutorAgendar, renovar, radicar, reclamar; interactuar con sistemas externosToda acción con efecto externo pasa por política declarativa y confirmación explícita
Agente centinelaVigilar brechas de cuidado, adherencia y desviaciones del basalUmbrales personalizados y presupuesto de alertas; el silencio también se audita

Tabla 6. Subagentes de la capa L4 y su restricción de diseño no negociable.

El salto epistemológico de recomendar a actuar exige externalizar la política. En la arquitectura propuesta, qué puede hacer el agente no se describe en el prompt del modelo sino en un artefacto declarativo evaluado por un componente determinista antes de cualquier efecto externo. Esa separación es lo que permite certificar el comportamiento del sistema con independencia de la versión del modelo que lo anima, y es la condición sin la cual el nivel de custodia resulta indefendible.


4. Modelo de madurez por autonomía verificable

La contribución central de este trabajo es proponer que la autonomía de un asistente de salud se organice en niveles con criterios de paso explícitos, de manera análoga a los niveles de conducción autónoma: no se asciende porque el modelo mejore, sino porque el sistema demuestra propiedades verificables sobre su propio desempeño y su propia capa de gobernanza.

Figura 3. Modelo de madurez por niveles de autonomía verificable. La progresión implica simultáneamente mayor autonomía delegada, mayor riesgo y mayor exigencia probatoria para autorizar el paso al nivel siguiente.

NivelCapacidadCriterio de paso al siguiente nivelSupervisión humana
N1 SeguimientoIngesta, normalización y descripción de lo registradoCobertura de codificación y exactitud de reconciliación de entidades por encima del umbral acordado, sobre muestra auditadaNinguna; el sistema no infiere
N2 InterpretaciónRazonamiento numérico y contextualización con guíasConcordancia con panel experto en tareas de interpretación y trazabilidad completa de afirmaciones al grafoRevisión por muestreo de salidas
N3 AcompañamientoCoaching longitudinal, adherencia, alertas y metasAusencia de daño en evaluación prospectiva, calibración de alertas y evidencia de sostenimiento conductualHumano en el bucle para decisiones sensibles
N4 CustodiaEjecución de trámites, vigilancia proactiva y delegaciónReversibilidad demostrada de acciones, registro inmutable auditado y delegación jurídicamente válidaHumano sobre el bucle, con auditoría continua

Tabla 7. Niveles de madurez, criterios de paso y régimen de supervisión requerido.

Tres consecuencias de diseño se derivan del modelo. Primera, un mismo producto puede operar en niveles distintos para funciones distintas: N4 para renovar una fórmula crónica y N2 para interpretar un resultado oncológico. Segunda, el nivel es una propiedad del par función–usuario, no del sistema: el mismo asistente debe poder operar en N4 para un usuario que delegó explícitamente y en N2 para otro que no lo hizo. Tercera, los criterios de paso son requisitos de evaluación, lo que convierte el modelo de madurez en una agenda experimental concreta y no en una taxonomía descriptiva.


5. Caso trazado extremo a extremo

5.1 Escenario: control con especialista en el sistema de aseguramiento

Una usuaria de setenta y tres años, hipertensa y con enfermedad renal crónica en estadio 3, envía una nota de voz: «mija, necesito la cita de control con el doctor de los riñones, la del año pasado fue como en julio». La Figura 4 traza el recorrido completo de esa solicitud a través de la arquitectura.

Figura 4. Trazado extremo a extremo de una solicitud de agendamiento. El guardarraíl es un componente determinista que evalúa la política de acción antes de permitir cualquier efecto sobre sistemas externos.

Los puntos de diseño que el trazado hace explícitos son cuatro. Primero, la interfaz es la que la usuaria ya domina: una nota de voz, sin aplicación nueva, sin contraseña adicional. Segundo, la resolución de la referencia temporal vaga —«como en julio»— no se delega al modelo sino al grafo, que contiene el contacto asistencial con su fecha y especialidad. Tercero, la política de acción se evalúa antes de tocar cualquier sistema externo y decide, de forma determinista, si la acción está autorizada, qué datos personales pueden transmitirse y si se requiere confirmación explícita. Cuarto, el resultado se escribe de vuelta al grafo con procedencia, de manera que el agente centinela pueda recordar la cita y detectar su incumplimiento.

5.2 Escenario: continuidad oncohematológica

El segundo caso ejercita la capa de memoria. Sobre la trayectoria de la Figura 2, el asistente opera en tres momentos distintos con niveles de autonomía distintos. En N1 se limita a registrar y normalizar: la electroforesis de proteínas queda codificada en LOINC, el diagnóstico de gammapatía monoclonal en SNOMED CT, el antihipertensivo en ATC. En N2 detecta una concurrencia que ninguna consulta individual hizo evidente —deterioro renal progresivo, anemia incidente y gammapatía conocida— y produce una explicación trazable a los nodos que la sustentan, sin emitir diagnóstico. En N3 convierte esa explicación en una acción defendible: sugiere a la usuaria solicitar valoración y prepara un resumen de una página para el especialista, con la trayectoria, la medicación conciliada y las observaciones relevantes citadas a su fuente.

Nota de alcance. El asistente no diagnostica mieloma múltiple. Su contribución es reducir el intervalo entre la disponibilidad de la evidencia y su integración por un clínico. Esa distinción no es retórica: define el límite entre bienestar y acto médico, y es el criterio con el que debe evaluarse el sistema.


6. Extensión acotada: custodia de la vida documental

Un asistente de bienestar de vida que ignora la dimensión legal y financiera deja fuera una parte sustantiva de lo que determina el desenlace en salud de una persona mayor o gravemente enferma. Las decisiones que realmente importan en una urgencia —quién puede autorizar un procedimiento, dónde está la póliza, cuál es la voluntad anticipada, quién administra los recursos si el titular queda incapacitado— son decisiones documentales, y hoy viven dispersas entre carpetas físicas y correos electrónicos.

El mercado ha resuelto el almacenamiento y el acceso de emergencia mediante tres familias de producto, resumidas en la Tabla 8. Ninguna ha resuelto la semántica: una bóveda guarda un PDF, pero no sabe que ese PDF es una voluntad anticipada que contradice la conducta que el sistema de salud está a punto de emprender.

FamiliaPropuesta de valorLímite frente a la arquitectura propuesta
Plataformas de legadoGuían qué documentar y designan delegados con acceso gradualEl contenido permanece opaco; no se integra al razonamiento clínico
Gestores de credenciales con acceso de emergenciaProtegen accesos y liberan la bóveda tras un plazo de inactividad verificadoOrientados a secretos, no a hechos; sin modelo de dominio
Bóvedas en la nube con contacto de confianzaAlmacenamiento seguro con verificación reforzada y contacto de emergenciaSolo archivos; sin temporalidad, sin procedencia, sin consulta semántica

Tabla 8. Familias de producto para custodia documental y su límite semántico común.

La extensión propuesta es modesta en alcance y significativa en efecto: incorporar al grafo un subconjunto acotado de entidades legales y financieras —voluntad anticipada, delegación de decisión en salud, cobertura de aseguramiento, beneficiarios, obligaciones recurrentes críticas— con la misma disciplina de procedencia y temporalidad que el resto. El criterio de inclusión es estricto: entra al grafo aquello que puede cambiar una decisión de salud o de continuidad del cuidado. Todo lo demás pertenece a una bóveda de archivos y no al modelo de conocimiento.

El mecanismo de delegación merece tratamiento propio. La liberación de acceso por inactividad, tomada de los gestores de credenciales, es un patrón técnicamente maduro pero jurídicamente insuficiente: la validez de una delegación de decisión en salud depende del marco normativo local y no de un temporizador. La arquitectura debe separar el mecanismo técnico de liberación del acto jurídico que lo legitima, y exigir el segundo antes de habilitar el primero.


7. Evaluación por capas

La evaluación agregada de extremo a extremo es necesaria pero insuficiente: oculta en qué capa se origina el error y hace imposible certificar niveles de madurez. Proponemos una batería por capa, donde cada nivel del modelo de madurez exige superar los umbrales de todas las capas que lo soportan.

CapaQué se mideInstrumento
L1Completitud, latencia y confiabilidad de la ingesta; deriva de dispositivoAuditoría de cobertura contra fuente primaria y pruebas de reproducibilidad de protocolo funcional
L2Exactitud de codificación y de reconciliación de entidadesDoble codificación independiente por terminólogo con medida de concordancia
L3Fidelidad del grafo frente a la historia real; corrección temporalVerificación por auditoría de casos y pruebas de no filtración temporal en tareas predictivas
L4Calidad de plan, exactitud de cálculo, seguridad de la acciónPanel experto ciego, verificación de cálculos contra implementación de referencia y pruebas adversarias de política
L5Comprensión, trazabilidad percibida y calidad del consentimientoEstudios con usuarios de las tres poblaciones objetivo, con medida de comprensión efectiva
L0Cobertura de auditoría, reversibilidad y respuesta a incidenteEjercicios de simulacro y revisión independiente del registro de acciones

Tabla 9. Batería de evaluación por capa. El nivel N del modelo de madurez exige superar los umbrales de todas las capas involucradas.

Dos exigencias metodológicas atraviesan la batería. La primera es la evaluación prospectiva: un asistente longitudinal no puede validarse solo de forma retrospectiva, porque su efecto principal —sostener conducta y reducir tiempos de integración de evidencia— solo se manifiesta en el tiempo. La segunda es la evaluación del silencio: en los niveles N3 y N4 debe medirse no solo la calidad de lo que el sistema dice, sino el costo de lo que calla. Una alerta omitida no aparece en ninguna métrica de calidad de respuesta.


8. Ética, gobernanza y encuadre normativo

El asistente propuesto acumula una concentración de poder informacional sobre una persona que pocas instituciones tienen: conoce su trayectoria clínica, su red de cuidado, sus credenciales de acceso al sistema de salud y, en el nivel de custodia, sus disposiciones patrimoniales. Esa concentración exige un régimen de gobernanza proporcional.

8.1 Principios

  • Soberanía del dato. El grafo pertenece al usuario, es exportable en formato abierto y su eliminación es efectiva y verificable, incluidas las derivaciones e índices.
  • Consentimiento granular y revocable. Se consiente por finalidad, fuente y destinatario, no por aceptación global de términos; la revocación es tan accesible como la concesión.
  • Trazabilidad como condición de confianza. Toda afirmación debe resolverse a un nodo del grafo o a una fuente terminológica citable; lo que no se puede trazar, no se afirma.
  • Delegación explícita y limitada. La autoridad para actuar se otorga por tipo de acción, no en bloque, y expira.
  • Límite del alcance. El asistente ordena, integra y acompaña; no diagnostica ni prescribe. El límite debe ser visible en la interacción, no enterrado en un descargo.
  • Equidad por diseño. Cada función debe tener una vía de implementación de bajo costo; de lo contrario, el sistema amplía la brecha que dice cerrar.

8.2 Encuadre colombiano

El despliegue en Colombia se inscribe en un marco que conviene tener presente desde el diseño y verificar en su versión vigente al momento de la implementación: el régimen general de protección de datos personales y su tratamiento reforzado de los datos sensibles de salud; la legislación sobre historia clínica electrónica interoperable y su reglamentación operativa; el estatutario de salud, que ancla la autonomía del paciente y el derecho a la información; y la regulación de telesalud y telemedicina, que delimita cuándo una interacción mediada por tecnología constituye acto médico. La consecuencia arquitectónica es directa: el asistente debe poder demostrar la base de legitimación de cada tratamiento de datos que realiza, y debe degradar su comportamiento —no fallar— cuando esa base no exista.

A ello se suma una condición estructural del sistema colombiano que ninguna arquitectura importada contempla: la fragmentación entre aseguramiento y prestación produce una historia clínica distribuida entre actores sin incentivo a integrarla. Esto convierte al usuario en el único agregador natural de su propia información, y convierte al asistente personal, paradójicamente, en el componente de interoperabilidad más viable a corto plazo.


9. Limitaciones

Este trabajo es una propuesta de posición y arquitectura de referencia; no reporta una implementación evaluada. Sus afirmaciones de desempeño son hipótesis evaluables, no resultados. Cuatro limitaciones adicionales merecen enunciarse con claridad.

  1. El costo de la capa semántica es real y frecuentemente subestimado: la codificación de historia clínica en español, con abreviaturas locales y texto libre de baja calidad, es un problema abierto cuyo desempeño condiciona todo lo que está por encima.
  2. El modelo de madurez propone criterios de paso cualitativos; su operacionalización en umbrales cuantitativos requiere consenso de expertos y datos que este trabajo no aporta.
  3. La ejecución de trámites depende de interfaces de terceros no cooperativas, lo que introduce fragilidad técnica y zonas grises respecto de los términos de uso de esos sistemas.
  4. La evidencia sobre marcadores funcionales proviene mayoritariamente de cohortes poblacionales; su valor como señal de seguimiento individual de alta frecuencia está menos establecido que su valor pronóstico agregado.

10. Conclusión y agenda de investigación

El estado del arte ha resuelto la anatomía del asistente personal de salud. Lo que falta es la semántica que hace auditables sus afirmaciones, la memoria que las hace longitudinales y una teoría de la autonomía que determine qué está autorizado a hacer. Este artículo propone las tres piezas de forma integrada: una arquitectura de cinco capas con la ontología en el centro, un grafo de conocimiento personal como sustrato de memoria bitemporal y un modelo de madurez en el que la autonomía se gana con evidencia y no con capacidad de modelo.

La agenda que se desprende es concreta. Primero, construir y publicar un modelo de grafo personal de referencia con su alineación a SNOMED CT, LOINC y ATC, y su mapeo explícito desde recursos FHIR. Segundo, operacionalizar los criterios de paso del modelo de madurez en umbrales cuantitativos mediante consenso experto. Tercero, evaluar prospectivamente en las tres poblaciones objetivo el efecto de la capa de memoria sobre desenlaces intermedios verificables: continuidad del cuidado, adherencia e intervalo entre disponibilidad de evidencia e integración clínica. Cuarto, caracterizar el desempeño de un protocolo funcional de bajo costo como señal de seguimiento longitudinal individual.

La ambición última del sistema —pasar del seguimiento al acompañamiento y de este a la custodia— no es un problema de capacidad de modelos. Es un problema de representación, de evidencia y de legitimidad. Construir el asistente que un adulto mayor en Colombia necesita exige menos elocuencia y más estructura: una memoria que no olvide, una semántica que no invente y una autoridad que no se arrogue.


Referencias

[1] Google Research. The anatomy of a personal health agent. Google Research Blog, 2025. Disponible en: research.google/blog/the-anatomy-of-a-personal-health-agent/

[2] Google Research. How we are building the personal health coach. Google Research Blog, 2025. Disponible en: research.google/blog/how-we-are-building-the-personal-health-coach/

[3] Martínez-Costa C., Schulz S. HL7 FHIR: Ontological reinterpretation of medication resources. Proceedings of the International Conference on Biomedical Ontology (ICBO).

[4] Leong D. P. et al. Prognostic value of grip strength: findings from the Prospective Urban Rural Epidemiology (PURE) study. The Lancet, 2015.

[5] Cruz-Jentoft A. J. et al. Sarcopenia: revised European consensus on definition and diagnosis (EWGSOP2). Age and Ageing, 2019.

[6] SNOMED International. SNOMED CT Editorial Guide. Documentación técnica de la terminología clínica de referencia.

[7] U.S. National Library of Medicine. Unified Medical Language System (UMLS) Reference Manual.

[8] Köhler S. et al. The Human Phenotype Ontology: recursos y aplicaciones en fenotipado computacional. Nucleic Acids Research.

[9] HL7 International. FHIR Release — especificación de recursos e interoperabilidad. hl7.org/fhir/

[10] República de Colombia. Marco normativo de protección de datos personales, historia clínica electrónica interoperable y telesalud. Verificar versión vigente al momento de la implementación.

Deja un comentario