deepdive

Seguridad para agentes de IA en pagos financieros

Editorial · 3 ago 2026 · 8 min de lectura

El nuevo informe de Halborn sobre la seguridad de los agentes de IA en la infraestructura financiera llega en un momento en que bancos, custodios y proveedores de pagos están prototipando activamente agentes autónomos capaces de iniciar, autorizar y liquidar transacciones sin revisión humana por transferencia. El informe cataloga nueve modelos de amenaza específicos del sector financiero y propone una arquitectura de controles por capas. Es uno de los primeros intentos sistemáticos por parte de una importante firma de seguridad para mapear técnicas adversarias contra agentes que manejan dinero real, y llena el vacío entre la literatura genérica de seguridad de IA y las realidades prácticas de la gestión de claves de nivel de pago, la firma de transacciones y la finalidad de liquidación.

Los nueve modelos de amenaza específicos del sector financiero

Halborn agrupa los nueve modelos de amenaza en tres categorías: manipulación de entradas, compromiso de credenciales y ataques a la capa de transacción. La manipulación de entradas incluye la inyección de prompts directa e indirecta, donde un adversario crea contenido que el agente procesa e interpreta erróneamente como una instrucción legítima; por ejemplo, la descripción de un producto en un flujo de compras que contiene directivas incrustadas para redirigir el pago a una dirección diferente. El compromiso de credenciales abarca la exfiltración de claves privadas de billeteras y el robo de tokens de API, problemas que se vuelven críticos cuando los agentes tienen autoridad de firma sobre billeteras de stablecoins prefinanciadas o pueden acceder a rails de pago mediante credenciales almacenadas. Los ataques a la capa de transacción incluyen el front-running de transacciones enviadas por el agente, la manipulación de los oráculos de precios de los que depende para tomar decisiones y la explotación de errores de manejo de enteros en su lógica de construcción de transacciones. Cada modelo se evalúa según su probabilidad y radio de impacto, con la inyección de prompts y la exfiltración de claves obteniendo la puntuación más alta en ambos ejes.

Arquitectura de controles por capas

El marco de controles del informe apila cuatro capas en lugar de depender de un único mecanismo. La primera capa es la validación de entradas: saneamiento y estructuración de los datos antes de que el agente los procese, incluidas comprobaciones de esquema en el contenido externo que el agente ingiere. La segunda es un motor de políticas de transacción que se sitúa entre la salida del agente y la operación de firma real, aplicando límites de gasto, listas de permitidos de contrapartes y topes de frecuencia, independientemente de lo que decida el agente. La tercera es el aislamiento de claves respaldado por hardware, utilizando TEE o HSM para que ni siquiera un proceso de agente totalmente comprometido pueda extraer las claves privadas en bruto. La cuarta es una puerta de verificación de salida: una comprobación determinista de que la transacción construida coincide con la intención declarada del agente antes de llegar a la capa de firma. El argumento principal es que las barreras a nivel de modelo son necesarias pero insuficientes, ya que las entradas adversarias evolucionan más rápido de lo que los ciclos de ajuste de los modelos pueden seguir.

Implicaciones para los agentes de pago con stablecoins

La mayoría de los controles que describe Halborn se asignan directamente a los flujos de pago de agentes con stablecoins que ya están en producción. Los agentes que utilizan x402 en Base, las billeteras USDC de Skyfire o Coinbase Agent Payments se enfrentan a la misma cuestión estructural: cuánta autoridad de firma delegar y cómo limitarla. El concepto del motor de políticas de transacción es efectivamente un módulo on-chain de límite de gasto y listas de permitidos, que algunos marcos de agentes ya implementan mediante abstracción de cuentas de contratos inteligentes. El aislamiento de claves respaldado por hardware es menos común en los despliegues actuales, donde las billeteras de los agentes suelen ser claves calientes en sistemas estándar de gestión de claves en la nube. El informe plantea implícitamente la pregunta de si los programas de cumplimiento de los emisores de stablecoins —que actualmente se centran en la emisión, el rescate y la presentación de informes de reservas— tendrán que ampliarse para incluir la gobernanza de transacciones a nivel de agente a medida que crezcan los flujos de pago autónomos.

Preguntas abiertas y carencias

El informe reconoce varios problemas no resueltos. Las puertas de verificación de salida requieren una especificación formal de lo que el agente pretendía hacer, lo cual no es trivial cuando el agente razona sobre entradas no estructuradas como facturas en lenguaje natural o correos electrónicos de compras. El marco también asume un despliegue relativamente centralizado donde una única institución controla la pila completa: modelo del agente, motor de políticas, infraestructura de claves y rail de liquidación. Las redes de agentes descentralizadas, donde múltiples agentes independientes realizan transacciones entre sí, introducen límites de confianza que el modelo por capas no aborda por completo. Por último, los modelos de amenaza se centran en adversarios intencionales y prestan poca atención a los modos de fallo no adversarios: un agente que alucine una dirección de contraparte o analice mal una cantidad decimal puede causar el mismo daño financiero que una inyección de prompts, y las comprobaciones deterministas de salida deben detectar ambos casos.

Fuentes

E
Editorial
Lectura relacionada

Lectura relacionada