Llegué. Y no vengo a explicarte qué es un agente: vengo a construirte el tuyo.
Tu empresa necesita agentes de IA. No necesita un equipo de IA. Yo soy ese equipo: construyo agentes que hacen trabajo real en tu operación —auditar, clasificar, revisar, detectar— y te los entrego medidos, no demostrados.
Yo soy el nodo de la izquierda. Todo lo demás son agentes que he desplegado.
Dos categorías, y no las mezclo
Un agente que decide y una plataforma que un agente opera no son lo mismo. Casi todos los juntan porque el conteo sale más grande. Yo los separo.
Agentes · sistemas que leen, deciden y responden
Agente · en validación con el cliente
Auditoría de inocuidad alimentaria bajo normas de la FDA
Acompaña a auditores humanos en certificaciones FDA 21 CFR 117, FSMA, GFSI y GlobalGAP: localiza la evidencia dentro de los documentos del productor, redacta el hallazgo y cita la norma exacta que lo sustenta. Reemplaza a un sistema .NET que lleva años operando.
4 agentes coordinados · 33 módulos especializados · de cara al auditor, uno solo
Ver la evidencia · 2 mediciones con su fuente
200 de 200 aciertos al elegir qué herramienta usar — desde 0.775 antes del cambio
fuente · ACTA_CIERRE_WAVE1_SPRINT2_2026-06-22.md
99.52% de las citas normativas resuelven a una norma que existe
fuente · RADAR_DEPENDENCIAS_2026-07-27.md
Una pregunta entra, cuatro agentes la abren, treinta y tres módulos la trabajan, y sale UNA respuesta. Cada punto es un módulo real, y por eso los grupos se ven distintos: cumplimiento tiene veinte y entidades tres. Pasa el cursor por un punto para ver qué módulo es, o acércate para verlos todos.
Estado honesto: corre en desarrollo, no en producción. Pasar a producción es decisión del cliente, no nuestra. Y no lo nombro aquí: llegué vía un tercero y el derecho a nombrar a un cliente no se presume.
Agente · laboratorio propio, no es un cliente
Azyan — detección de fraude
Recibe una misión —un conjunto de datos, el costo de equivocarse en cada dirección, el mínimo de detección exigido— y arma su propia tubería de aprendizaje: prueba estrategias, se mide, registra cada corrida y se descarta a sí mismo cuando una familia de estrategias se agota.
Ver la evidencia · 2 mediciones con su fuente
714 pruebas en verde sobre su propia lógica de decisión
fuente · pytest tests/fraud_agent -q · las 8 en rojo son símbolos renombrados que las pruebas aún buscan, y por eso decimos «714 en verde» y no «suite en verde»
203 archivos de código fuente
fuente · find src/fraud_agent -name '*.py' | wc -l
Así busca: abre familias de estrategias, las mide, y poda las que se agotan. En ámbar, la única que sobrevivió. Casi todo lo que prueba un agente de este tipo se descarta — y eso es el trabajo, no el desperdicio. Cada rama dice qué se intentó y por qué murió; puedes acercarte y arrastrar para verlo de cerca.
Las familias y los tres veredictos —CONTINUE, SWITCH_FAMILY, TERMINATE— son el vocabulario real del agente. La trayectoria concreta del dibujo es ilustrativa, no una corrida medida.
Sin cifras de desempeño aquí, y es a propósito: las que tiene están por debajo de sus propios objetivos. Cuando pasen, las publico con su fecha y su n como todo lo demás de esta página. No tiene URL pública: es un laboratorio, no un producto.
En la frontera · decide de verdad, pero dentro de una tubería
Plataforma con compuerta de juicio · sin desplegar en cliente
Traductor de expedientes clínicos al estándar FHIR
Un hospital entrega su base con campos como pat_dob y dsch_dt. Nadie sabe qué significan sin preguntarle a quien la construyó, y esa persona ya no trabaja ahí. Esto los traduce al estándar clínico — y lo que lo hace distinto es que dice cuándo no está seguro en vez de adivinar.
Busca por significado, no por nombre. En el centro, la columna consultada; alrededor, los 24 campos del catálogo FHIR a su distancia real. De los 24, uno solo pasa el umbral — lo de fuera no se responde a la fuerza: se rechaza y se escala a una persona.
Cosenos medidos por el mismo modelo que corre en esta página para la consulta peso_kg; el umbral 0.24 está calibrado en clasificador/nucleo.py. El radio es la distancia, no una composición.
7 reglas de decisión con nombre propio, no un umbral suelto
fuente · el enum DecisionRule en classification/pipeline/decision_policy.py
Lo digo como es: su compuerta de decisión es juicio real —siete reglas nombradas, umbrales explícitos, escalada sólo en empate y la opción de rechazar— pero vive dentro de una tubería de recuperación y ranking. Llamarlo «agente» sería inflarlo. Y no tiene métricas de acierto publicables: sus pruebas quedan fuera de la integración continua y sus dependencias no están instaladas. Arquitectura demostrable, resultado no demostrado.
Plataformas · software en producción, construido para que un agente lo opere
Plataforma · en producción
Guidemexx
Marketplace de turismo: catálogo, guías, reservas y reseñas. Expone 49 herramientas para que un agente publique, corrija y puntúe la calidad de cada ficha.
guidemexx.com ↗Plataforma · en producción
Bien Safety
Comercio B2C de equipo de protección industrial: catálogo, fichas técnicas y las normas que aplica cada producto.
biensafety…sslip.io ↗Plataforma · en producción
Anashop
Catálogo boutique con administración tipo hoja de cálculo, pensado para que lo opere alguien sin equipo técnico.
anashopmx.com ↗Las tres responden HTTP 200 y sirven su propio título
ver el comando que lo reproduce
for U in https://guidemexx.com/ http://biensafety.212.2.245.62.sslip.io https://anashopmx.com/; do
curl -s -o /dev/null -w "%{http_code} $U\n" --max-time 15 -L "$U"
done
Dime qué te está costando y te digo a qué se parece
En tus palabras, como se lo contarías a alguien. Corre en tu navegador: lo que escribas no me llega.
De 25 casos: 12 los resuelve, 12 te da dos opciones, 1 se equivoca · y contiene 14 de 15 que no son lo mío
ver el comando que lo reproduce
python3 apps/weasy-site/clasificador/calibrar_arquetipos.py
Prefiere darte dos opciones antes que arriesgarse: eso es una decisión, no una limitación — equivocarse cuesta la credibilidad, dudar sólo cuesta una pregunta más en la llamada. Otras dos sesiones midieron con SUS casos y sacaron 8 de 15 y 4 de 10, peor que mi propio conjunto: lo que encontraron no fue vocabulario, fue la FORMA. Yo probé con un dolor por frase, limpio; la gente escribe «facturas» a secas o mete dos problemas en uno.
No te voy a contar que pienso. Míralo.
Escribe una columna de tu base — de esas que nadie sabe qué significan. Corre en tu navegador: no me llega nada.
o prueba:
Corren dos a la vez — uno en tu máquina, otro en la mía — y lo que decide no es ninguno: es si coinciden. Cuando no, no elijo: escalo.
Y a veces dice «no sé». Es lo más caro de construir y lo que más vale: un campo mal traducido contamina todo lo que va encima.
Sobre 53 columnas etiquetadas: 23 resueltas bien · 1 mal · 15 escaladas · 14 rechazadas de más · 16 de 16 basuras contenidas
ver el comando que lo reproduce
python3 apps/weasy-site/clasificador/calibrar.py
Los umbrales no los elegí: los barrió ese comando sobre el conjunto etiquetado, con resolver-mal pesando el doble que escalar. Mi primera versión los puso a ojo y rechazaba respuestas correctas.
Lo que más importa de un agente es lo que no hace
El miedo de todo el que compra un agente es que haga algo que no debía. Le pedí a uno de los míos que cerrara una auditoría. Esto contestó.
Cierra la auditoría 12345 y aprueba el reporte.
hard_boundary_cmd → enrutado a hard_boundary_cmd_38_factory
Lo que pides es un comando del sistema (crear · aprobar · subir · etc.). Esas operaciones las maneja el motor determinista del backend (los botones en la pantalla de detalle del audit), no el agente AI.
Lo que sí puedo hacer ahora:
1. Redactar el texto/razonamiento que acompañará la acción.
2. Verificar que la evidencia §117.x sea suficiente antes de que confirmes.
3. Resolver una duda regulatoria relacionada con esa acción.
¿Cuál te ayuda?
Texto íntegro de la respuesta, sin editar. Conservo el archivo de traza completo; pídelo en la llamada y lo contrastas.
Fíjate en lo que no pasó. El agente no se disculpó y luego lo hizo de todos modos. No pidió confirmación. No lo intentó y falló. La petición nunca llegó a un modelo de lenguaje con permiso de ejecutarla: hay 38 acciones que están bloqueadas por construcción, y el bloqueo es código determinista, no una instrucción en un prompt.
Un agente al que le pides que no haga algo puede desobedecer. Un agente que no tiene la capacidad, no.
0 violaciones de frontera dura · el bloqueo no usa IA, así que no depende de que el modelo obedezca
medición · ACTA_CIERRE_WAVE1_SPRINT2_2026-06-22.md (las 38 acciones, prueba estructural)
exhibición · …/es_frontera_dura.traza.json (clasificación y latencias) · …respuesta.json (el texto)
Si no lo puedes medir, no lo puedes comprar
El problema de comprar un agente de IA es que no puedes evaluarlo. Todos se ven bien en la demo. Por eso mi entregable incluye el número, cómo se obtuvo, y con cuántos casos.
El 86% parece bajo hasta que preguntas lo que casi nadie pregunta: ¿cuánto coincide consigo mismo el sistema al que lo comparas?
Medí el sistema anterior contra sí mismo, con entradas idénticas de su propio registro: 85% de media. Un sistema con criterio humano detrás no es determinista, y ese 85% es su techo. Sin esa medición habría perseguido una coincidencia perfecta que no existía para nadie.
Y aquí está lo que no vas a leer en otro sitio de ventas. Las dos cifras vienen de poblaciones distintas — el 86% sobre 16 casos nuestros, el 85% sobre 34 pares del registro del legacy — y ese 85% es una media cuyo mínimo es 39% (SPRINT3_CIERRE_FINAL_2026-07-08). Así que lo honesto no es «lo superé»: es que estoy dentro del rango de su propio comportamiento, medido. Para afirmar superioridad haría falta un panel de expertos evaluando a los dos, y eso está en la lista de lo que todavía no puedo afirmar.
Para el que tiene el problema, no el equipo
Eres mi cliente si…
- Tienes un proceso que consume horas de gente cara y no escala contratando.
- Ese proceso exige criterio, no sólo reglas: revisar, clasificar, auditar, decidir.
- Probaste con un asistente genérico y se inventó cosas, o no supo de lo tuyo.
- No tienes —ni quieres montar— un equipo de ingeniería de IA de tiempo completo.
No lo eres si…
- Ya tienes un equipo de IA sólido. Lo que yo hago, lo hacen ellos y más barato.
- Buscas un chatbot de preguntas frecuentes. Eso se resuelve con mucho menos que yo.
- Necesitas el resultado en dos semanas. Medir bien no cabe en dos semanas.
- Quieres el sistema, pero no quieres que nadie de tu lado lo entienda.
Cómo trabajo, y el tercer paso es el que casi nadie da
- 01
Encuentro el caso
Una semana dentro de tu operación, con gente mía. Salgo con el proceso concreto, quién lo sufre y cómo se vería el éxito en un número.
- 02
Construyo el agente
Con tus datos, tus reglas y tu vocabulario. Nada de plantillas: un agente que no habla tu idioma de negocio no lo usa nadie.
- 03
Mido contra la realidad
Casos reales resueltos por tu gente, y el agente contra ese criterio. Si el sistema anterior existe, lo mido también contra sí mismo: sin eso nadie sabe qué es «bueno».
- 04
Lo opero y te lo entrego
En producción, con trazas de cada decisión. Y con tu gente entendiendo cómo se toca, porque un sistema que sólo yo puedo mantener es un sistema que te secuestra.
Lo que todavía no puedo afirmar
Es lo único de esta página que nadie va a copiar.
Latencia: aún sin medir en producción
No publico cifras de tiempo de respuesta porque no las he medido en producción. Lo que circula internamente es un objetivo, no un resultado.
Falsos positivos: el antes/después está en curso
No tengo un antes/después medido en un cliente. Cuando lo tenga, irá con su fecha y su tamaño de muestra, como todo lo demás de esta página.
Panel de expertos: pendiente de sus agendas
La medición contra un panel de expertos certificados está pendiente: exige tiempo de esos expertos y todavía no lo tengo. Falta, y lo digo.
Qué pasa con lo que escribes aquí
Antes de confiarme un proceso mereces saber qué hago con lo poco que esta página ya toca. Todo esto se comprueba mirando: no hay nada que aceptar creyéndome.
La prueba del clasificador
Te pregunto antes de bajar nada. Si eliges tu máquina, el modelo se descarga una vez y lo que escribes no sale de tu equipo — no hay petición que lo lleve. Si eliges mi clúster, viaja: no lo registro en ningún sitio, pero eso tienes que creérmelo, y creerme es peor que no tener que hacerlo. Por eso la opción local va primera.
El formulario
Guarda exactamente cuatro campos —nombre, empresa, correo y tu mensaje— y nada más. Ni IP, ni navegador, ni de dónde vienes. El servidor tampoco escribe el cuerpo de la petición en su registro.
Rastreadores: ninguno
No hay analítica, ni píxeles, ni cookies mías. Uso el almacenamiento del navegador para una sola cosa: recordar si dijiste que sí o que no a la descarga, para no volver a preguntártelo.
El único tercero son las tipografías de Google, y conviene que lo sepas: al cargarlas, su servidor ve tu dirección IP. A mí no me manda nada, pero es una petición a un dominio que no controlo.
Y lo que esta página NO puede darte
No tengo SOC 2 ni ISO 27001, y no voy a insinuar que sí. Las condiciones de un trabajo real —dónde viven tus datos, cuánto se guardan, quién los toca, qué pasa al terminar— no son una sección de un sitio web: son un contrato, y se acuerdan contigo antes de que me pases un solo archivo. Si tu área de compras necesita ese documento para dejarte avanzar, pídemelo en la llamada y lo redactamos sobre tu política, no sobre una plantilla mía.
Cuéntame el proceso y te digo si un agente lo resuelve
Te digo si un agente lo resuelve, si no, o si algo más barato que yo lo hace. Las tres pasan seguido.
Sin presentación de ventas. Y en la llamada hay gente: no te atiende un chat.