Outbound 13 de agosto de 2026

Agentes de IA para ventas B2B: qué hacen y qué no

agentes de iaventas b2bai sdrautomatizacion comercial

Agentes de IA para ventas B2B: qué automatizan de verdad, con qué frecuencia fallan según los benchmarks y qué te obliga el Reglamento de IA desde agosto.

Agentes de IA para ventas B2B: qué hacen y qué no

Llevo meses viendo la misma demo. Un panel limpio, un agente que “investiga la cuenta, escribe el email y agenda la reunión”, y un número de reuniones al mes que nadie sabe de dónde sale.

Cuando preguntas qué ocurre si el agente se equivoca, la respuesta casi siempre es que hay una persona revisando antes de que salga nada. Perfecto. Entonces lo que me estás enseñando no es un agente, es un redactor de borradores con una interfaz cara.

Aquí no vas a encontrar por qué la IA lo va a cambiar todo. Vas a encontrar qué es un agente cuando lo miras por dentro, cuántas veces falla según quien lo mide en serio, qué te obliga la ley española desde este mes y qué tarea le daría yo antes que ninguna otra.

Un agente decide el siguiente paso; un flujo lo lleva escrito

La diferencia técnica está bien explicada en la guía de ingeniería de Anthropic sobre construir agentes: los flujos de trabajo son sistemas donde el modelo y las herramientas van orquestados por un camino que alguien programó antes; los agentes son sistemas donde el modelo dirige su propio proceso y decide qué herramienta usa y cuándo.

Traducido a tu semana:

Quién decide el siguiente pasoEjemplo comercialQué pasa cuando se equivoca
Automatización (n8n, Zapier)El camino está escrito en el códigoEntra un formulario, se crea la ficha en el CRM y te llega un avisoSe para y lo ves en el panel
Asistente (ChatGPT, Copilot)Tú, en cada pasoLe pides un borrador de email para esta cuentaLo lees antes de mandarlo
AgenteEl modelo, sobre la marchaLe das mil empresas y decide a cuáles escribir, qué buscar de cada una y qué decirlesTe enteras días después, y en el buzón de otro

Casi todo lo que se vende como “agente de IA para ventas” vive en las dos primeras filas. Que esté bien: un flujo que enriquece una lista y prepara borradores resuelve trabajo real. Lo que molesta es pagar precio de fila tres por producto de fila uno.

La misma documentación avisa de la contrapartida cuando el agente sí es autónomo: más coste, y errores que se acumulan paso a paso. Ese “se acumulan” es la parte que ningún vendor te lee en voz alta.

Gartner cuenta unos 130 vendors de agentes de verdad

En junio de 2025, Gartner publicó una previsión incómoda para el sector: más del 40 % de los proyectos de IA agéntica se cancelarán antes de que acabe 2027, por costes que se disparan, valor de negocio poco claro o controles de riesgo insuficientes. La previsión salía de una encuesta a más de 3.400 organizaciones que ya estaban invirtiendo en la tecnología. En el mismo trabajo aparece el dato que a mí me parece más útil: de los miles de proveedores que dicen vender agentes, Gartner estima que unos 130 ofrecen capacidades agénticas reales. Al resto le puso nombre, agent washing, que es coger el chatbot o la automatización que ya tenías y repintarla de agente. Si estás comparando herramientas para tu equipo comercial, la probabilidad estadística de que la que tienes delante sea un flujo con un modelo dentro es abrumadora.

Yo no leo ese 40 % como una profecía sobre la tecnología. Un proyecto se cancela por lo que costó montarlo y por lo que nadie supo medir, y eso pasa igual con un CRM. El dato de los 130 sí me cambia la conversación: convierte la pregunta “¿qué agente compro?” en “¿esto es un agente?”, que es mucho más barata de responder y la puedes hacer en la propia demo.

Hablar es fácil; saber es difícil

Hay una forma decente de medir esto, y son los benchmarks de agentes que conversan con un usuario y a la vez tienen que respetar las reglas del negocio. El más usado es τ-bench, y su gracia está en que no mide si el modelo escribe bonito, mide si resuelve el caso entero sin saltarse una política.

Los resultados del ranking público dicen algo que encaja bastante con lo que se ve en el mundo real. En las tareas de texto conversacional, los mejores modelos van sobrados: GLM-5.2 acierta el 90,9 % de los casos al primer intento. En el benchmark de banca, que exige recuperar el dato correcto y aplicarlo bajo unas reglas, el mejor resultado publicado es un 46,4 % de GPT-5.5.

Comparativa del mejor resultado publicado en cada benchmark de la familia τ-bench: 90,9 % en tareas de texto, 67,3 % en voz y 46,4 % en el benchmark de banca.

Mejor resultado (pass¹) de cada benchmark de la familia τ-bench, ranking público de taubench.com consultado en julio de 2026. Cada benchmark mide tareas distintas: la comparación es entre tipos de tarea, no entre modelos.

Conversar es la parte fácil. Saber cuál de las cuarenta reglas de tu negocio aplica en este caso concreto es la difícil, y ahí el estado del arte anda por debajo de la mitad.

Hay una segunda medida que casi nadie enseña. El trabajo original de τ-bench introdujo una métrica para la fiabilidad: no si el agente acierta una vez, sino si acierta las ocho veces que le pones la misma tarea. Con los modelos de 2024, el mejor agente resolvía menos de la mitad de las tareas y bajaba del 25 % al exigirle ocho aciertos seguidos. Los modelos han mejorado mucho desde entonces, así que no te vendo ese número como el de hoy. Lo que no ha cambiado es la pregunta: cuando alguien te enseña un caso en el que el agente lo hizo bien, no te está diciendo cuántas veces lo intentó.

Cómo se pregunta esto en una demo. “Ejecuta la misma cuenta cinco veces delante de mí y enséñame las cinco salidas.” La demo preparada se cae ahí, y no hace falta que entiendas de benchmarks.

Lo que yo le daría a un agente y lo que no

Mi criterio cabe en dos condiciones, y las dos tienen que cumplirse: que el error sea reversible, y que el error se quede dentro de casa.

Investigar cuentas cumple las dos. Si el agente se equivoca en el sector de una empresa, lo ves al revisar y lo corriges, y nadie de fuera se ha enterado. Enviar el email no cumple ninguna: si sale mal, salió, y lo recibió tu mercado.

Tarea¿Reversible?¿Se queda dentro?Mi veredicto
Buscar empresas que encajan y descartar las que noAgente, con revisión de la lista
Enriquecer datos y detectar señales (cambios de web, contrataciones, notas de prensa)Agente, es donde más rinde
Redactar borradores personalizadosSí, hasta que le das a enviarAgente que redacta, persona que envía
Actualizar y limpiar el CRMSí, con históricoAgente, y agradecido
Preparar la reunión (qué hace la empresa, qué preguntar)Agente
Enviar el primer email en fríoNoNoPersona, o al menos una persona aprobando el lote
Contestar a quien respondeNoNoPersona, siempre
Cualificar por teléfonoNoNoPersona

Dos columnas: tareas que delego a un agente porque el error es reversible y se queda dentro de casa, frente a tareas que no delego porque el error sale al mercado.

El reparto que yo aplico. Criterio: si el fallo lo puedes corregir y no lo ve nadie de fuera, delega; si el fallo llega a tu mercado, no.

Este reparto no es una postura mía en contra de la corriente, es lo que cuenta la gente que lo usa. En el hilo Has AI reduced anyone’s salesforce yet? de r/sales, el resumen de quienes contestan es que las herramientas actuales apoyan al comercial (investigación, resúmenes de llamada, borradores de email, previsiones) en vez de sustituirlo. Y en r/coldemail se abre cada pocas semanas la misma pregunta, ¿alguna herramienta de IA te ha reducido de verdad la carga de trabajo?, con la queja de fondo de que cada semana sale un producto nuevo prometiendo automatizar el outbound entero.

Si el agente que te venden se cae exactamente en las tres últimas filas de mi tabla, tienes la comparación de coste hecha en AI SDR vs SDR humano y el detalle de qué automatiza cada categoría en la guía de AI SDR en España.

Desde el 2 de agosto tienes que decir que hay una IA detrás

Esto es nuevo y todavía no lo he visto en ninguna guía comercial en español. Desde el 2 de agosto de 2026 se aplican las obligaciones de transparencia del artículo 50 del Reglamento europeo de IA. El texto pide que los sistemas pensados para interactuar directamente con personas estén hechos de forma que esas personas sepan que están hablando con una IA, salvo que resulte obvio para alguien razonablemente informado y atento.

Un agente que mantiene una conversación por email con un desconocido y le responde entra de lleno en esa descripción. Las multas del reglamento por incumplir llegan a 15 millones de euros o el 3 % de la facturación mundial, cifras pensadas para grandes empresas, pero la obligación aplica igual si tienes doce personas.

Yo aquí soy escéptico con la excepción del “es obvio”. Si tu agente firma con nombre y apellidos de persona, que es justo lo que hacen casi todos los productos del mercado, has construido lo contrario de obvio. Y es una decisión de producto, no un accidente: alguien eligió que pareciese humano porque convierte mejor.

Lo que no dice este post. Aquí no hay asesoramiento legal, hay una lectura de la norma con enlace al texto. Si vas a montar un agente que conversa con clientes, esta conversación la tienes que tener con quien lleve tu cumplimiento normativo, y tenerla antes de encender nada.

Por dónde empezaría con diez personas y ningún equipo de datos

En España esto sigue siendo terreno virgen: según la encuesta de uso de TIC en empresas del INE, el 21,1 % de las empresas de diez o más empleados usaba inteligencia artificial en el primer trimestre de 2025. Cuatro de cada cinco todavía no. Eso significa que la ventaja no está en tener el agente más listo, está en llegar antes con uno que funcione.

El orden que yo seguiría empieza por lo aburrido. Primero, un agente que investiga cuentas y las descarta: es la tarea donde más horas se van y donde un error no cuesta nada. Segundo, uno que vigila señales y te avisa. Tercero, borradores. El envío, la respuesta y el teléfono los dejas quietos hasta que los tres anteriores lleven meses funcionando sin sorpresas.

Y mide desde el primer día, porque lo que se paga en autonomía se cobra en horas de revisión. Cómo montar esa medición sin engañarte con porcentajes de muestras pequeñas está en cómo evaluar un piloto de AI SDR. Si nadie de tu equipo va a llevar esto, el perfil que lo monta y lo mantiene es el de GTM engineer.

FAQ

¿Puede un agente de IA realizar ventas?

Puede ejecutar partes del proceso: buscar cuentas, enriquecer datos, preparar borradores, actualizar el CRM, resumir llamadas. Cerrar una venta B2B implica conversar con alguien que decide, y ahí los benchmarks públicos todavía andan por debajo del 50 % en tareas que exigen aplicar reglas de negocio.

¿Cómo se puede aplicar la inteligencia artificial en las ventas B2B?

Empieza por las tareas donde el error es reversible y no sale de tu empresa: investigación de cuentas, detección de señales y borradores. El envío en frío y la respuesta al prospecto son las dos últimas cosas que conviene automatizar, porque un fallo ahí lo recibe tu mercado y no se puede deshacer.

¿Cuál es la mejor IA para ventas?

Depende de qué trozo del proceso quieras cubrir, y desconfía de quien conteste esta pregunta con un solo nombre. Antes de comparar productos, comprueba si lo que te venden decide algo por su cuenta o ejecuta un camino programado: Gartner calcula que solo unos 130 proveedores de los miles que dicen vender agentes ofrecen capacidades agénticas reales.

¿Hay que avisar de que quien escribe es una IA?

Desde el 2 de agosto de 2026 el artículo 50 del Reglamento europeo de IA obliga a que las personas sepan que están interactuando con un sistema de IA, salvo que sea evidente por el contexto. Un agente que responde emails firmando como persona difícilmente cumple esa excepción.

Artículos relacionados

Explorar el laboratorio →