AI SDR 6 de agosto de 2026

Piloto de AI SDR en 90 días: cómo saber si funcionó

ai sdrpiloto ai sdroutbound b2bmétricas outbound

Piloto de AI SDR en 90 días: por qué el reply rate de mil emails no decide nada, cuánto habría que enviar de verdad y qué sí puedes medir con poco volumen.

Piloto de AI SDR en 90 días: cómo saber si funcionó

Noventa días, un vendor, un dominio nuevo y una lista. Al final del trimestre alguien enseña un porcentaje en una diapositiva y la empresa decide si se queda con la máquina o la devuelve.

Ese porcentaje casi nunca significa lo que la gente cree que significa.

Entre el 40 % y el 60 % de los pilotos de AI SDR se pausan o se cancelan antes de los 90 días por resultados pobres, entregabilidad o dudas legales, según los benchmarks de OneAway para 2026. El dato circula bastante. Lo que no circula es que buena parte de los que continúan lo hacen apoyándose en un número que no aguanta un vistazo de cerca.

Este post va de la aritmética que se salta todo el mundo, no de si la IA vende o no vende. Para lo otro está la guía de AI SDR.

El plan que te van a proponer

Es el mismo en todas partes. Apollo lo publica ordenado en su guía del piloto de 90 días: treinta días de montaje y calentamiento de dominio, treinta de ajuste del mensaje, treinta de medición contra un grupo de control que sigue trabajando a mano. El día 90 hay una reunión de sí o no.

Unify propone una versión de 30 días con criterios ponderados, desde las reuniones agendadas hasta el tiempo humano que se come aquello, y recomienda arrancar con 500 a 1.000 prospectos de un solo segmento.

Me parece que el esqueleto está bien pensado. Fases claras, grupo de control y una fecha en la que alguien tiene que mojarse.

El problema aparece cuando lees la letra de los criterios. Apollo pide un “lift estadísticamente significativo en al menos dos métricas de efectividad”. Unify da los 500-1.000 prospectos por buenos para una comparación significativa. La palabra aparece en los dos sitios. El cálculo, en ninguno.

Con mil emails no distingues un 2 % de un 3 %

Vamos a hacerlo, que es una tarde de calculadora.

Pongamos que tu campaña tiene un 2 % de respuesta, que está en el rango de lo que se ve de verdad y lejos de los casos de éxito que te enseñan (tengo el asunto desmontado en reply rate real del cold email). Ese 2 % del panel no es tu reply rate: es una estimación con ruido, y el ruido depende de cuántos emails hayan salido.

Con 500 envíos y un 2 % de respuesta observado, el intervalo de confianza del 95 % va del 0,8 % al 3,2 %. Con 1.000 envíos se estrecha al 1,1 %-2,9 %. Con 3.000 se queda entre el 1,5 % y el 2,5 %. Traducido: después de mandar mil emails con la máquina, un 2 % y un 3 % son el mismo resultado, porque los dos caben dentro del margen de error del otro. Si el piloto termina con la IA en un 2,4 % y el grupo de control en un 1,9 %, ahí no hay ganador; hay dos medidas indistinguibles. Y esa es exactamente la comparación que las guías del sector dan por buena para decidir un contrato anual. El número existe, se puede poner en una diapositiva, y no aporta información para tomar la decisión que se está tomando con él.

Margen de error del reply rate al 95 % de confianza según el volumen enviado: ±1,2 puntos con 500 envíos, ±0,9 con 1.000, ±0,5 con 3.000 y ±0,3 con 7.500.

Margen de error de un reply rate observado del 2 %, calculado como intervalo de confianza del 95 % sobre una proporción. Cuanto menos envías, más ancho el margen.

Con las reuniones es peor, porque son pocas. Si de todo el piloto salen 6, el rango razonable de esa cifra va de 2 a 13: repetir la misma campaña y sacar 3, o sacar 11, entra dentro de lo normal.

La trampa del panel. El vendor te enseña un porcentaje con un decimal. El decimal transmite precisión y a estos volúmenes no hay ninguna. Pídele el número absoluto de respuestas: cuando ves que son 24, la conversación cambia.

Cuánto habría que enviar para que el número decidiera

Si de verdad quieres que el piloto zanje la discusión con un contraste entre dos grupos, esto es lo que cuesta en envíos, con los niveles de confianza y potencia que se usan de manual.

Lo que quieres demostrarEnvíos por grupoTotal del piloto
Que la IA pasa del 2 % al 4 %~1.150~2.300
Que la IA pasa del 2 % al 3 %~3.800~7.600
Que la IA pasa del 2 % al 2,5 %~13.800~27.600

La primera fila es asumible. La segunda es una campaña seria de un trimestre. La tercera, para una mejora que en la práctica ni notarías, se va a casi 28.000 envíos.

Ahora crúzalo con el mercado que tienes delante. El INE contaba 3.310.824 empresas activas en España a 1 de enero de 2025, con el 81,6 % en dos asalariados o menos. Entre las que sí tienen plantilla, las de 20 trabajadores o más son el 5 %, o sea unas 75.000 en todo el país. Acota eso a un sector y a una provincia y te quedan cuatro cifras, con suerte.

Si me preguntas, cuando el experimento pide 7.600 envíos y tu segmento entero son 3.000 empresas, el experimento no cabe y hay que dejar de fingir que cabe. No es que salga caro. Es que para ejecutarlo tendrías que escribir dos veces a todo el mercado al que piensas venderle durante los próximos tres años, y esa lista ya no te la devuelve nadie. Un piloto que consume el mercado que quiere medir se ha comido su propio resultado.

El plan que contratas no da ni para el experimento

Esta parte es la que me hace más gracia. Coge los precios públicos de AiSDR, que es de los pocos vendors que los enseña sin pasar por una demo, y mira cuántos contactos te tocan en un trimestre.

PlanPrecioContactos en 90 días¿Da para el contraste?
Solo250 $/mes600Ni de lejos
Explore900 $/mes2.400Justo para el salto del 2 % al 4 %
Scale2.500 $/mes7.500Se queda corto para el salto del 2 % al 3 %, y van 7.500 $

El plan de entrada te da 600 contactos en tres meses. El escenario más generoso de la tabla anterior pedía 2.300. Estás contratando un experimento que el propio producto no puede ejecutar, y al final del trimestre alguien va a decidir con esos 600.

Con el plan grande te acercas, después de dejarte 7.500 $ y sin contar dominios, buzones ni las horas de quien revisa aquello a diario. Esas horas son el coste que nunca aparece en la comparación y el que decide si la máquina sale a cuenta, como sale en AI SDR vs SDR humano.

Entonces qué se mide en noventa días

Se mide lo que se puede observar con poca muestra. Que es bastante más de lo que parece.

La entregabilidad se ve enseguida y no necesita estadística. Google exige a quien manda más de 5.000 correos diarios a cuentas de Gmail que mantenga las quejas de spam por debajo del 0,30 % en Postmaster Tools, y recomienda no pasar del 0,10 %. Ese umbral es binario y para leerlo no hace falta grupo de control. Si el piloto lo cruza en la segunda semana ya sabes en qué acaba, porque los pilotos que se caen se caen por ahí.

La calidad se lee, no se cuenta. Siéntate con cincuenta emails que ha mandado la máquina y con todas las respuestas que hayan entrado, y léelos como si te los mandaran a ti. En los hilos de r/AI_Agents sobre estas herramientas se repite la misma queja de la gente que las ha probado: personalización de risa, rebotes por las nubes, dinero gastado en molestar a desconocidos. Eso se detecta leyendo diez emails, no cruzando cohortes.

Y las horas se apuntan. Cuántas se van en revisar, corregir y contestar. Un piloto que promete autonomía y se come quince horas semanales de alguien ha contestado la pregunta aunque el reply rate salga plano.

Los tres cortes de un piloto de AI SDR: día 15 entregabilidad, día 45 calidad leída a mano, día 90 la cuenta económica.

Los tres momentos en que un piloto se para o sigue. Cada corte mide algo observable sin necesidad de muestra grande.

Los tres cortes se escriben antes de arrancar y se firman con el vendor. Escritos después dejan de ser criterios y pasan a ser una interpretación de los resultados, que siempre acaba favoreciendo a quien cobra la cuota. Un piloto al que hay que “darle un mes más para que aprenda” es un no que nadie quiere decir en voz alta.

Lo que te llevas si el piloto sale mal

Aquí está la asimetría que ninguna de las guías del sector menciona. Yo creo que este formato de piloto está montado al revés: se diseña para responder la pregunta del vendor, que es si su producto merece el contrato, y no la tuya, que es cuánto de tu mercado estás dispuesto a gastarte para averiguarlo.

El vendor arriesga tres meses de cuota. Tú arriesgas el dominio y la lista. Si el piloto quema un dominio con quejas de spam, ese dominio arrastra la reputación durante meses y tienes que montar infraestructura nueva desde cero. Si el piloto escribe mal a 2.000 empresas de un segmento de 3.000, esas empresas ya te conocen, y te conocen por un email que daba vergüenza. No hay forma de deshacerlo, ni segunda oportunidad de primera impresión con el mismo remitente. Por eso el piloto se hace siempre con dominios y buzones separados de los de la empresa, aunque el vendor diga que no hace falta, y por eso se prueba primero contra el trozo del mercado que menos te importa perder, no contra tus cuentas objetivo. Cuando sale mal, y sale mal la mitad de las veces, la factura la pagas tú entera.

Lo que yo haría. Dominio aparte, lista de la periferia del mercado, criterios de corte firmados antes del primer envío y el reply rate fuera de la decisión final. Con los volúmenes de un piloto normal ese número no sabe lo suficiente, así que no le dejo decidir.

FAQ

¿Funcionan realmente los SDR de IA?

Funcionan para la parte mecánica: buscar cuentas, enriquecer datos, preparar borradores, ordenar los seguimientos. Donde se caen es en la conversación y en la entregabilidad, y ahí es donde se pierde el dinero. La versión larga está en la guía de AI SDR.

¿Cuánto debe durar un piloto de AI SDR?

Noventa días es un plazo razonable para ver entregabilidad, calidad y coste. No lo es para probar una diferencia de reply rate contra un grupo de control, salvo que tu volumen dé para varios miles de envíos por grupo.

¿Cuántos emails hacen falta para que el resultado sea concluyente?

Para distinguir un 2 % de un 4 % de respuesta con la confianza habitual, unos 1.150 envíos por grupo. Para distinguir un 2 % de un 3 %, unos 3.800 por grupo. Si tu piloto manda menos, la comparación de porcentajes no te está diciendo nada.

¿Qué hago si el piloto ha funcionado?

Antes de escalar volumen, comprueba que la entregabilidad aguanta con más buzones y que tu mercado da para el ritmo nuevo. Escalar un piloto que iba bien es la forma más rápida que conozco de quemar en dos meses la lista que te quedaba.

Artículos relacionados

Artículos relacionados

Explorar el laboratorio →