Dos preguntas, una respuesta
"¿Está funcionando la IA?" son dos preguntas, no una. ¿Se mantuvo? Y ¿cuánto costó? La mayoría de los equipos no pueden responder ninguna de las dos. Los que sí pueden están tomando ventaja.
Tu CFO entró a tu reunión uno a uno la semana pasada con un número en una nota adhesiva. Era más grande de lo que esperaban. Quieren saber qué obtuviste a cambio.
Hace seis meses, las herramientas de codificación con IA eran una curiosidad del lado de los desarrolladores — algunos puestos aquí, una prueba lado a lado allá. Ahora son una partida presupuestaria. Cursor, Copilot, Claude, Codeium, el presupuesto de API de modelos que se triplicó silenciosamente — la mayoría de las organizaciones de ingeniería están gastando dinero real en IA, y la mayoría no puede decirte si ese gasto produjo algo que se mantuviera.
Esta es la segunda mitad de Ship and Stick. La primera mitad respondió: ¿el trabajo en el que ayudó la IA realmente se envió y sobrevivió? La segunda mitad es la pregunta que cada socio financiero está haciendo ahora, y la mayoría de los líderes de ingeniería solo pueden responder con una factura y una intuición:
"¿Cuánto nos costó, y valió la pena?"
Un recordatorio: Ship and Stick
Argumentamos a principios de este año que las métricas de actividad — tasas de adopción, prompts escritos, líneas aceptadas — son vanidad. La única medida honesta de si la IA está funcionando es si los resultados se enviaron y se mantuvieron. ¿Se fusionó el PR? ¿Se mantuvo fusionado? ¿Se mantuvo la calidad? ¿Mejoró la predictibilidad, o el equipo empezó a oscilar?
Ese sigue siendo el marco correcto. Pero responde la mitad de una pregunta.
Los resultados por sí solos te dicen si algo mejoró. No te dicen si la mejora valió lo que pagaste por ella. Un aumento del 4% en la salud de entrega que cuesta $80k por trimestre en licencias de herramientas es una apuesta diferente a un aumento del 4% que cuesta $8k. Sin el denominador, no puedes saber cuál tienes.
¿Cómo mides el ROI de la IA?
El ROI de la IA es el valor de lo que se mantuvo dividido por lo que pagaste. Aquí está la matemática que se le pide hacer a cada líder de ingeniería:
ROI de IA = (valor de lo que se mantuvo) / (lo que pagaste)
La mayoría de los equipos están perdiendo el denominador por completo. Tienen una factura de proveedor en la bandeja de entrada de finanzas y una sensación de que "la gente parece más productiva". Eso no es ROI. Eso es esperanza más un estado de cuenta de tarjeta de crédito.
El denominador se ha movido. El gasto en IA solía ser una nota al pie — veinte dólares por puesto para un plugin de editor. En 2026 es una columna:
- Licencias por puesto en múltiples herramientas de codificación
- Cargos por uso de API que escalan con cuánto tu equipo realmente las usa — mientras más funciona, más pagas
- Servicios de enrutamiento de modelos, bases de datos vectoriales, herramientas de evaluación
- Las características de IA internas que tu propio producto está enviando, que se ejecutan en los mismos proveedores de modelos
Tres cosas se derivan de eso.
Uno: El gasto en IA se ha vuelto lo suficientemente significativo como para que finanzas sea ahora un interesado en las decisiones de ingeniería, te guste o no.
Dos: El gasto en IA ya no es de costo fijo. Escala con el uso — lo que significa que una adopción exitosa aumenta la factura. Ganar la batalla de adopción sin la instrumentación de resultados es cómo terminas explicando una factura 3x año tras año a un CFO que no puede ver el impacto.
Tres: Los dos números se mueven en relojes diferentes. El gasto es mensual y visible. Los resultados son sprint tras sprint e invisibles sin una capa de medición. Si solo ves uno de ellos, tomarás decisiones basadas en el que ves — y el que ves es la factura.
La trampa de la asimetría
El gasto es ruidoso. Los resultados son silenciosos. Sin instrumentación, cortarás herramientas que estaban funcionando y mantendrás herramientas que no — porque la factura llega a tiempo y el impacto nunca lo hace.
Por qué nadie te muestra ambas mitades
Si emparejar resultados con gasto es tan obviamente útil, ¿por qué tu proveedor de IA no lo ha construido para ti?
Porque las matemáticas no funcionan para ellos.
| Tipo de proveedor | Lo que te muestran | Lo que no |
|---|---|---|
| Herramientas de codificación con IA | Adopción, sugerencias aceptadas, "tiempo ahorrado" (estimado por ellos) | La tendencia en tu salud de entrega. Si tu tasa de bugs se movió. La factura en contexto. |
| Dashboards de productividad | Tiempo de ciclo, rendimiento de PR, tablas de clasificación individuales | Lo que pagaste. Si la actividad produjo resultados duraderos. |
| Herramientas FinOps / gasto | La factura, desglosada por servicio | Lo que cualquiera de eso envió. Si algo se mantuvo. |
| Encuestas de ingeniería | Satisfacción autorreportada con herramientas de IA | La brecha de percepción — lo que la gente sintió versus lo que hizo. |
Cada una de esas herramientas está enviando la mitad que pueden vender, y omitiendo silenciosamente la mitad que haría la imagen honesta. Una herramienta de codificación que te mostrara el costo por PR que se mantuvo estaría calificando su propia tarea. Un dashboard de productividad que expusiera la factura te estaría dando una razón para cancelarlo.
El ciclo cerrado — costo emparejado con resultado, ambos con tendencia sprint tras sprint — no es una característica que ningún proveedor de propósito único pueda enviar sin socavarse a sí mismo.
Cómo se ve el ciclo
La instrumentación no es complicada. Solo es rara.
Necesitas tres cosas en una pantalla:
- Una tendencia de salud de entrega. Sprint tras sprint, neutral a la IA. ¿Se envió el trabajo? ¿Se mantuvo? ¿Se mantienen la calidad y la predictibilidad?
- Una tendencia de gasto en IA. Misma cadencia. Por equipo, no por desarrollador. (Más sobre eso en un momento.)
- Una hipótesis causal. ¿Qué cambió en las herramientas del equipo entre el sprint N y el sprint N+1, y respondió la tendencia?
Cuando esas tres están juntas, dejas de discutir sobre IA y empiezas a medirla. La conversación pasa de "¿la gente está usando Cursor lo suficiente?" a "el equipo lo implementó hace tres sprints, la tendencia de salud subió cuatro puntos, y el gasto en IA por desarrollador aumentó veintidós por ciento. Estamos arriba en neto. Renovar." O — igual de valioso — "la tendencia está plana, el gasto está arriba, la puntuación de madurez no se movió. Probar una herramienta diferente."
Ese es el ciclo cerrado: costo emparejado con resultado, en la misma cadencia. No un dashboard con más números en él. Una imagen de grado de decisión que te permite dejar de adivinar.
Por equipo, no por desarrollador
Una nota que importa: esto solo funciona si la vista de gasto es por equipo, no por desarrollador.
En el momento en que pones el uso individual de IA en una tabla de clasificación, suceden tres cosas, todas malas:
- Los desarrolladores evaden la medición — ejecutando modelos localmente, compartiendo cuentas, optando por no usar las herramientas por las que estás pagando.
- Los datos se manipulan. Más prompts ≠ más valor, pero aparecerá de esa manera.
- Silenciosamente te has convertido en el producto de vigilancia que dijiste que nunca construirías.
El gasto a nivel de equipo emparejado con resultados a nivel de equipo es la unidad correcta. Responde la pregunta del presupuesto sin crear la de vigilancia.
La pregunta para llevar al CFO
No lleves una factura. Lleva dos líneas de tendencia: salud de entrega del equipo y gasto en IA del equipo, en el mismo eje, durante los últimos seis sprints. La conversación cambia inmediatamente.
El Movimiento Honesto
Si eres líder de ingeniería, tienes dos formas de manejar la próxima conversación sobre presupuesto de IA.
La primera es seguir haciendo lo que la mayoría de los equipos están haciendo: sacar la factura, narrar la vibra, esperar que la sala lo compre. Esto funciona por uno o dos ciclos. Deja de funcionar en el momento en que un equipo par aparece con una línea de tendencia.
La segunda es instrumentar antes de abogar. Haz visible el gasto y visibles los resultados — no después de la renovación, sino antes. Encontrarás una de tres cosas:
- El gasto está produciendo resultados duraderos. Defiéndelo en voz alta. Ahora tienes los datos para hacerlo.
- El gasto no está produciendo resultados. Córtalo antes de que alguien más lo corte por ti. Mejor ofrecer el recorte voluntariamente que ser el caso de estudio.
- El gasto está produciendo resultados para algunos equipos y no para otros. Esa es la respuesta más común, y la más útil. La adopción no es homogénea; el ajuste de las herramientas tampoco. El gasto debe seguir el ajuste.
En cada caso, estás actuando con base en evidencia. Eso solo te separa de la mayor parte de la conversación que está ocurriendo en tu industria en este momento.
La Conclusión
En 2026, "¿está funcionando la IA?" dejó de ser una pregunta de liderazgo de pensamiento y comenzó a ser una pregunta de presupuesto. Los equipos que ganan son los que pueden responderla bajo demanda, con dos líneas de tendencia, en menos de un minuto.
¿Se envió? ¿Se quedó? ¿Y cuánto costó?
Las primeras dos las escribimos en marzo. La tercera es la mitad sobre la que finanzas está preguntando ahora. Los equipos que tienen la respuesta no son los que usan más IA. Son los que pueden probar qué obtuvieron por ella.
Muéstrame el gasto. Muéstrame la tendencia. Ahora podemos hablar.
Mide la efectividad del desarrollador, no solo la productividad
Seis dimensiones de efectividad. Tendencias a lo largo del tiempo. Perspectivas que ayudan a tu equipo a ver qué está funcionando.
Lectura Adicional
- Ship and Stick: Midiendo si la IA Realmente Está Funcionando — la mitad de resultados de la pregunta, con los datos detrás de por qué las métricas de actividad son vanidad.
- Los Siete Pecados Capitales de las Métricas de Ingeniería — antipatrones a evitar cuando instrumentas el ciclo.
- Métricas DORA Sin el Impuesto del Dashboard — por qué los datos que necesitas ya están en las integraciones que ya has conectado.
Continuar leyendo
- Ship and Stick: Cómo medir si la IA realmente funcionaTodas las organizaciones están adoptando IA. Casi ninguna puede demostrar que funciona. Aquí te mostramos cómo medir lo que realmente importa: resultados que se entregan y perduran, no velocidad que rompe todo. · 13 min de lectura
- Doce Acuerdos de Trabajo para Código Escrito por MáquinasLa retro de resaca del vibe-coding termina con reglas en un pizarrón. Aquí hay doce que puedes robar — cada una es una regla de una sola oración, el número que se mueve si se está cumpliendo, y el check-in que la mantiene honesta. · 15 min de lectura
- La Retro para la Resaca del Vibe-CodingLa IA hizo que tu equipo fuera más rápido en la primera semana y más lento al tercer mes. La rotación de código aumentó 861%, los incidentes aumentaron 242%, y la solución no es menos IA. Es la ceremonia que ya realizas — alimentada con datos reales en lugar de vibes. · 10 min de lectura