Due domande, una risposta
"L'AI funziona?" sono due domande, non una. È rimasto? E quanto è costato? La maggior parte dei team non sa rispondere a nessuna delle due. Quelli che ci riescono stanno prendendo il largo.
Il tuo CFO è entrato nel tuo one-on-one la settimana scorsa con un numero su un post-it. Era più alto di quanto si aspettasse. Vuole sapere cosa hai ottenuto in cambio.
Sei mesi fa, gli strumenti di coding AI erano una curiosità lato sviluppatori — qualche licenza qua, un trial affiancato là. Ora sono una voce di bilancio. Cursor, Copilot, Claude, Codeium, il budget per le API dei modelli che è silenziosamente triplicato — la maggior parte delle organizzazioni engineering sta spendendo soldi veri per l'AI, e la maggior parte non sa dirti se la spesa ha prodotto qualcosa che è rimasto.
Questa è la seconda metà di Ship and Stick. La prima metà rispondeva: il lavoro in cui l'AI ha aiutato è effettivamente stato rilasciato ed è sopravvissuto? La seconda metà è la domanda che ogni partner finanziario sta ora ponendo, e la maggior parte dei leader engineering può rispondere solo con una fattura e una sensazione:
"Quanto ci è costato, e ne è valsa la pena?"
Un promemoria: Ship and Stick
Abbiamo sostenuto all'inizio di quest'anno che le metriche di attività — tassi di adozione, prompt scritti, righe accettate — sono vanità. L'unica misura onesta per capire se l'AI funziona è se i risultati sono stati rilasciati e sono rimasti. La PR è stata mergiata? È rimasta mergiata? La qualità ha tenuto? La prevedibilità è migliorata, o il team ha iniziato a oscillare?
Questo è ancora il framework giusto. Ma risponde a metà domanda.
I risultati da soli ti dicono se qualcosa è migliorato. Non ti dicono se il miglioramento valeva quello che hai pagato. Un aumento del 4% nella salute della consegna che costa 80k a trimestre in licenze è una scommessa diversa da un aumento del 4% che costa 8k. Senza il denominatore, non puoi capire su quale delle due ti trovi.
Come si misura il ROI dell'AI?
Il ROI dell'AI è il valore di ciò che è rimasto diviso per quello che hai pagato. Ecco il calcolo che viene chiesto di fare a ogni leader engineering:
ROI AI = (valore di ciò che è rimasto) / (quello che hai pagato)
La maggior parte dei team manca completamente il denominatore. Hanno una fattura del fornitore nella casella di posta di finance e la sensazione che "le persone sembrano più produttive". Questo non è ROI. Questa è speranza più un estratto conto della carta di credito.
Il denominatore si è spostato. La spesa AI era una nota a piè di pagina — venti dollari a licenza per un plugin dell'editor. Nel 2026 è una colonna:
- Licenze per utente su più strumenti di coding
- Costi di utilizzo API che scalano con quanto il tuo team li usa effettivamente — più funziona, più paghi
- Servizi di routing dei modelli, database vettoriali, strumenti di valutazione
- Le funzionalità AI interne che il tuo stesso prodotto sta rilasciando, che girano sugli stessi provider di modelli
Da questo seguono tre cose.
Uno: la spesa AI è diventata abbastanza rilevante che finance è ora uno stakeholder nelle decisioni engineering, che ti piaccia o no.
Due: la spesa AI non è più a costo fisso. Scala con l'utilizzo — il che significa che un'adozione di successo aumenta il conto. Vincere la battaglia dell'adozione senza la strumentazione dei risultati è come finisci a spiegare una fattura 3x anno su anno a un CFO che non riesce a vedere l'impatto.
Tre: i due numeri si muovono su orologi diversi. La spesa è mensile e visibile. I risultati sono sprint dopo sprint e invisibili senza un livello di misurazione. Se vedi solo uno dei due, prenderai decisioni su quello che vedi — e quello che vedi è il conto.
La trappola dell'asimmetria
La spesa è rumorosa. I risultati sono silenziosi. Senza strumentazione, taglierai strumenti che funzionavano e manterrai strumenti che non funzionavano — perché il conto arriva puntuale e l'impatto non arriva mai.
Perché nessuno ti mostra entrambe le metà
Se abbinare risultati e spesa è così ovviamente utile, perché il tuo fornitore AI non l'ha costruito per te?
Perché i conti non tornano per loro.
| Tipo di fornitore | Cosa ti mostrano | Cosa non mostrano |
|---|---|---|
| Strumenti di coding AI | Adozione, suggerimenti accettati, "tempo risparmiato" (stimato da loro) | Il trend nella tua salute della consegna. Se il tuo tasso di bug si è mosso. Il conto nel contesto. |
| Dashboard di produttività | Cycle time, throughput delle PR, classifiche individuali | Quanto hai pagato. Se l'attività ha prodotto risultati duraturi. |
| Strumenti FinOps / spesa | La fattura, suddivisa per servizio | Cosa ha rilasciato tutto questo. Se qualcosa è rimasto. |
| Survey engineering | Soddisfazione auto-riportata con gli strumenti AI | Il gap di percezione — cosa le persone hanno sentito rispetto a cosa hanno fatto. |
Ognuno di questi strumenti sta rilasciando la metà che può vendere, e omettendo silenziosamente la metà che renderebbe il quadro onesto. Uno strumento di coding che ti mostrasse il costo per PR rimasta starebbe correggendo i propri compiti. Una dashboard di produttività che esponesse il conto ti darebbe un motivo per cancellarla.
Il ciclo chiuso — costo abbinato al risultato, entrambi in trend sprint dopo sprint — non è una funzionalità che nessun fornitore single-purpose può rilasciare senza minarsi.
Come appare il ciclo
La strumentazione non è complicata. È solo rara.
Hai bisogno di tre cose su uno schermo:
- Un trend di salute della consegna. Sprint dopo sprint, neutrale rispetto all'AI. Il lavoro è stato rilasciato? È rimasto? Qualità e prevedibilità tengono?
- Un trend di spesa AI. Stessa cadenza. Per team, non per sviluppatore. (Più su questo tra un momento.)
- Un'ipotesi causale. Cosa è cambiato nel tooling del team tra lo sprint N e lo sprint N+1, e il trend ha risposto?
Quando questi tre stanno insieme, smetti di discutere sull'AI e inizi a misurarla. La conversazione si sposta da "le persone stanno usando Cursor abbastanza?" a "il team l'ha implementato tre sprint fa, il trend di salute è salito di quattro punti, e la spesa AI per sviluppatore è aumentata del ventidue percento. Siamo in positivo netto. Rinnova." O — altrettanto prezioso — "il trend è piatto, la spesa è aumentata, il punteggio di maturità non si è mosso. Prova uno strumento diverso."
Questo è il ciclo chiuso: costo abbinato al risultato, sulla stessa cadenza. Non una dashboard con più numeri sopra. Un quadro decision-grade che ti permette di smettere di indovinare.
Per team, non per sviluppatore
Una nota che conta: questo funziona solo se la vista della spesa è per team, non per sviluppatore.
Nel momento in cui metti l'utilizzo AI individuale su una classifica, succedono tre cose, tutte negative:
- Gli sviluppatori aggirano la misurazione — eseguendo modelli localmente, condividendo account, optando fuori dagli strumenti per cui stai pagando.
- I dati vengono manipolati. Più prompt ≠ più valore, ma apparirà così.
- Sei silenziosamente diventato il prodotto di sorveglianza che hai detto che non avresti mai costruito.
La spesa a livello di team abbinata ai risultati a livello di team è l'unità giusta. Risponde alla domanda del budget senza creare quella della sorveglianza.
La domanda da portare al CFO
Non portare una fattura. Porta due linee di trend: salute della consegna del team e spesa AI del team, sullo stesso asse, negli ultimi sei sprint. La conversazione cambia immediatamente.
La Mossa Onesta
Se sei un leader dell'ingegneria, hai due modi per gestire la prossima conversazione sul budget AI.
Il primo è continuare a fare quello che fanno la maggior parte dei team: tirare fuori la fattura, raccontare l'atmosfera, sperare che la sala ci creda. Funziona per uno o due cicli. Smette di funzionare nel momento in cui un team pari si presenta con una linea di tendenza.
Il secondo è strumentare prima di sostenere. Rendi visibile la spesa e visibili i risultati — non dopo il rinnovo, ma prima. Troverai una di tre cose:
- La spesa sta producendo risultati duraturi. Difendila ad alta voce. Ora hai i dati per farlo.
- La spesa non sta producendo risultati. Tagliala prima che qualcun altro la tagli per te. Meglio offrire volontariamente il taglio che essere il caso di studio.
- La spesa sta producendo risultati per alcuni team e non per altri. Questa è la risposta più comune, e la più utile. L'adozione non è omogenea; nemmeno l'adattamento degli strumenti lo è. La spesa dovrebbe seguire l'adattamento.
In ogni caso, stai agendo sulla base di prove. Questo da solo ti separa dalla maggior parte della conversazione che sta avvenendo nel tuo settore in questo momento.
Il Punto Finale
Nel 2026, "l'AI funziona?" ha smesso di essere una domanda da thought leadership ed è diventata una domanda di budget. I team che vincono sono quelli che possono rispondere su richiesta, con due linee di tendenza, in meno di un minuto.
È stato rilasciato? È rimasto? E quanto è costato?
I primi due li abbiamo scritti a marzo. Il terzo è la metà su cui la finanza sta chiedendo ora. I team che hanno la risposta non sono quelli che usano più AI. Sono quelli che possono dimostrare cosa hanno ottenuto per questo.
Mostrami la spesa. Mostrami la tendenza. Ora possiamo parlare.
Misura l'efficacia degli sviluppatori, non solo la produttività
Sei dimensioni di efficacia. Trend nel tempo. Insight che aiutano il tuo team a vedere cosa funziona.
Ulteriori Letture
- Ship and Stick: Misurare se l'AI Funziona Davvero — la metà dei risultati della domanda, con i dati dietro al perché le metriche di attività sono vanità.
- I Sette Peccati Capitali delle Metriche di Ingegneria — anti-pattern da evitare quando strumenti il ciclo.
- Metriche DORA Senza la Tassa della Dashboard — perché i dati di cui hai bisogno sono già nelle integrazioni che hai già connesso.
Continua a leggere
- Ship and Stick: come misurare se l'IA funziona davveroOgni organizzazione sta adottando l'IA. Quasi nessuna può dimostrare che funzioni. Ecco come misurare ciò che conta davvero: risultati che vengono consegnati e restano, non velocità che rompe tutto. · 13 min di lettura
- Dodici Accordi di Lavoro per il Codice Scritto dalle MacchineLa retro post-sbornia da vibe-coding finisce con regole su una lavagna. Eccone dodici che puoi copiare — ognuna una regola di una sola frase, il numero che si muove se sta funzionando e il check-in che la mantiene onesta. · 14 min di lettura
- La Retro per i Postumi della Programmazione a SensazioneL'AI ha reso il tuo team più veloce nella prima settimana e più lento entro il terzo mese. Il churn del codice è aumentato dell'861%, gli incident del 242%, e la soluzione non è meno AI. È la cerimonia che già conduci — alimentata con dati reali invece che con sensazioni. · 10 min di lettura