De les dues coses que l'informe DORA va dir sobre la IA el 2024, el 2025 en va observar el contrari en una i exactament el mateix en l'altra. La que no es va moure és la que costa diners: «AI adoption does continue to have a negative relationship with software delivery stability». Més IA continua venint amb menys estabilitat de lliurament. Dos informes seguits, mateix signe.
Convé dir d'entrada de què va això i de què no. No va de si la IA serveix: la fem servir cada dia i aquí no farem veure el contrari. Va d'on acaben les hores que promet. I la resposta que surt de les dades disponibles no és «enlloc», que seria el titular còmode de l'escèptic. És força més incòmoda: acaben aigües avall, a la part del procés que gairebé ningú pressuposta perquè no té logotip ni subscripció mensual.
Dos informes seguits, un signe que no canvia
L'edició del 2024, amb uns 3.000 enquestats i el 75,9 % d'ells recolzant-se ja en IA per a part de la seva feina, estimava que un augment del 25 % en l'adopció d'IA venia acompanyat d'una caiguda de l'1,5 % en el rendiment de lliurament i del 7,2 % en l'estabilitat de lliurament. Aquestes dues xifres es van publicar el mateix any en què gairebé tot el sector explicava el contrari.
Un any després, amb prop de 5.000 professionals enquestats i més de cent hores de material qualitatiu, el primer número es va girar: «Unlike last year, we observe a positive relationship between AI adoption on both software delivery throughput and product performance». Els equips lliuren més. El 90 % dels enquestats fa servir IA a la feina i més del 80 % diu que li ha pujat la productivitat. El 30 % declara poca o cap confiança en el codi que genera —«a slightly lower percentage than last year», matisa l'informe—, i l'estabilitat va continuar on era: en negatiu.
Abans de construir res a sobre, el matís honest: això és una enquesta, no un experiment. Són correlacions sobre respostes de persones que s'autoavaluen, amb tot el que això arrossega. La productivitat percebuda del 80 % és exactament el tipus de dada de la qual cal desconfiar, i per això val la pena mirar el treball recent que, en comptes de preguntar, va posar un rellotge.
L'experiment que sí que va posar un rellotge
El juliol del 2025, METR va publicar un assaig aleatoritzat amb 16 desenvolupadors experimentats i 246 tasques reals sobre repositoris de codi obert grans —de mitjana, més de 22.000 estrelles i més d'un milió de línies— on aquelles persones feia anys que contribuïen. No eren novells amb un projecte nou: era gent a casa seva. Amb IA permesa van trigar un 19 % més.
El que fa memorable aquell estudi no és el 19 %. És l'altra cosa: abans de començar, els participants van pronosticar que la IA els retallaria un 24 % el temps; després d'haver fet les tasques i d'haver anat més lents, continuaven estimant una millora del 20 %. Havien viscut l'experiment sencer i no ho van notar. Entre el que va marcar el rellotge i el que recordaven no hi ha un matís de grau: hi ha un canvi de signe. I la decisió de comprar eines, contractacions i llicències es pren sempre amb el segon.
I ara la part que gairebé ningú cita quan fa servir aquest estudi com a arma llancívola, començant pels qui l'usen contra la IA. Els mateixos autors diuen que no afirmen que el resultat valgui per a la majoria de desenvolupadors ni per a altres dominis, i descriuen el seu treball com «a snapshot of early-2025 AI capabilities in one relevant setting» — una foto fixa del que feien els models a principis del 2025 en un escenari concret. I el febrer del 2026 van anar molt més lluny: es van desmarcar del seu propi número.
El que van publicar el 24 de febrer del 2026 és això: entre el 30 % i el 50 % dels participants els van dir que deixaven d'enviar tasques perquè no les volien fer sense IA, amb la qual cosa les que sí que van entrar a l'experiment estaven esbiaixades en contra de l'eina; i sobre les estimacions del seu segon assaig escriuen que «our estimate reported above is a lower-bound on the true productivity effects of AI on these developers». Aquell segon assaig, engegat l'agost del 2025 amb 57 desenvolupadors, 143 repositoris i més de 800 tasques, dona −18 % per als participants originals (interval de confiança de −38 % a +9 %) i −4 % per als nous (de −15 % a +9 %): dos intervals que creuen el zero. METR qualifica les seves pròpies dades d'«an unreliable signal» i afegeix que, pel que els expliquen els participants, és probable que a principis del 2026 la IA els acceleri més del que van mesurar el 2025.
Així que no: el 19 % no demostra que la IA et freni, i qui l'estigui fent servir aquest any com a prova d'això està citant un número del qual els seus autors ja s'han distanciat. El que queda dret és més avorrit i més útil: no saps si et frena o t'accelera fins que ho mesures, la teva impressió no serveix com a mesura, i ni tan sols un equip que es dedica a mesurar això aconsegueix un interval que no creui el zero. Si ells no ho poden afirmar amb 800 tasques cronometrades, la sensació del teu equip a la reunió de dilluns tampoc.
On va anar el temps: a revisar
DORA ho resumeix en una frase que explica els dos resultats alhora: «time saved in creation is frequently re-allocated to auditing and verification». El temps que t'estalvies escrivint es reassigna a comprovar. I a les entrevistes qualitatives apareixen les frases que se senten a qualsevol equip un dimarts a la tarda: «I spend more time babysitting the AI and reviewing what it is trying to do», i aquesta altra, que és la que de debò importa per al que ve després: «Reviewing [another's] code is so much harder than writing it. AI tools are increasing the rate at which people can churn out code that needs to be reviewed».
Això últim és una opinió nostra i la marquem com a tal: revisar codi d'un company és car, però revisar codi d'un model és pitjor, perquè al company li pots preguntar per què ho va fer així i la resposta canvia el que busques. Al model li preguntes i et dona una explicació igual de fluida tant si va encertar com si no. Es revisa sense la pista que més estalvia temps.
La frase de l'informe que explica la factura
«AI accelerates software development, but that acceleration can expose weaknesses downstream. Without robust control systems, like strong automated testing, mature version control practices, and fast feedback loops, an increase in change volume leads to instability.» — DORA, 2025
Traduït i sense adorns: la IA accelera, i aquesta acceleració destapa les debilitats que ja tenies més avall. Sense sistemes de control sòlids —proves automàtiques serioses, pràctiques madures de control de versions, realimentació ràpida—, més volum de canvi es converteix en inestabilitat. Fixa't en el verb: expose. No diu que la IA creï l'esquerda. Diu que puja el cabal fins que l'esquerda es veu.
És exactament la mateixa idea amb què fa anys que expliquem la resiliència d'infraestructura, i per això aquest informe ens sona tan familiar: la fallada és inevitable, l'avaria és una decisió de disseny. Un canvi que trenca alguna cosa passarà, l'escrigui qui l'escrigui. Que aquell canvi tombi el servei, o que es quedi aturat en un entorn de proves un dimecres a les onze, no ho decideix l'eina amb què es va escriure. Ho decideix el que tens muntat a sota. El resum del mateix informe ho diu sense anestèsia: «AI doesn't fix a team; it amplifies what's already there».
El que l'informe del 2026 posa en diners
L'11 de maig del 2026 el mateix equip va publicar un informe de retorn de la inversió. Aquí cal ser molt precís amb què és cada cosa, perquè és un model, no un mesurament: per a una organització d'enginyeria de 500 persones, modela un retorn d'uns 11,6 milions de dòlars el primer any davant de 8,4 milions d'inversió —un 39 % de retorn i uns vuit mesos fins a recuperar-la—. Nosaltres no hem auditat aquest model i no el presentem com un fet: el citem pel que té a dins.
A dins hi ha dues coses que interessen més que el total. La primera és una partida negativa, i convé llegir-la amb cura perquè és un supòsit del model i no una troballa: a l'exemple de la calculadora se suposa que la taxa de fallada del canvi passa del 5 % al 6 % després d'adoptar IA, i aquell punt percentual es comptabilitza com a 344.000 dòlars de cost, amb el raonament que més codi movent-se més ràpid «can overwhelm existing deployment pipelines and manual review gates». Un punt. La segona és la conclusió, que es llegeix com un advertiment: «The greatest returns on AI investment come not from the tools themselves but from a strategic focus on the underlying organizational system: the quality of the internal platform, the clarity of workflows, and the alignment of teams».
Si la teva empresa té dotze persones a desenvolupament, aquells milions no et diuen res: no es divideixen per quaranta i surten els teus números. El que sí que es trasllada és l'ordre de les causes. Que el retorn més gran no sigui a l'eina sinó a la plataforma que tens a sota és una afirmació incòmoda per a qui acaba de signar llicències per a tot l'equip i no ha tocat el seu procés de desplegament des de fa tres anys. És la mateixa conclusió a què vam arribar al juliol per un altre camí, quan Gartner va calcular quants projectes d'agents es cancel·larien abans d'acabar el 2027 — allà la causa era el cost i la manca de línia base; aquí són dades i fonts diferents i el resultat apunta al mateix lloc.
Les quatre coses que han d'aguantar més cabal
No és una llista de bones intencions: cada punt porta la seva mesura, perquè si no es mesura tornes al problema del principi —creure't més ràpid sense ser-ho—.
- 1Un lloc on estavellar-lo que s'assembli a producció. No «un entorn»: un amb la mateixa versió de base de dades, el mateix balancejador al davant i dades amb la mateixa forma. Un preproducció que va sobrat quan producció va just no prova res. Mesura: quants canvis s'hi van aturar el mes passat. Si la resposta és zero, no tens un entorn bo, tens un entorn decoratiu.
- 2Lots petits. DORA és taxatiu: «Enforcing the discipline of working in small batches is a critical countermeasure to the risks of AI-assisted development». Fixa't en l'enforcing: no diu que sigui bona idea, diu que cal imposar-la. I aquí la IA empeny just al revés, perquè generar cinc-centes línies costa el mateix que generar-ne cinquanta. Mesura: la mida dels canvis que integres, no quants n'integres. Si la mitjana puja mes a mes, l'acceleració se te'n va en bultos més grans i més difícils de revisar.
- 3Marxa enrere cronometrada, no suposada. La pregunta no és si pots revertir, és quants minuts trigues des que algú diu «això està trencat» fins que està com abans — i aquell número ha de venir d'haver-ho fet, no d'estimar-ho. Aquí hi ha un parany clàssic que vam veure de prop: si el que desplegues es diu sempre igual, no tens una versió a la qual tornar, tens una etiqueta que es mou. Mesura: minuts de l'últim assaig real, amb la seva data.
- 4Telemetria per símptoma, no per component. Que l'alerta digui «les comandes triguen vuit segons» i no «la CPU del node 3 està al 80 %». Mesura: a l'últim incident, qui se'n va assabentar primer, el teu panell o un client per telèfon? És l'única mètrica de monitoratge que no es pot maquillar.
Cap de les quatre és nova ni porta IA a dins. Són les mateixes que demanàvem abans que existís el problema, i això és justament la qüestió: el que ha canviat no és la llista, és la pressa. El mateix passa amb el calendari de la plataforma — qui opera Kubernetes ja sap que la versió caduca sola, miris o no miris—; el volum de canvi no espera que acabis de muntar el que li falta a sota.
Quan això no va amb tu
Toca declarar el conflicte d'interès: nosaltres venem plataforma, CI/CD i guàrdia. Quan algú com nosaltres et diu «necessites més plataforma», mira qui cobra la factura. Així que la part honesta: si el teu equip són tres persones, desplegues un cop al mes i l'última restauració de còpia que vas provar va funcionar, no toquis res. Muntar canonades per a un cabal que no tens és una altra manera de gastar malament, i a sobre una que es paga en complexitat cada mes. La plataforma es dimensiona pel cabal de canvi real, no pel que t'agradaria tenir l'any vinent.
El que sí que convé mirar amb lupa és el que es va colar per la porta lateral. Els pilots d'IA que algú va muntar «per provar» i van acabar amb coses reals a sobre tenen la seva pròpia factura, i ja vam escriure sobre què passa quan ningú no els apaga: un pilot en producció sense amo, sense finestra d'actualització i sense inventari no és un experiment, és un servei que ningú no ha acceptat mantenir.
La pregunta que serveix en un comitè
La pregunta habitual és «quant ens estalvia la IA?», i ja hem vist que es contesta amb una percepció que en el primer experiment amb rellotge es va equivocar en el signe. La que serveix és una altra: quants canvis més al mes pot absorbir el que tenim muntat sense que pugi la taxa de fallada? Té l'avantatge que només es pot contestar amb números que ja existeixen o que no existeixen. I si la resposta és «no ho sabem, perquè no mesurem la taxa de fallada», aquí hi ha la primera feina del trimestre. No porta IA, no dona per a una nota de premsa i és la que decideix si la resta serveix d'alguna cosa.
Fonts (verificades el 27-09-2026): les cites «Unlike last year, we observe a positive relationship…», «AI adoption does continue to have a negative relationship with software delivery stability», «AI accelerates software development, but that acceleration can expose weaknesses downstream…» i «AI doesn't fix a team; it amplifies what's already there», juntament amb les dades de prop de 5.000 enquestats, el 90 % d'ús, el 80 % de productivitat percebuda i el 30 % de poca o cap confiança — anunci de l'informe DORA 2025 al blog de Google Cloud. Les frases sobre reassignació del temps a verificació, les dues cites d'enginyers i «Working in small batches is a critical countermeasure…» — DORA, «Balancing AI tensions». Les estimacions del 2024 (−1,5 % de rendiment i −7,2 % d'estabilitat per cada 25 % més d'adopció, amb 75,9 % d'ús sobre uns 3.000 enquestats) les prenem de l'anàlisi de l'informe del 2024 publicada per RedMonk, no del PDF original. L'assaig aleatoritzat, el 19 %, les 16 persones, les 246 tasques, el 24 % pronosticat, el 20 % estimat després i l'advertiment dels autors («a snapshot of early-2025 AI capabilities in one relevant setting») — METR, 10-07-2025, amb l'article a arXiv:2507.09089. El segon assaig (57 desenvolupadors, 143 repositoris i més de 800 tasques, engegat l'agost del 2025), els −18 % i −4 % amb els seus intervals de confiança, el biaix declarat del 30-50 % de participants que deixaven d'enviar tasques, «our estimate reported above is a lower-bound on the true productivity effects of AI on these developers», «an unreliable signal» i l'expectativa de més acceleració el 2026 — nota de METR del 24-02-2026. Les xifres de l'informe de retorn de l'11-05-2026 (11,6 M$, 8,4 M$, 39 %, vuit mesos, el salt del 5 % al 6 % i els 344.000 $) i la cita «The greatest returns on AI investment…» les prenem de la ressenya d'InfoQ, que parla de «the assumed change failure rate» — per això aquí es presenta com a supòsit de la calculadora i no com a mesurament; la pàgina de l'informe està publicada, però no hem obert el PDF i ho diem. El que és nostre i no de les fonts: la lectura que el coll d'ampolla es desplaça al lliurament, la comparació entre revisar codi d'un company i d'un model, les quatre comprovacions amb la seva mesura i la pregunta final. Els informes de DORA són enquestes amb autoavaluació, no experiments controlats, i així els citem. Foto de portada: «LOOM office seating», Wikimedia Commons (CC0).
Quants canvis més al mes aguanta el que tens muntat?
Operem plataformes de contenidors en producció —Docker Swarm i Kubernetes— amb CI/CD GitOps a GitLab, que és la manera que tenim que un desplegament sigui reproduïble i reversible, i assagem les recuperacions de forma cronometrada en comptes de suposar-les. Aquesta és la conversa que sabem tenir: què té sentit automatitzar amb IA i què convé arreglar abans a la plataforma de dades i aplicacions que hi ha a sota. Si surt que no necessites res, també t'ho direm.
Parlar amb everyWAN