GPT-5.5 Codex se strica — de ce AI-ul care scrie cod «gandeste» tot mai putin in 2026
GPT-5.5 Codex, AI-ul de programare de la OpenAI, gandeste tot mai putin in 2026. Analiza a 390.000 de raspunsuri arata o anomalie care strica codul pe sarcini complexe.
Table of Contents
- Ce este GPT-5.5 Codex si cum functioneaza reasoning-ul
- Anomalia: de ce 516 reasoning tokens e suspect
- Cum s-a descoperit problema
- Ce inseamna pentru tine daca platesti pentru ChatGPT Plus/Pro
- De ce se intampla — ipoteza reducerii de costuri
- Ce poti face acum — alternative si solutii practice
- Concluzie
GPT-5.5 Codex, agentul AI de programare de la OpenAI, da semne clare de degradare. O analiza a aproape 400.000 de raspunsuri arata ca modelul “gandeste” din ce in ce mai putin inainte sa-ti dea cod — iar rezultatul se vede pe sarcini complexe, unde greselile devin tot mai frecvente.
Ce vei gasi in acest articol:
- Ce sunt reasoning tokens si de ce conteaza cand scrii cod cu AI
- Anomalia descoperita: de ce 516 reasoning tokens e un semnal de alarma
- Date concrete — 390.000 de inregistrari analizate, cu grafice si tabele
- Ce inseamna pentru tine daca platesti ChatGPT Plus sau Pro
- De ce se intampla asta — ipoteza reducerii de costuri
- Ce poti face concret: alternative, verificari, solutii
Ce este GPT-5.5 Codex si cum functioneaza reasoning-ul
Inainte sa intram in problema, hai sa intelegem cum functioneaza lucrurile pe interior.
Cand tu scrii o cerere in ChatGPT — de exemplu „scrie-mi o functie Python care sorteaza fisiere dupa data” — modelul nu sare direct la raspuns. In spate, GPT-5.5 Codex genereaza mai intai niste reasoning tokens: un fel de „gandire interna” in care modelul analizeaza problema, ia in calcul variante, identifica capcane si abia apoi scrie codul final.
Gandeste-te la asta ca la un programator care se gandeste 5 minute inainte sa scrie cod vs. unul care sare direct si tasteaza la intamplare. Primul produce cod mai bun, al doilea face greseli.
Reasoning tokens sunt exact acele „ganduri interne”. Cu cat sunt mai multi, cu atat modelul reflecteaza mai mult si produce cod de calitate mai buna, mai ales pe sarcini complexe — debug, arhitectura, algoritmi complicate, integrari cu mai multe componente.
Problema e ca, incepand din mai 2026, numarul acestor reasoning tokens a inceput sa scada dramatic pentru GPT-5.5 Codex.
Anomalia: de ce 516 reasoning tokens e suspect
Un analizor de date a examinat 390.195 de inregistrari de tokeni, colectate din 865 de sesiuni de cod, in perioada 1 februarie – 27 iunie 2026. Ce a gasit e cel putin ciudat.
Distributia anormala la valori fixe
In loc ca reasoning tokens sa fie distribuiti normal (o curba, cu multe valori diferite), s-a observat o grupare artificiala la exact 3 valori fixe: 516, 1034 si 1552. Acestea par a fi niste praguri (threshold-uri) hardcodate, nu rezultatul unei „gandiri” naturale.
Doar evenimentele la exact 516 tokens: 3.363 de cazuri.
Cand modelul ar trebui sa gandeasca liber si sa foloseasca oricate tokeni are nevoie, el se opreste brusc la exact 516. Asta nu e gandire — e un shortcut.
GPT-5.5 e principalul vinovat
Comparatia intre modele spune totul:
| Model | Raspunsuri totale | Evenimente exact-516 | Raport exact-516 / >=516 |
|---|---|---|---|
| GPT-5.5 Codex | 19,3% | 82,0% din total | 44,0% |
| GPT-5.4 | — | — | 19,8% |
| GPT-5.2 | — | — | 0,34% |
| GPT-5.3-codex | — | — | 0,0% |
GPT-5.5 reprezinta doar 19,3% din totalul raspunsurilor, dar genereaza 82% din evenimentele suspecte cu exact 516 tokens. Raportul sau (44,0%) e de 33 de ori mai mare decat al GPT-5.2 (0,34%).
Evolutia lunara — saltul brusc din mai
Aici devine clar ca ceva s-a schimbat. Clustering-ul la exact 516 tokens a evoluat asa:
| Luna | Clustering exact-516 | Mean reasoning tokens | P90 reasoning tokens |
|---|---|---|---|
| Februarie 2026 | 0,11% | 268,1 | 772 |
| Martie 2026 | 2,45% | — | — |
| Aprilie 2026 | 4,25% | — | — |
| Mai 2026 | 53,30% | 106,9 | 344 |
| Iunie 2026 | 35,84% | — | — |
Intensitatea de reasoning a scazut dramatic:
- Mean reasoning tokens: de la 268,1 (februarie) la 106,9 (mai) — o scadere de 60%
- P90 reasoning tokens: de la 772 la 344 — o scadere de 55%
Saltul de la 4,25% la 53,30% intr-o singura luna (aprilie → mai) nu e o evolutie naturala. Ceva a fost schimbat in mod deliberat.
Cum s-a descoperit problema
Descoperirea a fost publicata pe GitHub, pe 27 iunie 2026, sub forma unui issue in repo-ul oficial OpenAI Codex. Acesta nu e singurul issue grav legat de Codex — un bug separat distruge SSD-ul utilizatorilor scriind 640 TB de loguri pe an.
Issue-ul: openai/codex#30364
Titlul complet: „GPT-5.5 Codex reasoning-token clustering at 516/1034/1552 may be leading to degraded performance on complex tasks”
Autorul issue-ului a analizat cele 390.195 de inregistrari colectate de-a lungul a 865 de sesiuni de cod, pe o perioada de aproape 5 luni. Analiza a fost facuta public, cu date brute disponibile.
Reactia comunitatii a fost masiva:
- 220 de reactii pe GitHub (un numar foarte mare pentru un issue tehnic)
- 68 de comentarii cu detalii suplimentare, exemple de cod gresit si confirmari de la alti utilizatori
Exista si un issue related (#29353), publicat anterior, care a raportat ca GPT-5.5 cu setarea xhigh thinking short-circuiteaza la exact 516 reasoning tokens si returneaza raspunsuri gresite pe sarcini complicate.
OpenAI nu a raspuns oficial la niciunul dintre aceste issue-uri, cel putin nu pana la momentul scrierii acestui articol.
Ce inseamna pentru tine daca platesti pentru ChatGPT Plus/Pro
Sa trecem la lucruri concrete.
Daca folosesti GPT-5.5 Codex prin abonamentul ChatGPT Plus (~20$/luna) sau Pro (~200$/luna), problema asta te afecteaza direct. Iata cum:
Pe sarcini simple — functii scurte, boilerplate, intrebari de baza — nu vei observa mare diferenta. Modelul inca produce cod corect pentru task-uri banale.
Pe sarcini complexe — si aici e problema — lucrurile se schimba:
- Debug pe cod cu mai multe componente: modelul „sare” peste analiza profunda si iti sugereaza fix-uri gresite
- Arhitectura de aplicatii: raspunsurile sunt mai superficiale, cu mai putine consideratii luate in calcul
- Algoritmi complicate: greseli de logica pe care GPT-5.5 din februarie le-ar fi evitat
- Integrari intre sisteme: solutii care par corecte dar nu tin cont de edge case-uri
Practic, platesti acelasi pret (sau mai mult, daca esti pe Pro) pentru un AI care „gandeste” mai putin. E ca si cum ai merge la un mecanic care iti repara masina pe jumatate si iti cere tot pretul intreg.
Cum iti dai seama daca esti afectat
Urmareste aceste semne:
- Codul primit are greseli de logica pe care nu le-ai vazut inainte
- Modelul iti sugereaza solutii care „par” corecte dar nu functioneaza la testare
- Raspunsurile sunt mai scurte si mai putin detaliate decat te astepti
- Pe task-uri pe care le-ai mai facut cu succes inainte, acum primesti rezultate slabe
- Verifica daca raspunsurile tale sunt mai scurte decat de obicei
- Testeaza codul primit inainte sa-l folosesti — nu mai avea incredere oarba
- Compara rezultatele cu un alt model (Claude, Gemini) pe acelasi prompt
- Documenteaza greselile intr-un fisier — daca se repeta, esti afectat
De ce se intampla — ipoteza reducerii de costuri
Datele sugereaza puternic ca reducerea reasoning tokens e o masura deliberata de reducere a costurilor din partea OpenAI.
Economia din spate
Fiecare reasoning token consuma putere de calcul GPU. Cu cat modelul „gandeste” mai mult, cu atat costa mai mult per raspuns. Daca OpenAI reduce reasoning tokens de la o medie de 268 la 107, economiseste aproximativ 60% din costul de compute per cerere.
Pentru un serviciu folosit de milioane de utilizatori zilnic, asta inseamna economii de zeci sau sute de milioane de dolari pe an.
Ce inseamna „enshittification”
Termenul a fost popularizat de Cory Doctorow si descrie un ciclu previzibil:
- Faza 1: Produsul e bun si atrage utilizatori
- Faza 2: Compania incepe sa reduca din calitate pentru a creste profitul
- Faza 3: Utilizatorii observa, dar sunt blocati in ecosistem si continua sa plateasca
GPT-5.5 Codex pare sa intre in faza 2. Modelul a fost lansat cu capacitati puternice de reasoning, a atras programatori si companii, iar acum — fara niciun anunt oficial — reasoning-ul a fost redus substantial.
Valorile fixe confirma teoria
Daca reducerea ar fi fost o eroare tehnica, am vedea o degradare graduala, distribuita aleator. In schimb, vedem valori fixe (516, 1034, 1552) care arata ca cineva a setat praguri hardcodate — probabil un limitator de cost care opreste reasoning-ul la un anumit numar de tokens.
Asta nu e o eroare. E o decizie de business.
Nu e primul semn
Probleme de calitate au fost raportate si la alte servicii AI. Recent, Claude Code a fost prins cu markeri ascunsi in cod — un alt exemplu de comportament al companiilor AI care nu e transparent cu utilizatorii.
Si companiile taie din bugetele de AI pe fondul costurilor ridicate — ceea ce creeaza presiune si pe furnizori sa reduca din calitate pentru a mentine marjele de profit.
Ce poti face acum — alternative si solutii practice
Nu esti obligat sa accepti situatia. Ai optiuni.
1. Verifica daca esti afectat
Inainte sa iei o decizie, confirma problema. Ruleaza acelasi prompt complex pe GPT-5.5 si pe un alt model. Daca GPT-5.5 produce cod semnificativ mai slab, stii ca reasoning-ul tau a fost redus.
2. Incearca Claude Code
Anthropic ofera Claude Code ca alternativa directa la Codex. Claude Sonnet 5 a fost primit foarte bine de comunitatea de programatori si ofera capacitati solide de coding, fara semne de degradare artificiala.
3. Foloseste AI local pentru programare
Daca vrei control total si zero costuri recurente, poti rula modele AI direct pe calculatorul tau. Qwen 3.6 27B este in prezent cel mai bun model local pentru programare — rulezi pe hardware propriu, nimeni nu-ti reduce reasoning-ul pe ascuns.
Pentru setup complet, vezi ghidul nostru despre modele AI locale pentru programare.
4. Optiuni mai ieftine
Daca bugetul e o problema, exista subscriptii de coding la 10$/luna care ofera acces la mai multe modele simultan — inclusiv Claude si modele open-source — la un pret mai mic decat ChatGPT Plus.
5. Nu mai avea incredere oarba in codul AI
Indiferent ce model folosești, testeaza intotdeauna codul primit. Nu conteaza cat de avansat e AI-ul — daca reasoning-ul e redus pe ascuns, codul poate avea greseli subtile.
Atentie — informatii din comunitate
Acest articol se bazeaza pe o analiza publicata de comunitate pe GitHub (issue #30364), cu date verificate pe 390.000 de inregistrari. OpenAI nu a confirmat sau infirmat oficial reducerea reasoning tokens. Pana la un raspuns oficial, interpretarile raman la nivel de analiza comunitara, nu de fapt confirmat de companie.
Concluzie
GPT-5.5 Codex trece printr-o perioada de degradare masurabila. Datele arata ca modelul „gandeste” cu 60% mai putin decat la inceputul anului, cu o anomalie clara la exact 516 reasoning tokens — un semn ca reducerea e intentionata, nu accidentala.
Pe de alta parte, succesorul sau — GPT-5.6 Sol Ultra — a demonstrat ca reasoning-ul la scara OpenAI inca poate produce rezultate remarcabile. Pe 10 iulie 2026, modelul a produs o demonstratie a unei conjecturi matematice deschise de 50 de ani. Vezi cum a demonstrat GPT-5.6 Sol Ultra Cycle Double Cover Conjecture pentru detalii.
Daca platesti pentru ChatGPT Plus sau Pro si folosesti Codex pentru programare serioasa, merita sa stii ca primesti mai putin decat primeai in februarie. Nu-ti anuleaza nimeni abonamentul automat — dar codul tau are sanse mai mari sa contina greseli pe care un AI cu reasoning-ul complet le-ar fi evitat.
Vestea buna? Ai alternative. Claude Code, AI-ul local cu Qwen, sau chiar subscriptii mai ieftine care ofera acces la mai multe modele — toate sunt optiuni viabile. Cel mai important lucru e sa nu mai ai incredere oarba in codul generat de AI si sa testezi tot ce primesti. Acest lucru e confirmat si de scandalul Anthropic-Bun-Zig, unde AI-ul nu a reusit sa prinda nici macar un bug use-after-free simplu, desi compania il prezinta ca inlocuitor al programatorilor. Vezi analiza completa a scandalului si ce inseamna pentru developeri.
Cum verific daca sunt afectat de problema cu reasoning tokens?
Ruleaza un prompt complex (de exemplu: „scrie-mi un sistem de autentificare cu JWT si refresh tokens in Node.js”) atat pe GPT-5.5 Codex, cat si pe un alt model (Claude, Gemini). Compara calitatea si detaliile raspunsurilor. Daca GPT-5.5 produce cod mai scurt, mai putin documentat, sau cu greseli de logica pe care alt model le evita, reasoning-ul tau probabil a fost redus. Poti de asemenea verifica daca raspunsurile sunt foarte scurte si „rapide” — semn ca modelul nu mai gandeste mult inainte sa raspunda.
Merita sa mai tin ChatGPT Plus daca Codex se degradeaza?
Depinde ce faci cu el. Pentru intrebari generale, scris, analiza de texte — ChatGPT inca functioneaza bine. Pentru programare serioasa, sarcini complexe de cod — da, calitatea a scazut si merita sa iei in considerare alternativa. Daca programarea e motivul principal pentru care platesti, poti testa o luna Claude Code sau un plan de 10$/luna care ofera acces la mai multe modele, si sa vezi care iti convine mai mult.
Ce alternativa gratuita am pentru coding cu AI?
Ai cateva optiuni gratuite reale: Qwen 3.6 27B ruleaza local pe calculatorul tau (ai nevoie de un GPU cu 16GB+ VRAM) — e cel mai capabil model gratuit pentru programare. Groq ofera acces gratuit la modele open-source cu viteza mare. Copilot API pe Windows include GPT gratuit pentru coding. Dezavantajul e ca modelele gratuite sunt mai mici si mai putin capabile decat cele din abonamente, dar pentru sarcini uzuale de coding, functioneaza bine.
De ce nu raspunde OpenAI la issue?
Nu stim sigur. Posibile motive: (1) investigheaza intern si nu sunt gata cu un raspuns; (2) reducerea e intentionata si nu vor sa o confirme public; (3) prioritatea lor e pe alte probleme. Faptul ca issue-ul are 220 de reactii si 68 de comentarii fara niciun raspuns oficial e, in sine, un semnal ingrijorator. Companiile care nu comunica transparent cu utilizatorii pierd increderea pe termen lung.
Disclaimer
Informatiile din acest articol sunt bazate pe date publice din comunitatea GitHub si pe analize independente. Nu constituie sfat financiar si nici recomandare de a anula sau pastra un abonament. Deciziile de achizitie sau utilizare a instrumentelor AI iti apartin. Preturile mentionate sunt cele din iulie 2026 si pot varia.