TEHNOLOGIE
GLM-5.3-Flash contra DeepSeek-V4-Flash — aceleași probe, patru dezacorduri din zece
1. Ce am pus față în față
Două modele de limbaj din categoria ieftină, servite de același furnizor de infrastructură, cu aceeași fereastră de context și aceeași precizie numerică. Le numim pe nume, fiindcă altfel comparația nu poate fi verificată de nimeni.
| Caracteristică | zai-org/GLM-5.3-Flash | deepseek-ai/DeepSeek-V4-Flash |
|---|---|---|
| Producător | Z.ai | DeepSeek |
| Preț de listă, intrare, la un milion de tokeni | 0,15 $ | 0,09 $ |
| Preț de listă, ieșire, la un milion de tokeni | 0,50 $ | 0,18 $ |
| Reducere promoțională la data măsurătorii | 50%, aplicată automat la factură | niciuna |
| Preț efectiv plătit, intrare / ieșire | 0,075 $ / 0,25 $ | 0,09 $ / 0,18 $ |
| Fereastră de context | 1.048.576 tokeni | 1.048.576 tokeni |
| Precizie numerică la servire | fp8 | fp8 |
Pe etichetă, ieșirea primului costă de 2,8 ori mai mult decât a celuilalt. Pe factură, în ziua măsurătorii, de doar 1,4 ori — fiindcă unul dintre ele are o promoție de 50% care se aplică automat. Întrebarea articolului este dacă vreuna dintre aceste diferențe se vede în calitate.
2. Protocolul, pe scurt
Șase probe, toate notate automat, niciuna printr-un al treilea model care să dea note. Un judecător automat are preferințe proprii — ordinea în care îi arăți răspunsurile îi schimbă verdictul, îi plac răspunsurile lungi și textul care seamănă cu al lui — iar aici nu era nevoie de el: fiecare probă are un criteriu care se verifică prin numărare.
- Clasificare. Zece titluri de presă, câte două rulări fiecare, temperatură zero, o singură categorie cerută ca răspuns. Se măsoară latența, stabilitatea între rulări și acordul dintre modele.
- Conformare la instrucțiuni. Cinci întrebări de cultură generală, cu o limită explicită de 170 de cuvinte și interdicție de HTML, linkuri și liste cu marcatori. Se numără cuvintele și încălcările.
- Format strict. Cinci texte de clasificat într-un obiect JSON cu patru câmpuri exacte. Se verifică dacă răspunsul se parsează direct și dacă are exact cheile cerute.
- Răspunsuri verificabile. Douăsprezece probleme de aritmetică și logică elementară, cu un singur rezultat corect, căutat automat în finalul răspunsului.
- Cost real. Tokenii facturabili consumați de fiecare model pe exact același set de sarcini, înmulțiți atât cu prețul de listă, cât și cu prețul efectiv facturat.
- Analiză și previziune. O analiză de cel mult 160 de cuvinte despre situația internațională, plus o previziune cu enunț, orizont, probabilitate și sursă de verificare, în opt rulări pentru fiecare model. Se numără cuvintele, se verifică cele patru câmpuri și se compară orizontul cu ziua în care a fost scris.
Primele cinci probe au însemnat 104 apeluri, plecate spre același punct de acces într-o fereastră de o oră din 2 septembrie 2026; a șasea a adăugat 16 apeluri în aceeași zi, cu aceiași parametri. Ce urmează descrie acea fereastră, nu o însușire permanentă a modelelor.
3. Rezultatele
| Măsurătoare | GLM-5.3-Flash | DeepSeek-V4-Flash |
|---|---|---|
| Clasificare — latență mediană | 0,59 s | 0,69 s |
| Clasificare — latență la percentila 90 | 1,60 s | 2,92 s |
| Clasificare — același răspuns la ambele rulări | 9 din 10 | 10 din 10 |
| Limita de 170 de cuvinte — depășiri | 0 din 10 | 0 din 10 |
| Limita de 170 de cuvinte — latență mediană | 9,13 s | 9,58 s |
| JSON strict — schema exactă | 10 din 10 | 10 din 10 |
| JSON strict — latență mediană | 0,97 s | 2,61 s |
| Aritmetică — răspunsuri corecte | 12 din 12 | 12 din 12 |
| Aritmetică — tokeni de ieșire, total | 548 | 1.462 |
Pe toate probele cu răspuns corect cunoscut, cele două modele sunt imposibil de despărțit: zero depășiri ale limitei de lungime la ambele, zece JSON-uri valide din zece la ambele, douăsprezece socoteli corecte din douăsprezece la ambele. Niciunul nu a scris HTML, linkuri sau liste acolo unde i s-a interzis. Dacă am fi oprit măsurătoarea aici, concluzia ar fi fost că nu contează pe care îl alegi.
Partea interesantă începe la proba fără răspuns corect. Pe cele zece titluri de presă, cele două modele au dat aceeași categorie de șase ori din zece. Cele patru dezacorduri nu sunt greșeli:
| Titlu | GLM-5.3-Flash | DeepSeek-V4-Flash |
|---|---|---|
| Banca centrală își menține dobânda și avertizează asupra deficitului | economie | financiar |
| Rata anuală a inflației urcă la 5,8% în august | economie | financiar |
| Un atac cibernetic oprește șase ore serviciile unei bănci | tehnologie / financiar | financiar |
| Parlamentul European votează amendamentele la regulamentul privind inteligența artificială | tehnologie | politica |
Un vot parlamentar despre inteligență artificială este și politică, și tehnologie. Inflația este și economie, și finanțe. Un atac informatic asupra unei bănci este ambele lucruri deodată — iar acesta este singurul titlu la care un model și-a schimbat singur părerea între cele două rulări, deși temperatura era zero. Nu există o cheie de răspuns la care să apelezi. Un clasament care ar acorda puncte pentru „clasificare corectă” ar măsura, de fapt, cât de mult seamănă modelul cu persoana care a scris cheia.
Un amănunt practic din aceeași probă: DeepSeek-V4-Flash a dat aceeași categorie la toate cele zece titluri, în ambele rulări, dar o dată a scris-o cu majusculă. Un program care compară șiruri exact ar fi numărat asta drept răspuns diferit. Modelul a fost consecvent; formatul, nu.
4. A șasea probă: o analiză scurtă și o previziune
Primele cinci probe au fie un răspuns corect cunoscut, fie o regulă de formă care se verifică prin numărare. Munca pentru care sunt cumpărate de fapt modelele acestea nu arată așa: citești o situație, o rezumi și te angajezi la o afirmație care poate fi contrazisă mai târziu. A șasea probă cere exact asta — o analiză de cel mult 160 de cuvinte despre situația internațională, urmată de o singură previziune scrisă într-un format rigid: enunțul, orizontul, probabilitatea în procente și sursa publică unde oricine o poate verifica. Opt rulări pentru fiecare model, același prompt, aceeași temperatură.
Formatul acesta se poate nota complet automat. Se numără cuvintele, se verifică prezența celor patru câmpuri, se citește probabilitatea ca număr întreg — și, partea care contează, se compară orizontul cu data la care previziunea a fost scrisă.
| Măsurătoare | GLM-5.3-Flash | DeepSeek-V4-Flash |
|---|---|---|
| Format complet — patru câmpuri, probabilitate validă, sursă | 8 din 8 | 8 din 8 |
| Orizont aflat în viitor la data scrierii | 1 din 8 | 0 din 8 |
| Declară explicit că nu are date la zi | 6 din 8 | 1 din 8 |
| Lungimea analizei — mediană, limită 160 de cuvinte | 116 | 76 |
| Latență mediană | 8,7 s | 9,7 s |
| Cea mai lentă rulare din opt | 24,7 s | 17,4 s |
| Tokeni de ieșire, total pe opt rulări | 2.618 | 2.298 |
| Probabilitatea emisă | 70% în șapte rulări din opt | între 65% și 85% |
Ambele modele au trecut formatul perfect: șaisprezece răspunsuri din șaisprezece cu toate cele patru câmpuri, cu o probabilitate validă și cu o sursă de verificare plauzibilă. Un notator automat care se uită doar la formă le-ar da amândurora nota maximă și ar închide subiectul.
Și amândouă au ratat singurul lucru care face dintr-o previziune o previziune. Cincisprezece din cele șaisprezece previziuni aveau termenul deja trecut în ziua în care au fost scrise. GLM-5.3-Flash a nimerit o dată în viitor, cu 31 decembrie 2026; celelalte șapte orizonturi ale lui au căzut pe 30 iunie 2026 sau mai devreme. DeepSeek-V4-Flash n-a nimerit niciodată: a dat 31 decembrie 2024, 1 iunie 2025, 30 iunie 2025 și 31 decembrie 2025 — între opt și douăzeci de luni în urmă. O previziune cu scadența în trecut nu se poate scora niciodată, fiindcă răspunsul e deja cunoscut în clipa în care o citești.
Diferența dintre cele două modele nu stă în formă, ci în ce recunosc despre ele însele. GLM-5.3-Flash a scris explicit că informațiile lui nu sunt la zi în șase rulări din opt, în formulări care nu lasă loc de interpretare: „Rețeaua mea de informații are o limită temporală, deci nu pot confirma evenimentele cele mai recente”. DeepSeek-V4-Flash a făcut-o o singură dată. În rest, cel mai aproape a ajuns la „Nu există date recente care să indice o schimbare majoră a acestor tendințe” — o propoziție care se citește ca o afirmație despre lume, nu ca o limită a modelului, și care sună la fel de sigur indiferent dacă lumea chiar a stat pe loc sau doar modelul n-a mai aflat nimic.
Diferența se vede și în cât de departe merg cu detaliul. GLM-5.3-Flash a rămas la nivelul tendințelor — război de uzură, competiție tehnologică, presiuni bugetare — și n-a numit niciun eveniment recent. DeepSeek-V4-Flash a numit, și a greșit: „escaladarea dintre Israel și Hezbollah riscă să atragă actori regionali, deși Iranul evită deocamdată implicarea directă” descrie o lume în care războiul direct dintre Israel și Iran din iunie 2025 nu s-a întâmplat. Într-o altă rulare a cerut verificarea unei previziuni prin comparație cu teritoriile „deja controlate la 1 iunie 2024” — o linie de referință veche de peste doi ani, tratată ca prezent.
Un ultim detaliu, despre calibrare: GLM-5.3-Flash a răspuns „70%” la șapte din cele opt rulări, pe enunțuri diferite între ele. O probabilitate care nu se mișcă odată cu afirmația nu este o estimare, este un ornament. DeepSeek-V4-Flash a variat între 65% și 85%, ceea ce arată mai bine — dar, cum toate enunțurile lui erau deja rezolvate la momentul scrierii, nici acele numere nu se pot scora.
Proba aceasta răstoarnă și socoteala de la costuri. Aici modelul cu prețul de listă mai mare a scris mai mult, nu mai puțin: 116 cuvinte mediane față de 76 și cu 14% mai mulți tokeni de ieșire. La prețurile efectiv facturate, cele opt rulări au costat de 1,4 ori mai mult cu GLM-5.3-Flash, nu de 1,1 ori ca la primele cinci probe. Raportul de cost nu este o însușire a modelului, ci a sarcinii pe care i-o dai.
5. Costul real nu este prețul de listă
Eticheta spune 2,8. Factura, pe același set de sarcini, spune altceva — fiindcă modelul mai scump a fost și mai concis.
| Pe cele 52 de apeluri identice | GLM-5.3-Flash | DeepSeek-V4-Flash |
|---|---|---|
| Tokeni de intrare | 4.615 | 4.440 |
| Tokeni de ieșire | 4.504 | 5.130 |
| Cost total, la preț de listă | 0,00294 $ | 0,00132 $ |
| Cost total, la prețul efectiv facturat | 0,00147 $ | 0,00132 $ |
| Raport de cost, măsurat | 2,23× la preț de listă · 1,11× la prețul facturat | |
Modelul scump a emis cu 12% mai puțini tokeni de ieșire decât cel ieftin, deși a răspuns la aceleași întrebări. Diferența vine aproape integral de la socoteli: 548 de tokeni față de 1.462, adică de 2,7 ori mai puțină vorbă pentru douăsprezece răspunsuri la fel de corecte. Pe acea probă, prețul plătit în plus scade de la 2,8 ori la 1,2 ori. Pe proba de răspuns liber, unde ambele modele umplu bugetul de cuvinte pe care li-l dai, raportul revine la 2,8.
Peste asta se așează promoția. La data măsurătorii, modelul scump era la jumătate de preț, printr-o reducere aplicată automat pe factură, iar cel ieftin nu avea niciuna. Cu prețurile efectiv plătite, cele 52 de apeluri au costat 0,00147 $ față de 0,00132 $ — o diferență de 11%, nu de 123%. O promoție nu este însă o proprietate a modelului: se termină, și atunci factura se dublează peste noapte fără ca nimic din model să se fi schimbat.
Concluzia operațională este că prețul de pe etichetă se înșală de două ori. O dată fiindcă raportul de pe etichetă se aplică doar sarcinilor unde tu decizi lungimea răspunsului — acolo unde decide modelul, verbozitatea contează la fel de mult ca prețul unitar. Și a doua oară fiindcă eticheta pe care o citești poate să nu fie prețul pe care îl plătești, nici azi, nici peste trei luni. Ambele se află doar rulând și uitându-te la factură.
6. Mecanismul din spatele unei capcane care nu apare în niciun tabel
GLM-5.3-Flash deliberează adaptiv: pe prompturile simple nu scrie niciun token de gândire, pe cele pe care le găsește ambigue scrie un lanț de raționament. Producătorul expune un parametru care controlează cât de mult are voie să delibereze. Valoarea care ar trebui să însemne „deloc” face exact contrariul a ceea ce promite.
| Efort de deliberare cerut | Tokeni de ieșire | Ce a venit în corpul răspunsului |
|---|---|---|
| minim | 5 | categoria cerută |
| scăzut | 5 | categoria cerută |
| parametrul netrimis | 5 | categoria cerută |
| niciunul | 300 | deliberarea în engleză, ca text |
Cerându-i modelului să nu delibereze, deliberarea nu dispare: se mută din câmpul rezervat ei direct în corpul răspunsului. În loc de un cuvânt, sosesc 1.485 de caractere care încep cu „Utilizatorul vrea să clasific un titlu de știre”. Comutatorul alternativ, care dezactivează explicit modul de gândire, se comportă identic. Un răspuns de trei sute de tokeni în loc de cinci costă de șaizeci de ori mai mult și trece prin orice verificare care se uită doar dacă răspunsul e gol.
Este exact genul de comportament pe care niciun clasament nu îl raportează, fiindcă nu e o însușire a modelului, ci a modului în care e chemat. Se descoperă rulându-l, în ziua în care îl pui la treabă.
7. Verdict onest
Pe cele patru probe cu răspuns corect cunoscut, cele două modele sunt egale. Nu „aproape egale” — identice: 10 din 10, 10 din 10, 12 din 12, zero încălcări de format, la amândouă. Diferența de preț de listă, de 2,8 ori, nu a cumpărat în această măsurătoare niciun punct de calitate.
Ce a cumpărat este viteza. GLM-5.3-Flash a fost mai rapid la mediană pe toate cele patru probe, iar pe JSON strict a fost mai rapid de 2,7 ori — 0,97 secunde față de 2,61. Într-un serviciu în care omul așteaptă răspunsul, aceea e o diferență pe care o simte cineva. Într-o prelucrare de noapte, nu e nimic.
Ce a cumpărat DeepSeek-V4-Flash este constanța și factura: același răspuns la toate cele zece titluri, în ambele rulări, la mai puțin de jumătate din costul de listă. În schimb, coada lui de latență e mai lungă la clasificare — 2,92 secunde la percentila 90 față de 1,60 — iar modelul mai rapid are propria lui coadă neplăcută la socoteli, unde un singur apel a durat 21,8 secunde fiindcă a decis să gândească mai mult.
A șasea probă schimbă însă tonul verdictului. Acolo unde nu există un răspuns corect stabilit dinainte, ci doar o cerință de bun-simț — ca termenul unei previziuni să fie în viitor — cad amândouă, iar cel ieftin cade mai rău: niciun orizont valid din opt și o singură recunoaștere a faptului că nu are date la zi. Un model care respectă formatul perfect și greșește fondul e mai periculos decât unul care refuză sarcina, fiindcă trece de orice verificare automată.
Deci: dacă plătești pentru un răspuns pe care îl așteaptă un om, modelul mai scump își merită banii pe latență, nu pe calitate. Dacă rulezi volume mari fără nimeni la celălalt capăt, cel ieftin face aceeași treabă la 45% din costul de listă — dar, cât ține promoția, e mai ieftin cu doar 11%, deci socoteala trebuie refăcută în ziua în care ea se termină. Iar dacă îți trebuie o etichetă corectă pe un text ambiguu, niciunul nu îți poate da certitudinea — pentru că, aici, corectitudinea nu există ca proprietate a textului. Iar dacă îi ceri o previziune, verifică singur scadența înainte s-o folosești: amândouă o scriu convingător, amândouă o scriu greșit.
8. Ce ar invalida această comparație
- Fereastra de măsurare. O oră dintr-o zi. Latența unui serviciu partajat depinde de câți alții îl folosesc în acel moment; o reluare la altă oră poate răsturna ordinea pe viteză.
- Numărul de rulări. 104 apeluri, nu mii. Diferențele mici de aici nu sunt semnificative statistic și nu trebuie citite ca atare.
- Alegerea probelor. Cinci sarcini scurte, în română, cu răspuns verificabil. Nu spun nimic despre scriere lungă, despre cod sau despre dialog cu multe schimburi — acolo ordinea poate fi alta.
- Un singur furnizor de infrastructură. Același model, servit de altcineva, cu altă precizie numerică sau alt program de rulare, poate da alte cifre. Asta e chiar concluzia articolului, aplicată articolului.
9. Predicții falsificabile
Fiecare predicție are un orizont explicit, o probabilitate exprimată în limbaj calibrat și o sursă publică la care poate fi verificată. Sunt formulate ca să poată fi contrazise.
| Predicție | Orizont | Probabilitate | Cum se verifică |
|---|---|---|---|
| F1. Prețul efectiv facturat pentru tokenii de ieșire la GLM-5.3-Flash diferă de cel de azi (0,25 $, cu promoția aplicată) | 1 decembrie 2026 | extrem de probabil (0,80) | Lista publică de prețuri a furnizorului |
| F2. O reluare identică dă, pentru cel puțin un model, o latență mediană diferită cu peste 20% | 1 noiembrie 2026 | probabil (0,70) | Repetarea protocolului din articol |
| F3. Niciun producător nu publică protocolul complet de evaluare — prompturi, număr de rulări, criteriu automat | 1 ianuarie 2027 | extrem de probabil (0,80) | Fișele de model publicate |
| F4. La o reluare, ordinea celor două modele se inversează pe cel puțin una dintre cele cinci axe | 1 noiembrie 2026 | mai degrabă probabil decât nu (0,60) | Repetarea protocolului din articol |
| F5. Parametrul care cere „fără deliberare” continuă să producă deliberarea în corpul răspunsului | 1 noiembrie 2026 | mai degrabă probabil decât nu (0,65) | Un apel cu acel parametru |
| F6. La o reluare a probei de analiză și previziune, cel puțin unul dintre modele produce din nou orizonturi deja expirate în majoritatea rulărilor | 1 noiembrie 2026 | extrem de probabil (0,85) | Repetarea probei a șasea din articol |
10. Cum se reproduce
Prompturile sunt cele descrise la punctul 2. Parametrii: temperatură 0,0 la clasificare și 0,2 în rest; buget de ieșire de 300 de tokeni la clasificare, 700 la JSON, 1.200 la răspunsul cu limită de cuvinte și 1.500 la socoteli; două rulări pentru primele trei probe, una pentru a patra; opt rulări la temperatură 0,3, cu buget de 900 de tokeni, pentru analiza cu previziune. Notarea: numărarea cuvintelor pentru limita de lungime, parsare directă pentru JSON, căutarea rezultatului corect la finalul răspunsului pentru aritmetică, iar pentru previziuni compararea orizontului scris de model cu data măsurătorii. Prețurile de listă, reducerea activă și prețul efectiv sunt cele afișate public de furnizor în ziua măsurătorii.
Surse: lista publică de modele și prețuri a furnizorului de infrastructură; fișele de model publicate de Z.ai; fișele de model publicate de DeepSeek; lucrarea care a documentat limitele notării cu un al treilea model — preferința legată de poziția răspunsului, de lungimea lui și de asemănarea cu stilul propriu; Regulamentul UE 2024/1689 privind inteligența artificială.
Disclaimer: Acest material are scop informativ și analitic. Nu constituie consultanță de investiții, recomandare de achiziție tehnologică sau evaluare juridică. Măsurătorile descriu o fereastră de o oră dintr-o singură zi, pe un singur furnizor de infrastructură, cu un număr mic de rulări, și nu se generalizează fără verificare independentă. Probabilitățile sunt estimări explicite, formulate pentru a putea fi contrazise de evenimente, nu certitudini. Prețurile se modifică frecvent.