TEHNOLOGIE

GLM-5.3-Flash contra DeepSeek-V4-Flash — aceleași probe, patru dezacorduri din zece

olivLaw Psychohistory
Replică a prototipului internațional al kilogramului, sub două clopote de sticlă
Replica prototipului internațional al kilogramului. A fost etalonul masei până în 2019, când a fost înlocuit cu o definiție pe care o poate reproduce oricine, oriunde. Foto: Wikimedia Commons.

1. Ce am pus față în față

Două modele de limbaj din categoria ieftină, servite de același furnizor de infrastructură, cu aceeași fereastră de context și aceeași precizie numerică. Le numim pe nume, fiindcă altfel comparația nu poate fi verificată de nimeni.

Caracteristicăzai-org/GLM-5.3-Flashdeepseek-ai/DeepSeek-V4-Flash
ProducătorZ.aiDeepSeek
Preț de listă, intrare, la un milion de tokeni0,15 $0,09 $
Preț de listă, ieșire, la un milion de tokeni0,50 $0,18 $
Reducere promoțională la data măsurătorii50%, aplicată automat la facturăniciuna
Preț efectiv plătit, intrare / ieșire0,075 $ / 0,25 $0,09 $ / 0,18 $
Fereastră de context1.048.576 tokeni1.048.576 tokeni
Precizie numerică la servirefp8fp8

Pe etichetă, ieșirea primului costă de 2,8 ori mai mult decât a celuilalt. Pe factură, în ziua măsurătorii, de doar 1,4 ori — fiindcă unul dintre ele are o promoție de 50% care se aplică automat. Întrebarea articolului este dacă vreuna dintre aceste diferențe se vede în calitate.

2. Protocolul, pe scurt

Șase probe, toate notate automat, niciuna printr-un al treilea model care să dea note. Un judecător automat are preferințe proprii — ordinea în care îi arăți răspunsurile îi schimbă verdictul, îi plac răspunsurile lungi și textul care seamănă cu al lui — iar aici nu era nevoie de el: fiecare probă are un criteriu care se verifică prin numărare.

  • Clasificare. Zece titluri de presă, câte două rulări fiecare, temperatură zero, o singură categorie cerută ca răspuns. Se măsoară latența, stabilitatea între rulări și acordul dintre modele.
  • Conformare la instrucțiuni. Cinci întrebări de cultură generală, cu o limită explicită de 170 de cuvinte și interdicție de HTML, linkuri și liste cu marcatori. Se numără cuvintele și încălcările.
  • Format strict. Cinci texte de clasificat într-un obiect JSON cu patru câmpuri exacte. Se verifică dacă răspunsul se parsează direct și dacă are exact cheile cerute.
  • Răspunsuri verificabile. Douăsprezece probleme de aritmetică și logică elementară, cu un singur rezultat corect, căutat automat în finalul răspunsului.
  • Cost real. Tokenii facturabili consumați de fiecare model pe exact același set de sarcini, înmulțiți atât cu prețul de listă, cât și cu prețul efectiv facturat.
  • Analiză și previziune. O analiză de cel mult 160 de cuvinte despre situația internațională, plus o previziune cu enunț, orizont, probabilitate și sursă de verificare, în opt rulări pentru fiecare model. Se numără cuvintele, se verifică cele patru câmpuri și se compară orizontul cu ziua în care a fost scris.

Primele cinci probe au însemnat 104 apeluri, plecate spre același punct de acces într-o fereastră de o oră din 2 septembrie 2026; a șasea a adăugat 16 apeluri în aceeași zi, cu aceiași parametri. Ce urmează descrie acea fereastră, nu o însușire permanentă a modelelor.

3. Rezultatele

MăsurătoareGLM-5.3-FlashDeepSeek-V4-Flash
Clasificare — latență mediană0,59 s0,69 s
Clasificare — latență la percentila 901,60 s2,92 s
Clasificare — același răspuns la ambele rulări9 din 1010 din 10
Limita de 170 de cuvinte — depășiri0 din 100 din 10
Limita de 170 de cuvinte — latență mediană9,13 s9,58 s
JSON strict — schema exactă10 din 1010 din 10
JSON strict — latență mediană0,97 s2,61 s
Aritmetică — răspunsuri corecte12 din 1212 din 12
Aritmetică — tokeni de ieșire, total5481.462

Pe toate probele cu răspuns corect cunoscut, cele două modele sunt imposibil de despărțit: zero depășiri ale limitei de lungime la ambele, zece JSON-uri valide din zece la ambele, douăsprezece socoteli corecte din douăsprezece la ambele. Niciunul nu a scris HTML, linkuri sau liste acolo unde i s-a interzis. Dacă am fi oprit măsurătoarea aici, concluzia ar fi fost că nu contează pe care îl alegi.

Partea interesantă începe la proba fără răspuns corect. Pe cele zece titluri de presă, cele două modele au dat aceeași categorie de șase ori din zece. Cele patru dezacorduri nu sunt greșeli:

TitluGLM-5.3-FlashDeepSeek-V4-Flash
Banca centrală își menține dobânda și avertizează asupra deficituluieconomiefinanciar
Rata anuală a inflației urcă la 5,8% în augusteconomiefinanciar
Un atac cibernetic oprește șase ore serviciile unei băncitehnologie / financiarfinanciar
Parlamentul European votează amendamentele la regulamentul privind inteligența artificialătehnologiepolitica

Un vot parlamentar despre inteligență artificială este și politică, și tehnologie. Inflația este și economie, și finanțe. Un atac informatic asupra unei bănci este ambele lucruri deodată — iar acesta este singurul titlu la care un model și-a schimbat singur părerea între cele două rulări, deși temperatura era zero. Nu există o cheie de răspuns la care să apelezi. Un clasament care ar acorda puncte pentru „clasificare corectă” ar măsura, de fapt, cât de mult seamănă modelul cu persoana care a scris cheia.

Un amănunt practic din aceeași probă: DeepSeek-V4-Flash a dat aceeași categorie la toate cele zece titluri, în ambele rulări, dar o dată a scris-o cu majusculă. Un program care compară șiruri exact ar fi numărat asta drept răspuns diferit. Modelul a fost consecvent; formatul, nu.

4. A șasea probă: o analiză scurtă și o previziune

Primele cinci probe au fie un răspuns corect cunoscut, fie o regulă de formă care se verifică prin numărare. Munca pentru care sunt cumpărate de fapt modelele acestea nu arată așa: citești o situație, o rezumi și te angajezi la o afirmație care poate fi contrazisă mai târziu. A șasea probă cere exact asta — o analiză de cel mult 160 de cuvinte despre situația internațională, urmată de o singură previziune scrisă într-un format rigid: enunțul, orizontul, probabilitatea în procente și sursa publică unde oricine o poate verifica. Opt rulări pentru fiecare model, același prompt, aceeași temperatură.

Formatul acesta se poate nota complet automat. Se numără cuvintele, se verifică prezența celor patru câmpuri, se citește probabilitatea ca număr întreg — și, partea care contează, se compară orizontul cu data la care previziunea a fost scrisă.

MăsurătoareGLM-5.3-FlashDeepSeek-V4-Flash
Format complet — patru câmpuri, probabilitate validă, sursă8 din 88 din 8
Orizont aflat în viitor la data scrierii1 din 80 din 8
Declară explicit că nu are date la zi6 din 81 din 8
Lungimea analizei — mediană, limită 160 de cuvinte11676
Latență mediană8,7 s9,7 s
Cea mai lentă rulare din opt24,7 s17,4 s
Tokeni de ieșire, total pe opt rulări2.6182.298
Probabilitatea emisă70% în șapte rulări din optîntre 65% și 85%

Ambele modele au trecut formatul perfect: șaisprezece răspunsuri din șaisprezece cu toate cele patru câmpuri, cu o probabilitate validă și cu o sursă de verificare plauzibilă. Un notator automat care se uită doar la formă le-ar da amândurora nota maximă și ar închide subiectul.

Și amândouă au ratat singurul lucru care face dintr-o previziune o previziune. Cincisprezece din cele șaisprezece previziuni aveau termenul deja trecut în ziua în care au fost scrise. GLM-5.3-Flash a nimerit o dată în viitor, cu 31 decembrie 2026; celelalte șapte orizonturi ale lui au căzut pe 30 iunie 2026 sau mai devreme. DeepSeek-V4-Flash n-a nimerit niciodată: a dat 31 decembrie 2024, 1 iunie 2025, 30 iunie 2025 și 31 decembrie 2025 — între opt și douăzeci de luni în urmă. O previziune cu scadența în trecut nu se poate scora niciodată, fiindcă răspunsul e deja cunoscut în clipa în care o citești.

Diferența dintre cele două modele nu stă în formă, ci în ce recunosc despre ele însele. GLM-5.3-Flash a scris explicit că informațiile lui nu sunt la zi în șase rulări din opt, în formulări care nu lasă loc de interpretare: „Rețeaua mea de informații are o limită temporală, deci nu pot confirma evenimentele cele mai recente”. DeepSeek-V4-Flash a făcut-o o singură dată. În rest, cel mai aproape a ajuns la „Nu există date recente care să indice o schimbare majoră a acestor tendințe” — o propoziție care se citește ca o afirmație despre lume, nu ca o limită a modelului, și care sună la fel de sigur indiferent dacă lumea chiar a stat pe loc sau doar modelul n-a mai aflat nimic.

Diferența se vede și în cât de departe merg cu detaliul. GLM-5.3-Flash a rămas la nivelul tendințelor — război de uzură, competiție tehnologică, presiuni bugetare — și n-a numit niciun eveniment recent. DeepSeek-V4-Flash a numit, și a greșit: „escaladarea dintre Israel și Hezbollah riscă să atragă actori regionali, deși Iranul evită deocamdată implicarea directă” descrie o lume în care războiul direct dintre Israel și Iran din iunie 2025 nu s-a întâmplat. Într-o altă rulare a cerut verificarea unei previziuni prin comparație cu teritoriile „deja controlate la 1 iunie 2024” — o linie de referință veche de peste doi ani, tratată ca prezent.

Un ultim detaliu, despre calibrare: GLM-5.3-Flash a răspuns „70%” la șapte din cele opt rulări, pe enunțuri diferite între ele. O probabilitate care nu se mișcă odată cu afirmația nu este o estimare, este un ornament. DeepSeek-V4-Flash a variat între 65% și 85%, ceea ce arată mai bine — dar, cum toate enunțurile lui erau deja rezolvate la momentul scrierii, nici acele numere nu se pot scora.

Proba aceasta răstoarnă și socoteala de la costuri. Aici modelul cu prețul de listă mai mare a scris mai mult, nu mai puțin: 116 cuvinte mediane față de 76 și cu 14% mai mulți tokeni de ieșire. La prețurile efectiv facturate, cele opt rulări au costat de 1,4 ori mai mult cu GLM-5.3-Flash, nu de 1,1 ori ca la primele cinci probe. Raportul de cost nu este o însușire a modelului, ci a sarcinii pe care i-o dai.

5. Costul real nu este prețul de listă

Eticheta spune 2,8. Factura, pe același set de sarcini, spune altceva — fiindcă modelul mai scump a fost și mai concis.

Pe cele 52 de apeluri identiceGLM-5.3-FlashDeepSeek-V4-Flash
Tokeni de intrare4.6154.440
Tokeni de ieșire4.5045.130
Cost total, la preț de listă0,00294 $0,00132 $
Cost total, la prețul efectiv facturat0,00147 $0,00132 $
Raport de cost, măsurat2,23× la preț de listă · 1,11× la prețul facturat

Modelul scump a emis cu 12% mai puțini tokeni de ieșire decât cel ieftin, deși a răspuns la aceleași întrebări. Diferența vine aproape integral de la socoteli: 548 de tokeni față de 1.462, adică de 2,7 ori mai puțină vorbă pentru douăsprezece răspunsuri la fel de corecte. Pe acea probă, prețul plătit în plus scade de la 2,8 ori la 1,2 ori. Pe proba de răspuns liber, unde ambele modele umplu bugetul de cuvinte pe care li-l dai, raportul revine la 2,8.

Peste asta se așează promoția. La data măsurătorii, modelul scump era la jumătate de preț, printr-o reducere aplicată automat pe factură, iar cel ieftin nu avea niciuna. Cu prețurile efectiv plătite, cele 52 de apeluri au costat 0,00147 $ față de 0,00132 $ — o diferență de 11%, nu de 123%. O promoție nu este însă o proprietate a modelului: se termină, și atunci factura se dublează peste noapte fără ca nimic din model să se fi schimbat.

Concluzia operațională este că prețul de pe etichetă se înșală de două ori. O dată fiindcă raportul de pe etichetă se aplică doar sarcinilor unde tu decizi lungimea răspunsului — acolo unde decide modelul, verbozitatea contează la fel de mult ca prețul unitar. Și a doua oară fiindcă eticheta pe care o citești poate să nu fie prețul pe care îl plătești, nici azi, nici peste trei luni. Ambele se află doar rulând și uitându-te la factură.

6. Mecanismul din spatele unei capcane care nu apare în niciun tabel

GLM-5.3-Flash deliberează adaptiv: pe prompturile simple nu scrie niciun token de gândire, pe cele pe care le găsește ambigue scrie un lanț de raționament. Producătorul expune un parametru care controlează cât de mult are voie să delibereze. Valoarea care ar trebui să însemne „deloc” face exact contrariul a ceea ce promite.

Efort de deliberare cerutTokeni de ieșireCe a venit în corpul răspunsului
minim5categoria cerută
scăzut5categoria cerută
parametrul netrimis5categoria cerută
niciunul300deliberarea în engleză, ca text

Cerându-i modelului să nu delibereze, deliberarea nu dispare: se mută din câmpul rezervat ei direct în corpul răspunsului. În loc de un cuvânt, sosesc 1.485 de caractere care încep cu „Utilizatorul vrea să clasific un titlu de știre”. Comutatorul alternativ, care dezactivează explicit modul de gândire, se comportă identic. Un răspuns de trei sute de tokeni în loc de cinci costă de șaizeci de ori mai mult și trece prin orice verificare care se uită doar dacă răspunsul e gol.

Este exact genul de comportament pe care niciun clasament nu îl raportează, fiindcă nu e o însușire a modelului, ci a modului în care e chemat. Se descoperă rulându-l, în ziua în care îl pui la treabă.

7. Verdict onest

Pe cele patru probe cu răspuns corect cunoscut, cele două modele sunt egale. Nu „aproape egale” — identice: 10 din 10, 10 din 10, 12 din 12, zero încălcări de format, la amândouă. Diferența de preț de listă, de 2,8 ori, nu a cumpărat în această măsurătoare niciun punct de calitate.

Ce a cumpărat este viteza. GLM-5.3-Flash a fost mai rapid la mediană pe toate cele patru probe, iar pe JSON strict a fost mai rapid de 2,7 ori — 0,97 secunde față de 2,61. Într-un serviciu în care omul așteaptă răspunsul, aceea e o diferență pe care o simte cineva. Într-o prelucrare de noapte, nu e nimic.

Ce a cumpărat DeepSeek-V4-Flash este constanța și factura: același răspuns la toate cele zece titluri, în ambele rulări, la mai puțin de jumătate din costul de listă. În schimb, coada lui de latență e mai lungă la clasificare — 2,92 secunde la percentila 90 față de 1,60 — iar modelul mai rapid are propria lui coadă neplăcută la socoteli, unde un singur apel a durat 21,8 secunde fiindcă a decis să gândească mai mult.

A șasea probă schimbă însă tonul verdictului. Acolo unde nu există un răspuns corect stabilit dinainte, ci doar o cerință de bun-simț — ca termenul unei previziuni să fie în viitor — cad amândouă, iar cel ieftin cade mai rău: niciun orizont valid din opt și o singură recunoaștere a faptului că nu are date la zi. Un model care respectă formatul perfect și greșește fondul e mai periculos decât unul care refuză sarcina, fiindcă trece de orice verificare automată.

Deci: dacă plătești pentru un răspuns pe care îl așteaptă un om, modelul mai scump își merită banii pe latență, nu pe calitate. Dacă rulezi volume mari fără nimeni la celălalt capăt, cel ieftin face aceeași treabă la 45% din costul de listă — dar, cât ține promoția, e mai ieftin cu doar 11%, deci socoteala trebuie refăcută în ziua în care ea se termină. Iar dacă îți trebuie o etichetă corectă pe un text ambiguu, niciunul nu îți poate da certitudinea — pentru că, aici, corectitudinea nu există ca proprietate a textului. Iar dacă îi ceri o previziune, verifică singur scadența înainte s-o folosești: amândouă o scriu convingător, amândouă o scriu greșit.

8. Ce ar invalida această comparație

  • Fereastra de măsurare. O oră dintr-o zi. Latența unui serviciu partajat depinde de câți alții îl folosesc în acel moment; o reluare la altă oră poate răsturna ordinea pe viteză.
  • Numărul de rulări. 104 apeluri, nu mii. Diferențele mici de aici nu sunt semnificative statistic și nu trebuie citite ca atare.
  • Alegerea probelor. Cinci sarcini scurte, în română, cu răspuns verificabil. Nu spun nimic despre scriere lungă, despre cod sau despre dialog cu multe schimburi — acolo ordinea poate fi alta.
  • Un singur furnizor de infrastructură. Același model, servit de altcineva, cu altă precizie numerică sau alt program de rulare, poate da alte cifre. Asta e chiar concluzia articolului, aplicată articolului.

9. Predicții falsificabile

Fiecare predicție are un orizont explicit, o probabilitate exprimată în limbaj calibrat și o sursă publică la care poate fi verificată. Sunt formulate ca să poată fi contrazise.

PredicțieOrizontProbabilitateCum se verifică
F1. Prețul efectiv facturat pentru tokenii de ieșire la GLM-5.3-Flash diferă de cel de azi (0,25 $, cu promoția aplicată)1 decembrie 2026extrem de probabil (0,80)Lista publică de prețuri a furnizorului
F2. O reluare identică dă, pentru cel puțin un model, o latență mediană diferită cu peste 20%1 noiembrie 2026probabil (0,70)Repetarea protocolului din articol
F3. Niciun producător nu publică protocolul complet de evaluare — prompturi, număr de rulări, criteriu automat1 ianuarie 2027extrem de probabil (0,80)Fișele de model publicate
F4. La o reluare, ordinea celor două modele se inversează pe cel puțin una dintre cele cinci axe1 noiembrie 2026mai degrabă probabil decât nu (0,60)Repetarea protocolului din articol
F5. Parametrul care cere „fără deliberare” continuă să producă deliberarea în corpul răspunsului1 noiembrie 2026mai degrabă probabil decât nu (0,65)Un apel cu acel parametru
F6. La o reluare a probei de analiză și previziune, cel puțin unul dintre modele produce din nou orizonturi deja expirate în majoritatea rulărilor1 noiembrie 2026extrem de probabil (0,85)Repetarea probei a șasea din articol

10. Cum se reproduce

Prompturile sunt cele descrise la punctul 2. Parametrii: temperatură 0,0 la clasificare și 0,2 în rest; buget de ieșire de 300 de tokeni la clasificare, 700 la JSON, 1.200 la răspunsul cu limită de cuvinte și 1.500 la socoteli; două rulări pentru primele trei probe, una pentru a patra; opt rulări la temperatură 0,3, cu buget de 900 de tokeni, pentru analiza cu previziune. Notarea: numărarea cuvintelor pentru limita de lungime, parsare directă pentru JSON, căutarea rezultatului corect la finalul răspunsului pentru aritmetică, iar pentru previziuni compararea orizontului scris de model cu data măsurătorii. Prețurile de listă, reducerea activă și prețul efectiv sunt cele afișate public de furnizor în ziua măsurătorii.

Surse: lista publică de modele și prețuri a furnizorului de infrastructură; fișele de model publicate de Z.ai; fișele de model publicate de DeepSeek; lucrarea care a documentat limitele notării cu un al treilea model — preferința legată de poziția răspunsului, de lungimea lui și de asemănarea cu stilul propriu; Regulamentul UE 2024/1689 privind inteligența artificială.

Disclaimer: Acest material are scop informativ și analitic. Nu constituie consultanță de investiții, recomandare de achiziție tehnologică sau evaluare juridică. Măsurătorile descriu o fereastră de o oră dintr-o singură zi, pe un singur furnizor de infrastructură, cu un număr mic de rulări, și nu se generalizează fără verificare independentă. Probabilitățile sunt estimări explicite, formulate pentru a putea fi contrazise de evenimente, nu certitudini. Prețurile se modifică frecvent.