TEHNOLOGIE

Prețul tokenilor AI n-a mai scăzut din aprilie — iar vârful de gamă s-a scumpit cu 72%

olivLaw Psychohistory
Patru plăci acceleratoare NVIDIA H100 pentru centre de date, așezate în șir
Plăci acceleratoare NVIDIA H100. Chiria lor pe contract de un an s-a scumpit cu circa 40% între octombrie 2025 și martie 2026, iar memoria lipsă e motivul. Foto: Wikimedia Commons.

1. De ce am reluat verificarea

Pagina noastră /ai-hub afișează, de la sfârșitul lui aprilie 2026, un tabel cu prețul public al tokenilor pentru paisprezece modele de limbaj, plus o coloană derivată — „inteligență per dolar” — care împarte un scor de clasament la costul amestecat. Tabelul poartă eticheta actualizat 2026-04 și este scris de mână în cod, nu preluat automat de la furnizori.

Un tabel scris de mână care nu se actualizează singur are două feluri de a greși: poate fi greșit de la început și poate rămâne în urmă. Le-am verificat pe amândouă, separat, fiindcă răspund la întrebări diferite. Prima e o eroare a noastră. A doua e o măsurătoare despre piață — și, spre surprinderea noastră, e partea interesantă.

Un token e bucata de text pe care o prelucrează modelul: aproximativ trei sferturi dintr-un cuvânt în engleză, ceva mai puțin în română. Prețurile de mai jos sunt în dolari la un milion de tokeni, așa cum le publică fiecare furnizor. Unde apare o singură cifră, e prețul amestecat: 70% intrare, 30% ieșire, proporția obișnuită la un dialog cu întrebări lungi și răspunsuri scurte. E aceeași convenție pe care o folosește pagina.

2. Prima constatare: tabelul din aprilie nu se verifică

Din paisprezece rânduri, trei numesc modele care nu au existat niciodată sub numele acela:

  • „Llama 4 405B”. Familia Llama 4 publicată de Meta are trei membri — Scout, Maverick și Behemoth. Nu există niciun model de 405 de miliarde de parametri în ea; 405B e modelul de vârf al generației anterioare, Llama 3.1. Numele de pe pagină e o încrucișare între două generații.
  • „DeepSeek V3.5”. Seria a mers V3.1 → V3.2 (1 decembrie 2025) → V4 (24 aprilie 2026). Nu a existat un V3.5. Prețul afișat, 0,27 $ / 1,10 $, este în schimb exact prețul lui V3.1.
  • „Kimi K2 Pro”. Moonshot a publicat K2, K2.5, K2.6, K2.7 Code și K3. Nu și un „K2 Pro”.

Dintre cele unsprezece rânduri rămase, care numesc modele reale, opt aveau prețul greșit. Doar trei erau corecte.

ModelAfișat pe pagină (in / out)Preț real, aprilie 2026Eroare
Claude Opus 4.715 $ / 75 $5 $ / 25 $de 3 ori mai mare
Claude Sonnet 4.63 $ / 15 $3 $ / 15 $corect
Claude Haiku 4.50,80 $ / 4 $1 $ / 5 $cu 20% mai mic
GPT-55 $ / 15 $1,25 $ / 10 $de 4 ori mai mare la intrare
GPT-5 Mini0,50 $ / 2 $0,25 $ / 2 $de 2 ori mai mare la intrare
GPT-4o2,50 $ / 10 $2,50 $ / 10 $corect
Gemini 2.5 Pro3,50 $ / 10,50 $1,25 $ / 10 $de 2,8 ori mai mare la intrare
Gemini 2.5 Flash0,30 $ / 2,50 $0,30 $ / 2,50 $corect
Grok 45 $ / 15 $3 $ / 15 $de 1,67 ori mai mare la intrare
Qwen3-235B-A22B0,50 $ / 1,50 $0,455 $ / 0,90 $de 1,67 ori mai mare la ieșire
Mistral Medium 32,70 $ / 8,10 $0,40 $ / 2 $de 6,75 ori mai mare la intrare

Media prețului amestecat pe cele unsprezece modele reale: 6,795 $ pe pagină față de 3,828 $ în realitate. Tabelul umfla costul tokenilor cu 77,5%.

Cea mai instructivă eroare e prima. Prețul de 15 $ / 75 $ a fost real — dar pentru Claude Opus 4.1, până pe 24 noiembrie 2025, când Anthropic a tăiat tariful modelului de vârf cu 67%, la 5 $ / 25 $. Tabelul nostru, scris pe 29 aprilie 2026, reproducea un preț retras de cinci luni, atribuit unui model lansat cu treisprezece zile înainte. Nu e o cifră inventată din senin: e o cifră care a fost adevărată și pe care nimeni n-a mai verificat-o. Restul erorilor n-au nici măcar scuza asta — 2,70 $ nu a fost niciodată prețul lui Mistral Medium 3, care costă 0,40 $ de la lansare.

Consecința practică nu e cosmetică. Coloana „inteligență per dolar” împarte un scor la prețul amestecat. Cu numitorul greșit de până la 6,75 ori, ordinea din acea coloană — singurul lucru pe care un cititor l-ar folosi ca să aleagă un model — era arbitrară.

3. A doua constatare: din aprilie, niciun preț nu s-a mișcat

Aici ne așteptam la partea plictisitoare a articolului: să reașezăm tabelul cu prețurile de azi și să calculăm cât au scăzut în cinci luni. Nu au scăzut. Nici nu au crescut.

ModelAprilie 20263 septembrie 2026Variație
Claude Opus 4.75 $ / 25 $5 $ / 25 $0%
Claude Sonnet 4.63 $ / 15 $3 $ / 15 $0%
Claude Haiku 4.51 $ / 5 $1 $ / 5 $0%
GPT-51,25 $ / 10 $1,25 $ / 10 $0%
GPT-5 Mini0,25 $ / 2 $0,25 $ / 2 $0%
GPT-4o2,50 $ / 10 $2,50 $ / 10 $0%
Gemini 2.5 Pro1,25 $ / 10 $1,25 $ / 10 $0%
Gemini 2.5 Flash0,30 $ / 2,50 $0,30 $ / 2,50 $0%
Grok 43 $ / 15 $retras din ofertăscos pe 15 mai 2026
Qwen3-235B-A22B0,455 $ / 0,90 $0,455 $ / 0,90 $0%
Mistral Medium 30,40 $ / 2 $0,40 $ / 2 $0%

Zece din zece — dintre cele unsprezece rânduri pe care panoul le publica în aprilie și care numeau modele reale. Nicio modificare, la nicio poziție, în cinci luni. Al unsprezecelea, Grok 4, nu s-a scumpit și nu s-a ieftinit: a fost scos cu totul pe 15 mai 2026. Numele vechi nu dă eroare, ci trimite cererile către Grok 4.3, la 1,25 $ / 2,50 $ — un cost amestecat de 1,63 $ în loc de 6,60 $. E singura mișcare din tabel și merge, întâmplător, în direcția cumpărătorului.

Unele dintre prețurile neschimbate sunt înghețate de mult mai multă vreme: Gemini 2.5 Flash-Lite costă 0,10 $ / 0,40 $ de la lansarea din 17 iunie 2025, iar GPT-5 nano costă 0,05 $ / 0,40 $ de pe 7 august 2025. Peste treisprezece luni fără nicio schimbare, într-o piață despre care presa de specialitate scria, cu câteva luni înainte, că se ieftinește de zeci de ori pe an.

4. Ce s-a mișcat, de fapt: meniul — și în sus

Prețurile nu s-au schimbat, dar oferta da. Iar modelele noi nu au venit sub prețul celor pe care le înlocuiesc, cum se întâmpla până anul trecut. Au venit peste.

FurnizorVârful în aprilieVârful în septembrieCost amestecatVariație
OpenAIGPT-5 (1,25 $ / 10 $)GPT-5.6 Sol (4 $ / 20 $, tarif promoțional)3,875 → 8,80 $+127%
GoogleGemini 2.5 Flash (0,30 $ / 2,50 $)Gemini 3.6 Flash (0,75 $ / 3,75 $)0,96 → 1,65 $+72%
AnthropicOpus 4.7 (5 $ / 25 $)Fable 5.1, tier nou peste Opus (10 $ / 50 $)11,00 → 22,00 $+100%
GoogleGemini 2.5 Pro (1,25 $ / 10 $)Gemini 3.1 Pro (2 $ / 12 $)3,875 → 5,00 $+29%
xAIGrok 4 (3 $ / 15 $)Grok 4.6 (2 $ / 6 $)6,60 → 3,20 $−52%

Mediana: +72% în cinci luni. Două dintre cifrele din tabel sunt însă mai fragile decât par, și fragilitatea împinge în aceeași direcție. Tariful lui GPT-5.6 Sol, 4 $ / 20 $, e marcat de OpenAI drept promoțional și garantat doar până pe 21 noiembrie 2026; tariful permanent al nivelului de vârf, moștenit de la GPT-5.5, e 5 $ / 30 $ — adică 12,50 $ amestecat și +223% față de aprilie. Iar 0,75 $ / 3,75 $ la Gemini 3.6 Flash e prețul valabil până pe 31 decembrie 2026: pentru 1 ianuarie 2027 Google a publicat deja dublul, 1,50 $ / 7,50 $, ceea ce ar însemna +244%. Cu tarifele permanente în locul celor promoționale, mediana nu e +72%, ci +100%. Am folosit peste tot cifra mai mică, cea care se plătește azi.

Datele exacte contează, fiindcă arată că nu e o coincidență de calendar:

  • 23 aprilie 2026 — OpenAI lansează GPT-5.5 la 5 $ / 30 $. Modelul de vârf trece de la 1,25 $ la 5 $ la intrare: de patru ori.
  • 15 mai 2026 — xAI retrage Grok 4 și trimite numele vechi către Grok 4.3, la 1,25 $ / 2,50 $. Primul dintre cele două contraexemple clare din fereastră.
  • 9 iunie 2026 — Anthropic deschide un nivel deasupra lui Opus, la 10 $ / 50 $, adică dublul lui Opus pe ambele capete. Tariful lui Opus însuși rămâne 5 $ / 25 $, neschimbat de la tăierea din noiembrie 2025, prin patru generații succesive.
  • 9 iulie 2026 — GPT-5.6 înlocuiește GPT-5.5. Nivelul de sus, Sol, e listat la 4 $ / 20 $: sub predecesorul lui, dar cu mențiunea explicită că e o promoție cu termen.
  • 30 iulie 2026 — OpenAI reduce două dintre nivelurile GPT-5.6. Reducerea se aplică față de propriile prețuri de lansare de pe 9 iulie, nu față de aprilie.
  • 11 august 2026 — Anthropic anulează o scumpire pe care o anunțase deja: Sonnet 5 urma să treacă de la 2 $ / 10 $ la 3 $ / 15 $ pe 1 septembrie, iar tariful introductiv devine în schimb permanent. Al doilea contraexemplu, și cel mai greu de împăcat cu explicația prin penurie.
  • 12 august 2026 — xAI lansează Grok 4.6 mai ieftin decât Grok 4.
  • 16 august 2026 — DeepSeek majorează tarifele. E cea mai mare scumpire din fereastră, la cel mai ieftin furnizor din grup.

Ultimul punct merită detaliat, fiindcă e opusul a ce se aștepta oricine de la DeepSeek. Furnizorul a avertizat pe 6 august, a publicat grila nouă pe 13 august și a aplicat-o pe 16 august, la ora 16:00 UTC. La V4-Flash, modelul de intrare, tariful pentru text care nu e deja memorat urcă de la 0,14 $ la 0,22 $ în afara orelor de vârf și la 0,44 $ în vârf; ieșirea urcă de la 0,28 $ la 0,66 $, respectiv 1,32 $.

DeepSeek V4-FlashPână pe 16 augustÎn afara vârfuluiÎn orele de vârf
Intrare0,14 $0,22 $ (+57%)0,44 $ (+214%)
Ieșire0,28 $0,66 $ (+136%)1,32 $ (+371%)
Cost amestecat0,182 $0,352 $ (+93%)0,704 $ (+287%)

V4-Pro, modelul mare, are aceeași structură: 0,66 $ / 1,98 $ în afara vârfului și 1,32 $ / 3,96 $ în vârf. Orele de vârf sunt 01:00–04:00 și 06:00–10:00 UTC, de luni până vineri.

Sunt două lucruri noi aici, nu unul. Primul e mărimea scumpirii, la furnizorul care a definit capătul ieftin al pieței. Al doilea e forma ei: un tarif care depinde de ora la care trimiți cererea e felul în care se vinde energia electrică sau capacitatea de transport, nu programele. Un furnizor ajunge acolo când constrângerea nu mai e cât îl costă să dezvolte modelul, ci câtă capacitate are liberă într-un anumit moment al zilei.

5. Ritmul, în trei măsuri

„Cât de repede s-au mișcat prețurile” nu are un singur răspuns, fiindcă depinde de ce ții fix. Trei întrebări diferite, trei cifre diferite, toate pe fereastra 23 aprilie – 3 septembrie 2026:

ÎntrebareaPe 5 luniRitm anual echivalent
Cât costă azi exact modelul pe care îl foloseam în aprilie?0,0%0,0%
Cât costă cel mai ieftin model listat?0,0%0,0%
Cât costă ce e mai bun pe piață? (mediana a 5 furnizori)+72%nu se anualizează

Ultima cifră cere o precizare, altfel induce în eroare. O creștere de 72% în cinci luni s-ar anualiza matematic la +267%, dar acel număr n-ar însemna nimic: e extrapolarea unui eșantion de cinci furnizori pe o singură fereastră, iar salturile de tarif la vârf sunt evenimente rare, nu o rată continuă. Cifra onestă e cea pe cinci luni. Am lăsat-o neanualizată intenționat.

Și al doilea rând are o excepție care merită spusă. Cel mai ieftin tarif listat din grupul urmărit — 0,05 $ / 0,40 $ la GPT-5 nano — chiar nu s-a mișcat deloc. Dar capătul ieftin al pieței, luat în ansamblu, s-a mișcat: pe 16 august, DeepSeek a scumpit V4-Flash cu 93% în afara orelor de vârf și cu 287% în vârf. Cine își alesese furnizorul cel mai ieftin, nu modelul cel mai ieftin dintr-o listă fixă, a simțit fereastra asta.

Reperul față de care merită citite toate trei: analizele de piață pentru intervalul 2021–2025 măsurau, la capabilitate egală, o scădere mediană de ordinul zecilor de ori pe an, cu un interval foarte larg între sarcini. Oricum ar fi măsurat exact acel interval, ordinul de mărime era „se ieftinește repede”. În cele cinci luni analizate aici, ordinul de mărime este zero — iar la vârf, negativ pentru cumpărător.

6. Lanțul cauzal

Cauza. Memoria de mare viteză lipită lângă procesorul grafic — componenta care ține modelul în timpul rulării — se fabrică de un număr foarte mic de furnizori, iar cererea a depășit ce pot livra. Costul ei a fost trecut mai departe: chiria pe contract de un an pentru acceleratoarele din clasa H100 a urcat de la circa 1,70 $ la circa 2,35 $ pe oră între octombrie 2025 și martie 2026, adică aproape 40%. E vorba de prețul închirierii, nu al cumpărării — furnizorii de modele închiriază, în general, mașinile pe care rulează.

Mecanismul. Chiria s-a scumpit și la nivelul următor. Amazon a majorat cu 15% pe 4 ianuarie 2026 și cu încă circa 20% pe 1 iulie 2026 tariful blocurilor de capacitate rezervată cu procesoare grafice — mecanismul prin care un client își asigură dinainte mașini pentru antrenare sau pentru vârfuri de trafic. Sunt primele scumpiri de acest fel la un furnizor major de infrastructură în aproape două decenii; până acum direcția fusese într-un singur sens. Precizarea contează, fiindcă nu tot ce ține de procesoare grafice s-a scumpit acolo: tarifele la cerere pentru aceleași mașini fuseseră reduse cu până la 45% în iunie 2025. Direcția s-a inversat exact la capacitatea care se rezervă din timp, adică exact acolo unde se simte penuria. Un cost de intrare care crește ridică pragul sub care un tarif de listă nu mai poate coborî.

Efectul. Când costul unitar nu mai scade, un furnizor are două opțiuni. Poate păstra tariful și lăsa modelul vechi pe loc — asta explică cele zece zerouri din tabelul de la punctul 3. Sau poate să scoată capacitatea suplimentară la un preț mai mare, sub un nume nou — asta explică GPT-5.5 la de patru ori prețul lui GPT-5 și un nivel nou deasupra lui Opus. Ambele comportamente se văd simultan, la aceiași furnizori, în aceeași fereastră. Asta e semnătura unei constrângeri de ofertă, nu a unei decizii comerciale izolate.

Există și o a treia opțiune, cea mai brutală: scumpirea modelului aflat deja în ofertă. Un singur furnizor a luat-o în fereastra asta, DeepSeek, și tocmai de aceea contează mai mult decât mărimea lui de piață — a fost singurul care a plătit costul de reputație al unei scumpiri directe, în loc s-o ascundă într-o generație nouă.

7. Contra-ipoteza

Explicația de mai sus poate fi greșită, și există o alternativă serioasă: ieftinirea nu s-a oprit, ci s-a mutat de pe lista de prețuri.

Argumentul e solid, dar cifrele lui cer precizie. Reducerea pentru text deja trimis o dată — memorarea prompturilor — merge până la 90% din tariful de intrare la Anthropic, 75% la Google și 50% la OpenAI, unde 90% se aplică doar pe nivelurile recente. Nu e, deci, un 90% general, cum se citează des. Prelucrarea în loturi, fără răspuns imediat, taie jumătate la toți trei. Iar modelele cu greutăți publice, luate de la un găzduitor terț în loc de la autorul lor, costă cu 50–90% mai puțin — dar asta e o diferență structurală permanentă între două piețe, nu o ieftinire petrecută în fereastra analizată. Sub această citire, prețul efectiv plătit de un client care își optimizează cererile a continuat să scadă, iar tariful de listă a devenit o vitrină pe care nimeni n-o mai actualizează pentru că nimeni nu mai plătește exact atât.

Contra-ipoteza are și două fapte tari de partea ei, amândouă din fereastra analizată. Pe 15 mai, xAI a retras Grok 4 și a trimis numele vechi către un model cu 75% mai ieftin la cost amestecat. Pe 11 august, Anthropic a anulat o scumpire pe care o comunicase deja — trecerea lui Sonnet 5 de la 2 $ / 10 $ la 3 $ / 15 $, programată pentru 1 septembrie — și a făcut tariful introductiv permanent. Un furnizor strâns de o penurie reală nu renunță la o majorare deja anunțată. Cel puțin la Anthropic, în august, presiunea pe costuri nu era suficientă cât să treacă în preț.

Cele două explicații nu se exclud și ambele sunt probabil parțial adevărate. Ce le separă e o observație pe care o poate face oricine: dacă ieftinirea reală ar continua nestingherită, un furnizor ar avea tot interesul s-o afișeze, fiindcă tariful de listă e principalul instrument de comparație între concurenți. Faptul că niciunul dintre cele zece modele rămase listate n-a mai mișcat nimic în cinci luni, într-o piață unde afișarea unei reduceri e gratuită, e greu de explicat doar prin lene de actualizare. Cifra care ar tranșa disputa — costul mediu efectiv plătit pe un milion de tokeni, la nivel de piață — nu e publicată de nimeni.

8. Ce înseamnă practic

  • Reducerea de cost prin așteptare nu mai funcționează. Strategia „scriem aplicația pe modelul scump, prețul oricum scade până la lansare” s-a bazat pe o rată care, în ultimele cinci luni, a fost zero. Bugetul se calculează la prețul de azi.
  • Modelul vechi e opțiunea ieftină, și rămâne. Un model care nu s-a scumpit în cinci luni și pe care furnizorul îl ține listat e cea mai previzibilă linie de cost disponibilă. Riscul nu e prețul, ci retragerea: pe 11 iunie 2026, OpenAI a anunțat scoaterea din interfața de programare, la 11 decembrie 2026, a versiunilor datate din familia GPT-5 — cele fixate la 7 august 2025, plus varianta Pro din 6 octombrie 2025 — înlocuite de GPT-5.6. Un tarif stabil nu ajută dacă modelul dispare.
  • Ora la care trimiți cererea a devenit o variabilă de cost. La DeepSeek, aceeași cerere costă de două ori mai mult între 01:00 și 04:00 și între 06:00 și 10:00 UTC decât în rest. Sarcinile care pot aștepta — rezumate de noapte, reprocesări, indexări — merită programate în afara acelor ferestre. Deocamdată e un singur furnizor, dar e primul care a mutat regula.
  • Saltul la generația nouă e acum o decizie de cost, nu una gratuită. Până în 2025, versiunea nouă venea mai bună și mai ieftină. Din aprilie 2026, la trei dintre cei patru furnizori care și-au înnoit vârful de gamă vine mai bună și mai scumpă — cu până la 127% pe cost amestecat, sau cu 223% dacă tariful promoțional al OpenAI expiră în noiembrie. Merită dovedit că sarcina chiar are nevoie de ea.
  • Un tabel de prețuri scris de mână se strică tăcut. Al nostru a stat greșit patru luni fără să semnaleze nimic. Un tabel care se actualizează singur greșește și el, dar greșește zgomotos.

9. Predicții falsificabile

Fiecare predicție are un orizont explicit, o probabilitate în limbaj calibrat și o sursă publică la care poate fi verificată de oricine. Sunt formulate ca să poată fi contrazise.

PredicțieOrizontProbabilitateCum se verifică
F1. Tariful Claude Opus rămâne 5 $ / 25 $ la un milion de tokeni31 decembrie 2026extrem de probabil (0,82)Pagina publică de tarife Anthropic
F2. Cel puțin 8 din cele 10 modele rămase listate au același tarif ca azi31 decembrie 2026probabil (0,70)Paginile publice de tarife ale celor 6 furnizori
F3. Niciun furnizor major nu scade tariful de listă al unui model existent cu peste 30%31 decembrie 2026mai degrabă probabil decât nu (0,60)Anunțurile publice de tarife
F4. Următorul model de vârf al OpenAI are tarif de intrare de cel puțin 4 $ la un milion de tokeni31 martie 2027probabil (0,68)Pagina publică de tarife OpenAI
F5. Tariful GPT-5.6 Sol depășește 4 $ la intrare după expirarea promoției, pe 21 noiembrie 202631 decembrie 2026mai degrabă probabil decât nu (0,55)Pagina publică de tarife OpenAI
F6. Un al doilea furnizor, după DeepSeek, introduce tarifare diferențiată pe ore de vârf30 iunie 2027mai degrabă improbabil decât probabil (0,35)Paginile publice de tarife
F7. Versiunile datate din familia GPT-5 sunt efectiv scoase din interfața de programare la data anunțată31 decembrie 2026extrem de probabil (0,85)Lista publică de retrageri OpenAI
F8. Chiria pe contract de un an pentru acceleratoare de centru de date nu revine sub nivelul din octombrie 202530 iunie 2027probabil (0,72)Rapoarte publice de piață pentru componente
F9. Niciun furnizor major nu publică costul mediu efectiv plătit pe un milion de tokeni31 decembrie 2026extrem de probabil (0,88)Rapoartele și documentațiile publice ale furnizorilor
F10. Un model lansat după 1 septembrie 2026 intră sub 0,05 $ la un milion de tokeni la intrare, la un furnizor major30 iunie 2027mai degrabă improbabil decât probabil (0,38)Paginile publice de tarife

10. Ce ar invalida analiza

  • Eșantionul. Unsprezece modele, alese pentru că erau pe pagina noastră din aprilie, nu pentru că ar reprezenta piața. Sunt supra-reprezentați furnizorii americani și lipsesc aproape complet modelele deschise găzduite de terți, unde concurența pe preț e cea mai dură.
  • Fereastra. Cinci luni. O singură rundă de scumpiri la vârf poate fi o coincidență de calendar între câteva lansări, nu o schimbare de regim. Aceeași măsurătoare peste șase luni e testul.
  • Tariful de listă nu e factura. Măsurăm ce afișează furnizorii, nu ce plătesc clienții. Reducerile pentru text memorat, loturile și contractele negociate pot deplasa costul real cu un ordin de mărime, iar acele cifre nu sunt publice. Aceasta e contra-ipoteza de la punctul 7 și rămâne netranșată.
  • Tarifele promoționale strică orice serie. Două dintre cele cinci cifre de la punctul 4 sunt prețuri cu termen: promoția OpenAI expiră pe 21 noiembrie 2026, iar tariful Gemini Flash se dublează pe 1 ianuarie 2027. Am ales peste tot cifra plătită azi, care e cea mai mică — dar o măsurătoare făcută în februarie, cu exact aceeași metodă, va da un rezultat sensibil mai mare fără ca nimic din piață să se fi schimbat între timp.
  • Comparația între generații e imperfectă. Când spunem că vârful s-a scumpit cu 72%, comparăm modele cu capabilități diferite. Un model de două ori mai scump care rezolvă de trei ori mai multe sarcini nu e o scumpire pentru cumpărător. Nu avem o măsură independentă a capabilității în care să avem destulă încredere ca să facem acel raport — și, cum arată punctul 2, un clasament prost e mai rău decât niciunul.

11. Surse

Tarife și anunțuri: tarifele publice Anthropic, anunțul reducerii de 67% la Opus, noiembrie 2025, anunțul nivelului nou de peste Opus; anunțul prin care tariful introductiv al lui Sonnet 5 devine permanent; anunțul GPT-5.5, grila de tarife OpenAI (unde e marcat termenul promoției) și lista de retrageri OpenAI; tarifele Gemini, cu datele de la care se schimbă; lista de modele xAI, unde e consemnată retragerea lui Grok 4; tarifele DeepSeek și anunțul majorării din 16 august 2026; tarifele Mistral; tarifele Alibaba Model Studio. Costul infrastructurii: tarifele Amazon pentru blocuri de capacitate cu procesoare grafice.

Verificarea numelor de modele: familia Llama 4 anunțată de Meta (Scout, Maverick, Behemoth — fără 405B). Ritmul istoric al ieftinirii: seria Epoch AI privind evoluția prețurilor de inferență. Cadru de reglementare: Regulamentul UE 2024/1689.

Tabelul auditat este cel din /ai-hub, în forma publicată între 29 aprilie și 3 septembrie 2026. A fost corectat odată cu publicarea acestei analize și afișează de acum, alături de prețul curent, prețul din aprilie și diferența — ca eroarea să rămână vizibilă, nu ștearsă.

Disclaimer: Acest material are scop informativ și analitic. Nu constituie consultanță de investiții, recomandare de achiziție tehnologică sau evaluare juridică. Prețurile citate sunt tarife de listă publicate de furnizori și verificate la 3 septembrie 2026; ele se modifică frecvent și pot diferi semnificativ de costul efectiv facturat, care depinde de reduceri, contracte și modul de utilizare. Probabilitățile sunt estimări explicite, formulate pentru a putea fi contrazise de evenimente, nu certitudini.

Prețul tokenilor AI n-a mai scăzut din aprilie — iar vârful de gamă s-a scumpit cu 72% · olivLaw