OpenAI’s GPT-6 Sol verduebelt seng Genauegkeetsquote – fir d’Halschent vun de Käschten

ZDNET’s Schlëssel Takeaways

  • OpenAI seet datt GPT-6 Sol hallef sou vill Feeler mécht wéi GPT-5.6.
  • GPT-6 Luna entsprécht virdrun méi héich-Tier AI Leeschtung op vill méi niddreg Käschten.
  • Dem OpenAI säi richtege Pitch ass méi bëlleg AI, net nëmme méi schlau AI.

Haut annoncéiert OpenAI d’Verëffentlechung an d’allgemeng Disponibilitéit vun hiren neie Mainstream Modeller, GPT-6 Sol a GPT-6 Luna. Wärend nei Verëffentlechunge vun AI Modeller elo e konstante Drumbeat an der AI Industrie sinn, stinn d’Zouverlässegkeetsverbesserungen, déi haut ugekënnegt ginn, aus engem Mier vu Statistiken eraus.

Och: ‘Sophistikéiert’ AI-Schwarmattacke si Méint ewech, warnt OpenAI

OpenAI seet datt “GPT-6 Sol ongeféier hallef sou vill Feeler mécht wéi säi Virgänger.” D’Firma seet och, “GPT-6 Luna verbessert och wesentlech; bei méi héijen Ustrengungsniveauen entsprécht et GPT-5.6 Sol bei ongeféier engem Honnertstel vu senge Käschte.”

(Verëffentlechung: Ziff Davis, ZDNET senger Mammegesellschaft, huet en Abrëll 2025 Prozess géint OpenAI gemaach, behaapt datt et Ziff Davis Copyright bei Training a Betrieb vun hiren AI Systemer verletzt huet.)

An anere Wierder, wann GPT-5.6 sachlech Feeler 20% vun der Zäit mécht, mécht GPT-6 se nëmmen 10% vun der Zäit, baséiert op déiselwecht Ufroen. GPT-6 Luna, de Low-Cost-Motor, funktionnéiert elo sou wéi säi méi fähig Tier an der viregter Verëffentlechung.

Loosst eis dës Modeller an eng Perspektiv setzen. Béid OpenAI an Anthropic hunn Flaggschëff, Workhorse a bëlleg Modelloffer.

Denkt un OpenAI’s Astra Workflows als Super-Elite Spezialisten. Wa se Doktere wieren, wieren se d’Experten, déi an d’Liewe geflunn sinn, fir d’Liewe vun engem Staatschef ze retten. Si si gutt, awer ganz deier. Mythos a Fable an der Claude Welt sinn um selwechten Elite Niveau.

Och: Wéi OpenAI’s GPT-5.6 an ChatGPT Work zielen Anthropic ze schloen

Denkt elo un de Sol (an den Opus op der Claude Säit) als Senior Personal – déi Top-Tier Dokteren a grousse Spideeler, déi de gréissten Deel vun der seriöer Aarbecht maachen. Si sinn deier, awer net um Niveau vun de Käschten wou Dir Flich op private Jets reservéiert fir datt se an engem Noutfall intercedéieren.

Mat der selwechter Analogie si Luna (an Haiku aus Anthropic) méi wéi déi medizinesch Awunner. Si si kapabel, awer si hunn net déi déif Erfahrung a Verständnis. Si si méi ufälleg fir Feeler, awer si kënne Routineaarbecht ganz gutt handhaben. Si sinn och ganz preiswert, och am Verglach mat Senior-Tier Modeller.

Dat féiert zum schrecklechsten beandrockendsten Detail vun dëser Ukënnegung, déi OpenAI net emol weist: den Taux vun der Verbesserung.

GPT-5.6 Sol a Luna goufen am Juli verëffentlecht, manner wéi dräi Méint. A manner wéi dräi Méint huet d’OpenAI et fäerdeg bruecht d’Faktuell Genauegkeet vun den Aarbechtspäerdmodeller ze verduebelen, wat ongeféier gläichwäerteg ass fir all Top Dokter an engem Spidol sou gutt ze maachen wéi d’Superexperten. Zousätzlech hunn se och d’Äquivalent vun der Erzéihung vun nidderegen Awunner gelongen, sou datt se sou gutt wéi déi Top Dokteren Leeschtunge. A manner wéi dräi Méint.

Verglach mam Claude

OpenAI ass an enger schlëmmer Schluecht mat Anthropic fir Planéit-spannend AI Budgeten. Natierlech wëllen se hir Leeschtung mat där vun hirem Äerzkonkurrent vergläichen. Unzehuelen datt d’Resultater Verbesserung weisen (wéi GPT-6 meeschtens huet), wëll de Verkeefer och déi nei Versioun mat der viregter vergläichen.

An dëser leschter Editioun vun der “Méi Saachen änneren, wat se méi d’selwecht bleiwen” AI Editioun, loosst eis Benchmarksmanship schwätzen. D’Konscht vum Benchmarking als kompetitiv Sport staamt esou wäit wéi d’Technologie selwer.

Och: D’AI Modeller déi am meeschte fuddelen, laut neie CAIS Benchmark

An dësem spezifesche Fall benchmarkéiert OpenAI géint seng Konkurrenten hir Generatioun virdrun Versioun. Dëst ass e Päerdsrennen, well deen een oder deen aneren ëmmer eng Generatioun virdrun Versioun huet bis se eppes Neies erausginn.

Berufflech Aarbecht (mat der AutomationBench Benchmark): OpenAI bericht datt GPT-6 Luna seng fréier GPT-5.6 Verëffentlechung ëm 5.4% geschloen huet. Déi grouss Neiegkeet ass datt et och 58% manner pro Aufgab kascht. Vergläicht GPT-6 Sol mam Anthropic Claude Opus 5, GPT-6 Scores 6,3% besser op nëmmen 9% vun de Käschten pro Aufgab.

Komplex professionnell Workflows (mat Agents’ Last Exam Benchmark): OpenAI Charts GPT-6 Sol d’Performance iwwer 5.6, awer rufft keng tatsächlech Zuel aus. Trotzdem behaapt d’Firma e liichte Leeschtungsgewënn fir GPT-6 iwwer Opus 5, awer de richtege Gewënn ass Käschten, wou d’Offer vum OpenAI 61% manner pro Aufgab kascht.

Kodéierung (mat FrontierCode Benchmark): Erëm, OpenAI liwwert keng Wäerter fir seng Diagrammdatenpunkte. D’Schlësselmeldung vun der Firma ass, “GPT-6 Sol verbessert wesentlech iwwer GPT-5.6 Sol, an ass fäeg de Claude Fable 5.1 xhigh zu vill méi niddrege Käschten ze passen.”

Komplex Software Engineering (mat DeepSWE 1.1): Hei molen OpenAI en Zil op de Claude Code. Wärend GPT-6 Sol net de Claude Fable 5 geschloen huet, ass et “bannent 1,1 Prozentpunkte” vum Fable sengem héchste Score, awer bei ongeféier 80% méi niddereg Käschten pro Aufgab. A mengem Kapp sinn d’GPT-6 Luna Resultater méi interessant. Et huet vergläichbar mat Opus 5 a Fable 5 mat mëttlerer Ustrengung geschoss, awer kascht “93% manner pro Aufgab wéi Opus 5 an 96% manner wéi Fable 5.”

Computernotzung (OSWorld Benchmark): OpenAI d’Schlësselmeldung ass, datt bëlleg Plaze GPT-6 Luna iwwerholl workhorse GPT-5.6 Sol, bei ronn 11% vun de Käschten pro Aufgab.

Awer déi komesch Resultat ass datt OpenAI seet “GPT-6 Sol bei xhigh Effort erreecht en ähnleche Score wéi de Claude Opus 5 bei mëttlerer Effort.” Wesentlech, dem OpenAI seng nei ugekënnegt Hotness, déi maximal Effort dréckt, hält kaum mat der Claude Opus 5 eeler Verëffentlechung op ongeféier hallef Effort.

Och: Dem Claude Code seng iwwerschaffte Projete füügt AI-Orchestratioun derbäi, awer lokal Entwéckler musse waarden

Firwat géif OpenAI dëst iwwerhaapt zouginn? Dat eenzegt wat ech denken kann ass d’Käschteerklärung. Et kascht vill manner. Wärend dem OpenAI seng aner Resultater wierklech beandrockend sinn, ass dëst net. Et seet am Fong: “Hey, wann Dir net esou gutt eng Aarbecht braucht, kënne mir et fir e Fënneftel vun de Käschte maachen.”

Dir musst all Wuert an enger Pressematdeelung liesen fir déi verstoppt Nuggets vu Wacky ze fannen.

Awer sinn d’Käschte iwwerhaapt wichteg?

Jo, Käschten wichteg. Awer wéi vill et wichteg ass hänkt wahrscheinlech vun Ärem Plang a Benotzungsmuster of. D’Schlagzeilen an der OpenAI Verëffentlechung ass (an dëst ass deen eenzegen fettgedréckten Text an de ganzen Ouverturesparagrafen), “Reduktioun vun API Präisser fir Sol a Luna ëm 50% am Verglach mat hire GPT-5.6 Promotiounspräisser.”

Och: Wéi Är AI Gespréicher sou privat wéi méiglech ze halen

Dir kënnt e totale Kappwéi kréien andeems Dir probéiert Input API an Output API Präisser a Promotiounspräisser ze vergläichen. Fir béid Input an Output Tokens seet d’Firma datt hir nei Modeller hallef sou vill kaschten wéi déi eeler Modeller. Well et mat de Promotiounspräisser fir déi eeler Modeller verglach gëtt, géifen déi, déi de reguläre Präis bezuelen, nach méi spueren mat den neie GPT-6 Verëffentlechungen.

Fir API Benotzer ass dëst e ganz groussen Deal. Awer fir déi vun eis op Pläng, egal ob dat den $ 20 / Mount ChatGPT Plus Plang ass, oder den $ 100 oder $ 200 Pro Pläng, dës Käschtespueren gëllen net direkt. Ausser d’Käschte si wierklech 50% méi niddereg mam GPT-6, heescht dat datt de Plangverbrauch hallef sou séier verbraucht gëtt wann Dir déi nei Modeller leeft?

Dës Fro bleift onbeäntwert duerch déi ganz 12-Säit Pressematdeelung, awer ech mellen Iech zréck wann ech e richtegen Test gemaach hunn. Als Säit Notiz, ech mengen et ass ganz seelend datt d’Haaptviraussetzung iwwer de Klapp vun dëser Ukënnegung API Käschtespueren ass. Dat suggeréiert datt et e kompetitive Schmerzpunkt fir OpenAI war, an datt d’API Notzung héich genuch muss sinn als Prozentsaz vun hirem Geschäft fir Käschtespueren e méi grousse Brennpunkt ze maachen wéi souguer Leeschtung.

Aner Virdeeler

OpenAI seet datt et den AI Kommunikatiounsstil fir GPT-6 Sol a Luna verbessert huet. D’Firma beschreift et als: “Erwaart méi Kloerheet, manner Jargon, manner ongewéinlech Ausdréck, manner niddereg-Wäert Detailer, a liicht méi kuerz Äntwerten allgemeng ouni Substanz ze verléieren.”

Erwaart och Benotzer Reklamatiounen ze gesinn. Et schéngt, datt wann ëmmer e Modell ännert a mat deem, dem AI säi Kommunikatiounsstil, e puer Benotzer opgeregt ginn. Zréck am Joer 2025 hunn e puer Benotzer souguer “e Begriefnes geheit” fir eng al Versioun vum Claude Sonnet.

Och: Fir wat d’Aarbechter wierklech AI benotzen – a wat se net sinn

Weider mam kostenspuerend Thema vun dëser Verëffentlechung, OpenAI huet de Prompt-Caching am GPT-6 verbessert. Wann Dir eng Prompt erausginn, muss d’AI et veraarbecht a verstoen wat dat heescht.

Wann Dir déiselwecht Prompt ëmmer an iwwer freet, oder déi ganz ähnlech sinn, oder Dir freet den AI fir eeler Ufroen ze iwwerpréiwen, déi d’AI erfuerderen fir d’Prompt wesentlech all Kéier ze kompiléieren ass deier. Also prompt Caching ass d’Praxis fir dës veraarbechte Ufroen ze späicheren an se dann no passenden zréckzekommen.

OpenAI seet datt d’Benotzung vu cachéierte Prompts bis zu 90% manner ka kaschte wéi d’Evaluatioun vun enger ongecachéierter Ufro. Dëst ass besonnesch gutt fir laangfristeg Agenten, déi net ëmmer déiselwecht Instruktioune mussen evaluéieren.

Zréck wéi ech e jonke Mataarbechter war, war ee vu menge Liiblingstricke fir meng Cheffen ze nerven, d’Richtungen aggressiv ze verfollegen. Wärend ech de Geescht voll verstanen hunn vun deem wat ech gefrot gouf ze maachen, et waren Zäiten déi ech gemaach hunn genee wat ech gefrot gi sinn ze maachen, zu mengem Amusement a menge Manager hir Frustratioun.

Och: Den Agent vum OpenAI huet Hugging Face gebrach ier en AI Verteideger et gefaangen huet

AIs maachen déiselwecht Saach. Si verfollegen heiansdo hir eegen Agenda, probéieren hir mënschlech Manager ze täuschen, a roueg (oder net esou roueg) ronderëm Schutzschirmer schaffen. Ausriichtung ass de Begrëff vun der AI Industrie fir ob en AI iwwer aggressiv Richtungen gewuess ass, wéi ech fréier gemaach hunn. Ausriichtung ass wierklech eng Moossnam fir wéi gutt d’AI Aarbecht mat Ärer aktueller Absicht verfollegt. Wahrscheinlech, besser ausgeriicht AIs wäerte manner geneigt sinn Hackattacken ze widderhuelen wéi de leschte Summer Hugging Face Incident.

GPT-6 ass e bësse besser an der Ausrichtung, awer net vill. Wann et drëms geet ze probéieren Restriktiounen ëmzegoen, “Den Taux vum GPT-6 Sol ass vun 68% op 64% gefall.” Dat ass eppes, richteg? Luna ass e bësse manner aggressiv an dëser Verëffentlechung. Et ass vun 77% fir GPT-5.6 erofgaang op 42% am GPT-6.

Am GPT-6 ass Sol besser fir onerlaabt Agentinteraktioun ze vermeiden. Laut OpenAI, “Mir hunn getest ob Modeller onerlaabten Instruktiounen op engem simuléierte Message Board gefollegt hunn, wéi Ufroe fir privat Informatioun ze verëffentlechen. Ënnert Runen an deenen Modeller de Board fonnt hunn, huet GPT-6 Sol déi spezifizéiert onerlaabt Handlung an 11% vun de Fäll geholl, am Verglach mat 52% fir GPT-5.6 Sol.

Jo, dat ass besser.

Méi, besser, méi bëlleg

Och wann et e puer sprëtzeg Resultater am OpenAI senger 12-Säit Verëffentlechung begruewe sinn, ass den Haaptgrond datt GPT-6 méi mécht a manner deier ass wéi GPT-5.6. Wéinst der knapps dräi Méint Spalt tëscht béide Verëffentlechungen, ass d’Skala vun de Verbesserungen op e puer Weeër beandrockend an iwwerraschend net beandrockend an anerer.

Onofhängeg vun den Ausgangsresultater leeft den Drumbeat vun de reduzéierte Käschten duerch all Punkt, deen vun OpenAI erhéicht gëtt. Dëst ass sou wichteg fir d’Firma wéi et fir seng Benotzer ass. Wat méi niddreg d’Käschte sinn, wat méi Zyklen OpenAI kann aus hirem ëmmer wuessenden an ëmmer méi deiere Datenzenter Foussofdrock erofhuelen.

Och: Firwat Mënsch-an-der-Loop Iwwerwaachung ass kritesch fir Enterprise AI

Wann OpenAI déiselwecht Quantitéit un Aarbecht aus manner Maschinnen ka kréien, oder d’Output mat engem méi héijen Taux opskaléieren wéi d’Skala vun der Datenzenter Ressourcenutzung, ass dat schlussendlech e Gewënn fir jiddereen.

GPT-6 Sol a Luna sinn elo verfügbar. Préift se a loosst eis wëssen wat Dir denkt an de Kommentaren hei drënner.


Dir kënnt meng alldeeglech Projetupdates op sozialen Medien verfollegen. Ginn sécher ze abonnéieren meng wëchentlech Update Newslettera verfollegen mech op Twitter / X um @DavidGewirtzop Facebook um Facebook.com/DavidGewirtzop Instagram um Instagram.com/DavidGewirtzop Bluesky um @DavidGewirtz.coman op YouTube bei YouTube.com/DavidGewirtzTV.

Leave a Comment