Kilka rzeczy, które warto wiedzieć o najnowszej premierze GPT-5, a o których ewangeliści nie mówią:

  1. GPT-5 nie jest jednym modelem. To, co poza kontekstem API nazywa się GPT-5, jest routerem, który przekazuje twoje zapytanie do modelu mającego, jego zdaniem, obsłużyć je najefektywniej. W tym świetle trzeba patrzeć na obietnicę OpenAI o dostępie dla wszystkich. Dają dostęp do routera, a ty nie znasz konkretnej konfiguracji, którą ci przydzielono, ani tego, czy faktycznie uda ci się przetestować najpotężniejszy model. To bez wątpienia sprawi, że doświadczenia różnych użytkowników będą zupełnie różne.

  2. GPT-5 nie jest doktorem nauk. To całkiem zdolny model (a przynajmniej jeden z nich jest), który błyszczy w niektórych zadaniach. Można oczekiwać poprawy w:

    • zdolnościach kodowania (robią wrażenie według części vibe testów, ale według benchmarku SWE-bench Verified przewaga nad Claude Opus 4.1 jest minimalna);
    • wywoływaniu narzędzi, co ma największe znaczenie dla obciążeń agentowych;
    • innych zadaniach, w których OpenAI miało dostęp do natychmiastowego feedbacku.

    To ważne usprawnienia dla wielu dziedzin, ale nie czynią one z modelu doktora nauk. Halucynacja o profilu skrzydła podczas demo doskonale pokazuje, że model wciąż internalizuje przekonanie najpowszechniejsze, a nie najbardziej aktualne. To bardzo trudny problem do rozwiązania i w gruncie rzeczy poważna przeszkoda na drodze do AGI.

  3. Mniej halucynacji to broń obosieczna. Z jednej strony im mniej model halucynuje, tym lepiej, bo można mu bardziej ufać. Z drugiej strony im bardziej ufasz modelowi, tym łatwiej przegapisz faktyczne halucynacje. W realnym świecie najlepszy jest model, który nie halucynuje nigdy. Model halucynujący w 0,01% przypadków może być groźniejszy od takiego, który halucynuje w 10% przypadków.

Moje osobiste wrażenie jak dotąd jest takie, że ma on wciąż tę samą przypadłość co poprzednie modele OpenAI: bez starannego promptowania jest naprawdę powierzchowny. Serwuje najpłytszą analizę, jaka mu ujdzie na sucho, i maskuje ten fakt bardzo dobrze ustrukturyzowanymi odpowiedziami.