Dlaczego to ważne?
Modele AI osiągają coraz lepsze wyniki w zadaniach wykonywanych dotąd przez ludzi. Jednocześnie ich skuteczność bardzo różni się w zależności od rodzaju zadania. Wynik jednego benchmarku nie pokazuje więc możliwości systemu we wszystkich zastosowaniach.
W tym tekście
- AI zdobyła „złoto” na olimpiadzie matematycznej
- W jakich zadaniach sztuczna inteligencja przewyższa człowieka?
- AI radzi sobie z coraz dłuższymi zadaniami
- Czy sztuczna inteligencja ma większą wiedzę niż człowiek?
- Czy AI ma wyższe IQ od człowieka?
- Czy sztuczna inteligencja jest więc mądrzejsza od człowieka?
Dane z AI Index Report 2026, przygotowanego przez Stanford Institute for Human-Centered Artificial Intelligence, pokazują szybki wzrost możliwości najnowszych modeli. W ciągu roku wyniki na benchmarku Humanity’s Last Exam wzrosły o około 30 punktów procentowych. Test powstał po to, by sprawdzać modele na trudnych pytaniach wymagających specjalistycznej wiedzy.
Autorzy raportu zwracają uwagę, że część benchmarków jest obecnie pokonywana szybciej, niż zakładali ich twórcy.
AI zdobyła „złoto” na olimpiadzie matematycznej
Jednym z najbardziej konkretnych przykładów jest wynik systemu Gemini Deep Think w zadaniach z Międzynarodowej Olimpiady Matematycznej.
W 2025 roku model zdobył 35 punktów, co odpowiadało progowi złotego medalu. Zadania rozwiązywał w języku naturalnym i w oficjalnym limicie czasu wynoszącym 4,5 godziny. Rok wcześniej najlepszy wynik systemu Google’a odpowiadał srebrnemu medalowi.
Nie oznacza to jednak, że ten sam poziom skuteczności pojawia się w każdym rodzaju zadania.
Raport Stanforda zestawia wynik matematyczny z rezultatami testu ClockBench, który sprawdza między innymi odczytywanie czasu z zegara analogowego. Najlepszy model uwzględniony w raporcie osiągnął 50,6 proc. poprawnych odpowiedzi. Wynik ludzi wynosił 90,7 proc.
W Stanfordzie takie różnice opisano jako przykład jagged intelligence, czyli nierównomiernego rozwoju możliwości systemów.
W jakich zadaniach sztuczna inteligencja przewyższa człowieka?
Nie ma jednego testu pozwalającego porównać człowieka ze sztuczną inteligencją.
Wyniki zależą przede wszystkim od rodzaju zadania. Obecne modele osiągają wysokie rezultaty między innymi w matematyce, programowaniu, analizie tekstu, rozpoznawaniu obrazów oraz części testów dotyczących wiedzy specjalistycznej.
Stanford podaje również, że systemy stosowane w testach dotyczących między innymi podatków, kredytów hipotecznych, finansów przedsiębiorstw i rozumowania prawniczego osiągają wyniki od około 60 do 90 proc., zależnie od dziedziny i używanego benchmarku.
Rosną też możliwości agentów, czyli systemów wykonujących serię czynności na komputerze.
W benchmarku OSWorld, który sprawdza wykonywanie rzeczywistych zadań w systemach operacyjnych, skuteczność najlepszych systemów wzrosła z około 12 proc. do około 66 proc. Nadal oznacza to niepowodzenie mniej więcej jednej na trzy próby.
AI radzi sobie z coraz dłuższymi zadaniami
Inny sposób mierzenia możliwości modeli stosuje organizacja badawcza METR.
Zamiast sprawdzać tylko krótkie pytania, badacze analizują, jak długie zadanie może samodzielnie wykonać agent. Punktem odniesienia jest czas potrzebny ludzkiemu specjaliście na wykonanie tej samej pracy.
Testy obejmują przede wszystkim programowanie, uczenie maszynowe i cyberbezpieczeństwo.
METR podał w maju 2026 roku, że publicznie dostępne czołowe modele osiągnęły w używanym zestawie zadań 50-procentowy horyzont wynoszący około 12 godzin. Oznacza to, że przy zadaniach wymagających od ludzkiego eksperta około 12 godzin pracy model miał według zastosowanej metodologii około 50 proc. szans na ich ukończenie.
Badacze zaznaczają, że nie oznacza to automatyzacji dwunastogodzinnego dnia pracy.
Zestaw METR składa się przede wszystkim z dobrze określonych zadań technicznych. W zwykłej pracy dochodzą dodatkowo rozmowy z ludźmi, niepełne informacje, zmiana wymagań i decyzje, których poprawności nie można łatwo zmierzyć.
Czy sztuczna inteligencja ma większą wiedzę niż człowiek?
Modele językowe są trenowane na bardzo dużych zbiorach danych i mogą korzystać z informacji z wielu dziedzin jednocześnie. Nie jest to jednak równoznaczne z bezbłędną pamięcią ani gwarancją prawdziwości odpowiedzi.
System może poprawnie rozwiązać trudne zadanie matematyczne, a następnie podać błędny fakt lub stworzyć nieistniejące źródło.
Dlatego wyniki benchmarków mierzą określone umiejętności, a nie jedną uniwersalną inteligencję.
Także same benchmarki mają ograniczenia. W AI Index 2026 opisano analizy, w których odsetek wadliwych pytań w popularnych zestawach testowych wynosił od 2 do 42 proc., zależnie od benchmarku.
Czy AI ma wyższe IQ od człowieka?
Wyników modeli w testach IQ nie można bezpośrednio porównywać z wynikami ludzi.
Testy inteligencji zostały opracowane dla człowieka, podczas gdy modele uczą się na dużych zbiorach tekstów i mogą wcześniej zetknąć się z podobnymi typami zadań.
Z tego powodu badacze wykorzystują wiele różnych benchmarków zamiast jednej wartości odpowiadającej ludzkiemu IQ.
Czy sztuczna inteligencja jest więc mądrzejsza od człowieka?
W części konkretnych zadań tak.
Modele osiągają już wyniki przekraczające przeciętny poziom człowieka, a w niektórych przypadkach również poziom ekspertów. Dotyczy to między innymi części zadań matematycznych, programistycznych i analitycznych.
Nie ma jednak obecnie podstaw do stwierdzenia, że sztuczna inteligencja przewyższa człowieka we wszystkich rodzajach zadań.
Te same systemy, które rozwiązują problemy olimpijskie, nadal popełniają błędy przy odczytywaniu zegara, pracy w komputerowym interfejsie czy realizowaniu długich zadań wymagających wielu kolejnych decyzji.
Werdykt AIHub24
Na dziś odpowiedź jest prosta: sztuczna inteligencja nie jest po prostu „mądrzejsza od człowieka”. W niektórych zadaniach potrafi już zawstydzić najlepszych specjalistów, w innych wciąż wykłada się na rzeczach, które dla przeciętnej osoby są banalne.
Najuczciwiej powiedzieć tak: AI ma już nad człowiekiem przewagę punktową, ale nie ogólną. Wygrywa szybkością, skalą i coraz częściej także poziomem wykonania konkretnych zadań. Człowiek nadal jest znacznie bardziej uniwersalny.
I to właśnie jest dziś najciekawsze. Nie obserwujemy momentu, w którym maszyna nagle „stała się mądrzejsza od człowieka”. Obserwujemy raczej, jak kolejne obszary ludzkiej przewagi po prostu znikają.
