Analizy

Czego sztuczna inteligencja nie potrafi? Najnowsze testy pokazują jej ograniczenia

Sztuczna inteligencja rozwiązuje zadania olimpijskie z matematyki, programuje i wykonuje coraz więcej czynności na komputerze. Nadal jednak są zadania, z którymi najnowsze modele mają wyraźne problemy. Testy opublikowane w 2026 roku pokazują ograniczenia między innymi w odczytywaniu zegara, wykonywaniu długich zadań, obsłudze komputera oraz działaniu robotów w rzeczywistym otoczeniu.

Ilustracja do artykułu „Czego sztuczna inteligencja nie potrafi? Najnowsze testy pokazują jej ograniczenia”
Sztuczna inteligencja radzi sobie z coraz trudniejszymi zadaniami, ale nadal ma problemy z częścią prostych czynności, takich jak odczytywanie zegara analogowego. Fot. AIhub24 / grafika wygenerowana przez AI.

Dlaczego to ważne?

Wyniki poszczególnych benchmarków mogą bardzo się od siebie różnić. Model osiągający poziom najlepszych ludzi w jednym teście może uzyskać znacznie słabszy wynik w innym. Przy ocenie możliwości systemów znaczenie ma więc nie tylko najwyższy osiągnięty rezultat, ale również rodzaj zadania i poziom skuteczności.

W tym tekście

Dane opisane w AI Index Report 2026 Uniwersytetu Stanforda pokazują duże różnice między wynikami osiąganymi przez te same systemy w różnych rodzajach testów. Model może uzyskać wynik odpowiadający złotemu medalowi na olimpiadzie matematycznej, a jednocześnie popełniać błędy w znacznie prostszych zadaniach.

Czego sztuczna inteligencja nadal nie potrafi robić niezawodnie?

Nie ma jednej stałej listy czynności niedostępnych dla sztucznej inteligencji. Możliwości kolejnych modeli szybko się zmieniają.

Badania z 2026 roku wskazują jednak kilka obszarów, w których skuteczność systemów nadal jest niższa niż ludzi lub wyraźnie spada wraz ze wzrostem złożoności zadania.

Dotyczy to między innymi rozpoznawania niektórych informacji wizualnych, wykonywania serii czynności na komputerze, długotrwałej pracy nad jednym zadaniem oraz działania robotów poza kontrolowanym środowiskiem.

AI zdobywa złoto z matematyki, ale myli się przy odczytywaniu zegara

Jednym z przykładów przedstawionych przez Stanford jest porównanie wyników z matematyki i testu ClockBench.

W 2025 roku Gemini Deep Think zdobył 35 punktów w zadaniach Międzynarodowej Olimpiady Matematycznej. Taki wynik odpowiadał poziomowi złotego medalu.

Znacznie słabsze wyniki systemy osiągają przy odczytywaniu wskazówek tradycyjnego zegara.

W teście ClockBench najlepszy model poprawnie rozpoznawał godzinę w 50,6 proc. przypadków. Ludzie osiągnęli wynik 90,1 proc.

Stanford używa tego przykładu do opisania zjawiska określanego jako jagged intelligence, czyli nierównomiernego poziomu możliwości w zależności od wykonywanego zadania.

Agenci AI nadal nie wykonują poprawnie około jednej trzeciej zadań na komputerze

Postęp widać również w przypadku agentów, czyli systemów, które mogą samodzielnie wykonywać kolejne czynności w programach i systemach operacyjnych.

Benchmark OSWorld sprawdza takie systemy na rzeczywistych zadaniach wykonywanych na komputerze.

Według Stanforda skuteczność najlepszych agentów wzrosła z około 12 proc. do 66,3 proc. Wynik znalazł się w granicach sześciu punktów procentowych od rezultatu osiąganego przez ludzi.

Oznacza to jednocześnie, że w tym benchmarku około jedna trzecia prób nadal kończy się niepowodzeniem.

Roboty mają znacznie większe problemy w prawdziwym domu

Dużą różnicę w wynikach widać również w robotyce.

W RLBench, który sprawdza manipulowanie przedmiotami w symulowanym środowisku, skuteczność systemów osiągnęła 89,4 proc.

W przypadku rzeczywistych zadań domowych wynik podawany przez Stanford wynosi natomiast około 12 proc. Testy obejmują między innymi czynności takie jak składanie ubrań czy zmywanie naczyń.

Raport wskazuje na różnicę między kontrolowanym środowiskiem testowym a warunkami występującymi w rzeczywistych mieszkaniach.

Długie zadania nadal obniżają skuteczność modeli

Możliwości agentów bada również organizacja METR.

Stosowana przez nią metoda mierzy tak zwany time horizon. Jest to poziom trudności zadania wyrażony czasem, którego ludzki ekspert potrzebowałby na jego wykonanie.

Według danych METR z maja 2026 roku publicznie dostępne modele na granicy możliwości osiągały około 12-godzinny 50-procentowy time horizon w zestawie zadań programistycznych.

Nie oznacza to, że system pracuje autonomicznie przez 12 godzin.

METR wyjaśnia, że chodzi o zadanie, którego wykonanie człowiekowi zajmuje około 12 godzin i przy którym model ma szacowane 50 proc. prawdopodobieństwa powodzenia. Same modele wykonują część takich zadań szybciej od ludzi.

Organizacja podaje też szeroki przedział niepewności dla tego wyniku, od około 5 do 61 godzin. METR zaznacza, że najtrudniejsze zadania zaczynają już przekraczać możliwości obecnego zestawu testowego, co utrudnia dokładne pomiary.

Sztuczna inteligencja nadal popełnia błędy w specjalistycznych zadaniach

AI Index 2026 obejmuje także testy dotyczące podatków, kredytów hipotecznych, finansów przedsiębiorstw i rozumowania prawnego.

W zależności od benchmarku czołowe modele osiągają w tych dziedzinach wyniki od około 60 do 90 proc.

Raport Stanforda zwraca też uwagę na problemy z samymi testami. Analiza popularnych benchmarków wykazała od 2 do 42 proc. nieprawidłowych pytań, w zależności od zestawu.

Dlatego pojedynczy wynik benchmarku nie opisuje wszystkich możliwości danego systemu.

Czy sztuczna inteligencja potrafi zrobić wszystko, co człowiek?

Nie. Wyniki badań z 2026 roku pokazują, że możliwości zależą od rodzaju zadania.

Systemy osiągają bardzo wysokie wyniki między innymi w części testów matematycznych i naukowych. Jednocześnie ich skuteczność pozostaje niższa przy niektórych zadaniach wizualnych, obsłudze komputera, wykonywaniu długich sekwencji czynności oraz pracy robotów w rzeczywistym środowisku.

Zakres tych ograniczeń zmienia się wraz z pojawianiem się nowych modeli.