Przejdź do treści

GARIN AI Spółka Akcyjna

Strona główna » Agenty AI uczą się pytać: mniej mocy, więcej rozumu

Agenty AI uczą się pytać: mniej mocy, więcej rozumu

W testach opartych na „Battleship” okazało się, że o skuteczności agentów AI decyduje nie rozmiar modelu, lecz jakość zadawanych pytań i umiejętność weryfikacji odpowiedzi. To ważna lekcja dla zastosowań w nauce i medycynie.

Dlaczego agenty AI potykają się w niepewności

W 2026 roku „agenty AI” stały się hasłem wytrychem: mają planować, wykonywać zadania i samodzielnie dochodzić do celu. W praktyce wiele z nich świetnie radzi sobie tam, gdzie problem jest dobrze opisany, a sukces zależy od sprawnego generowania odpowiedzi. Schody zaczynają się w środowiskach niepewnych, gdy trzeba najpierw ustalić, jakie informacje w ogóle są potrzebne.

To różnica kluczowa dla obszarów wysokiego ryzyka, takich jak diagnostyka medyczna czy odkrycia naukowe. Tam nie wystarczy „ładnie odpowiedzieć” — trzeba umieć prowadzić dochodzenie: zadawać pytania, które maksymalizują przyrost wiedzy, oraz aktualizować hipotezy po każdej nowej wskazówce. Modele językowe często przegrywają właśnie na tym etapie: nie dlatego, że nie znają faktów, ale dlatego, że słabo eksplorują przestrzeń możliwości.

„Battleship” jako laboratorium zadawania pytań

Do zbadania tego problemu wykorzystano klasyczną grę w statki, od lat używaną w naukach poznawczych do analizy tego, jak ludzie szukają informacji. Wersja badawcza została jednak przebudowana: zamiast standardowych strzałów pojawiły się pytania w języku naturalnym, a rozgrywka stała się współpracą dwóch ról.

W wariancie „Collaborative Battleship” jedna strona — „kapitan” — formułuje pytania o położenie ukrytych statków, a druga — „obserwator” — odpowiada na bieżąco „tak/nie” lub w sposób zgodny z regułami gry. Najpierw w takiej formule zagrało ponad 40 osób, co pozwoliło zebrać realne, ludzkie strategie dociekania i zbudować zestaw danych „BattleshipQA”. To ważne, bo daje punkt odniesienia: nie tylko wynik końcowy, ale też jakość pytań.

Duże modele wygrywają, ale nie zawsze „rozumują”

Gdy do gry wpuszczono współczesne modele językowe — zarówno bardzo duże, jak i mniejsze — okazało się, że czołówka potrafi pokonać ludzi, kończąc rozgrywkę w mniejszej liczbie tur. Jednocześnie mniejsze modele wypadały wyraźnie gorzej, a ich zachowanie bywało mało „racjonalne”: zadawały pytania, które nie zawężały sensownie poszukiwań.

To odsłoniło sedno problemu: w takich zadaniach nie liczy się wyłącznie zdolność generowania poprawnych zdań, lecz umiejętność projektowania pytań. Jeśli pytanie nie rozdziela dobrze możliwych scenariuszy, agent marnuje tury, a w realnych zastosowaniach — czas, pieniądze i margines bezpieczeństwa. W tym sensie „inteligencja” ujawnia się nie w odpowiedzi, lecz w tym, co agent postanawia sprawdzić.

Monte Carlo i „model świata”: jak uczyć dociekania

Przełom przyniosło dołożenie do modeli strategii wnioskowania typu Monte Carlo. W uproszczeniu: zamiast trzymać się jednej intuicji, agent utrzymuje wiele konkurencyjnych hipotez o układzie statków, a po każdej odpowiedzi aktualizuje ich prawdopodobieństwa. To przypomina ważenie scenariuszy: te zgodne z nową informacją „rosną w siłę”, a sprzeczne są odrzucane.

Takie podejście działa jak prowizoryczny „model świata” — mechanizm symulowania, co jest możliwe, a co mniej prawdopodobne. Efekt był jednoznaczny: modele, niezależnie od skali, zaczęły zadawać pytania bardziej informacyjne, czyli takie, które szybciej redukują niepewność. To ważna wskazówka dla projektowania agentów AI: sama skala modelu nie zastąpi procedury eksploracji.

Mały model, duży skok i rachunek ekonomiczny

Najmocniej wybrzmiał przypadek małego modelu, który przed usprawnieniami wygrywał z ludźmi rzadko (około 8% gier). Po dopracowaniu strategii wnioskowania jego skuteczność wzrosła do około 82% w starciach z ludzkimi graczami. Co więcej, taki „odchudzony” agent potrafił wyprzedzić model z absolutnej czołówki, działając przy kosztach rzędu 1% tego, co wymagał większy konkurent.

To nie jest tylko ciekawostka z gier. W praktyce wdrożeniowej koszt wnioskowania bywa barierą równie twardą jak jakość: jeśli podobny poziom skuteczności da się uzyskać mniejszym modelem wspartym lepszą metodą eksploracji, zmienia to ekonomię agentów AI w firmach, administracji czy edukacji. Zamiast „większy = lepszy” pojawia się „sprytniejszy = tańszy i wystarczająco dobry”.

Problem obserwatora: odpowiadanie też wymaga dyscypliny

Badacze zauważyli też drugą słabość: nie tylko pytania bywają nietrafione, ale i odpowiedzi generowane przez mniejsze modele potrafią być błędne. W roli „obserwatora” część systemów myliła się w ocenie, czy dany układ jest zgodny z planszą, co wprowadzało kapitana w błąd i psuło cały proces.

Rozwiązaniem okazało się „auto-formalizowanie” pytań, czyli automatyczne tłumaczenie ich na kod w Pythonie, który jednoznacznie instruuje model, jak sprawdzić odpowiedź. Zamiast zgadywać, system wykonuje prostą procedurę weryfikacji (np. przeszukanie wskazanego obszaru planszy). Średnio podniosło to trafność odpowiedzi o około 15%, a w niektórych przypadkach poprawa była jeszcze większa.

Czy to działa poza „Battleship”? Test w „Guess Who?”

Żeby sprawdzić, czy to nie jednorazowy trik, podejście przetestowano także w „Guess Who?”, gdzie celem jest zawężanie listy 100 postaci poprzez pytania o cechy. Tu również widać było, że po usprawnieniach modele szybciej i pewniej eliminują niemożliwe opcje: mniejszy model podniósł skuteczność z około 30% do ponad 72%, a większy z okolic 62% do około 90%.

Warto jednak zachować proporcje. Gry planszowe są kontrolowanym środowiskiem: reguły są jasne, a „prawda” jest w pełni określona przez stan gry. To świetny poligon do badania eksploracji, ale w medycynie czy nauce dochodzi szum danych, niekompletność obserwacji, a czasem brak jednoznacznej odpowiedzi. Wyniki sugerują kierunek, nie gwarancję.

Wąskie gardło agentów AI: pragmatyka i współpraca

Najciekawszy wniosek wykracza poza statystyki wygranych. W miarę jak agenty AI stają się bardziej samodzielne, rośnie znaczenie problemów „społecznych”: utrzymywania wspólnego kontekstu, wykrywania nieporozumień i dopasowywania stylu komunikacji do partnera. Nawet idealnie „optymalne” pytanie może być bezużyteczne, jeśli druga strona zinterpretuje je inaczej, odpowie nieprecyzyjnie lub pominie założenia.

Dlatego przeniesienie ciężaru z samego generowania odpowiedzi na aktywne zbieranie informacji jest obiecujące, ale nie zamyka tematu. Kolejny krok to trudniejsze środowiska, większa liczba opcji i testy współpracy człowiek–AI, gdzie liczy się nie tylko logika, lecz także pragmatyka rozmowy. Jeśli te elementy zagrają razem, agenty AI mogą stać się realnym wsparciem w zadaniach „igła w stogu siana” — tam, gdzie trzeba znaleźć rzadkie rozwiązanie w ogromnej przestrzeni możliwości.

Oryginalny tekst: Teaching AI agents to ask better questions by playing “Battleship”