Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego serca jego architektury. U podstaw leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg odtwarza się wielokrotnie, aż do osiągnięcia zamierzonego efektu.
Sercem tego procesu jest model językowy, który odgrywa rolę wewnętrznego głosu doradczego agenta. To on odczytuje polecenia użytkownika, dzieli złożone zadanie na drobniejsze podzadania i sugeruje kolejność ich wykonania. Środowisko modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy potrzebuje konkretnych danych spoza swojej wiedzy treningowej.
Interesującym elementem architektury jest tak zwana pamięć operacyjna, w której agent trzyma tło bieżącego zadania. Dzięki niej nie traci wątku nawet wtedy, gdy procedura rozciąga się na wiele etapów i potrzebuje przełączania między różnymi źródłami informacji. To dokładnie ta zdolność wyróżnia agenta od prostego skryptu, który wykonuje jedynie wcześniej zapisaną listę poleceń.
Oddzielną kwestią pozostaje mechanizm oceny własnych działań. Dobrze zbudowany agent jest w stanie rozpoznać, że otrzymany wynik odbiega od oczekiwanego, i cofnąć się do poprzedniego etapu, by spróbować innej ścieżki. Taka samokorekta przybliża działanie maszyny do ludzkiego nawyku sprawdzania własnej pracy przed jej złożeniem.