Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego rdzenia jego architektury. U fundamentu leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw rejestruje informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten cykl odtwarza się wielokrotnie, aż do uzyskania zamierzonego efektu.
Trzonem tego procesu jest model językowy, który pełni rolę własnego głosu konsultacyjnego agenta. To on interpretuje polecenia użytkownika, dzieli złożone zadanie na mniejsze podzadania i proponuje kolejność ich realizacji. Otoczenie modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy potrzebuje konkretnych danych spoza swojej wiedzy treningowej.
Ciekawym elementem architektury jest tak zwana pamięć robocza, w której agent trzyma tło bieżącego zadania. Dzięki niej nie gubi wątku nawet wtedy, gdy procedura rozkłada się na wiele etapów i wymaga przeskakiwania między różnymi źródłami informacji. To dokładnie ta umiejętność wyróżnia agenta od podstawowego skryptu, który odtwarza jedynie z góry zapisaną listę poleceń.
Oddzielną sprawą pozostaje mechanizm ewaluacji własnych działań. Dobrze zbudowany agent potrafi rozpoznać, że otrzymany wynik nie zgadza się od zamierzonego, i cofnąć się do poprzedniego etapu, by podjąć próbę innej ścieżki. Taka autokorekta zbliża działanie maszyny do ludzkiego zwyczaju sprawdzania własnej pracy przed jej złożeniem.