인식-계획-행동 순환 Perceive-Plan-Act Cycle
환경을 관찰해 현재 상태를 구성하고, 목표에 맞는 계획을 세운 뒤 행동을 실행하며 결과를 다음 관찰에 반영하는 에이전트 제어 순환이다.
개념과 원리
섹션 제목: “개념과 원리”개요와 핵심 정의
섹션 제목: “개요와 핵심 정의”환경을 관찰해 현재 상태를 구성하고, 목표에 맞는 계획을 세운 뒤 행동을 실행하며 결과를 다음 관찰에 반영하는 에이전트 제어 순환이다.
관찰을 내부 상태로 변환하고 목표와 제약을 기준으로 행동 후보를 평가한 뒤 하나를 실행한다. 실행 결과가 예상과 다르면 상태와 계획을 갱신한다. 이 표제어는 Perceive-Plan-Act Cycle이라는 영문 용어와 함께 사용되며, 구현 이름보다 입력·처리·출력과 성립 조건을 기준으로 이해해야 한다. 핵심 정의를 실제 시스템에 적용할 때는 모델이나 도구의 버전, 데이터 범위와 평가 단위를 함께 적어 같은 이름 아래 다른 동작이 섞이지 않게 한다.
배경과 설명 범위
섹션 제목: “배경과 설명 범위”환경을 관찰해 현재 상태를 구성하고, 목표에 맞는 계획을 세운 뒤 행동을 실행하며 결과를 다음 관찰에 반영하는 에이전트 제어 순환이다. 설명 범위에는 개념의 역사적 배경뿐 아니라 현재의 계산 절차와 운영 경계가 포함된다. 단순한 일회성 도구 호출과 달리 실행 결과가 다음 계획에 되먹임되며, 반응형 정책보다 명시적인 계획 상태를 유지한다.
외부 백과는 표제어와 인접 용어를 대조하는 데 사용하고, 기술적 작동과 제약은 논문·표준·공식 문서를 우선한다. 제품의 특정 옵션을 보편 원리로 일반화하지 않으며 빠르게 변하는 구현은 기준 날짜와 버전을 명시한다.
작동 원리
섹션 제목: “작동 원리”관찰을 내부 상태로 변환하고 목표와 제약을 기준으로 행동 후보를 평가한 뒤 하나를 실행한다. 실행 결과가 예상과 다르면 상태와 계획을 갱신한다.
작동 과정을 확인할 때는 입력이 어떤 중간 표현으로 바뀌고 어떤 기준으로 다음 상태나 출력이 선택되는지 단계별로 기록한다. 동일한 입력으로 기준 구현과 비교하고, 난수나 임계값이 관여하면 시드와 설정을 고정한다. 정상 결과 하나만 확인하지 않고 결측값, 경계값과 의도적으로 실패할 사례에서 어느 단계가 먼저 무너지는지도 관찰한다.
순환을 닫는 관찰의 역할
섹션 제목: “순환을 닫는 관찰의 역할”인식-계획-행동 순환에서 인식은 센서 값을 한 번 읽는 단계가 아니라, 목표 판단에 필요한 상태를 선택하고 불확실성을 표현하는 과정이다. 에이전트가 웹 도구를 호출했다면 HTTP 성공 여부만 관찰하지 않고 요청한 정보가 실제로 포함되었는지, 자료의 시점과 출처가 무엇인지 확인해야 한다. 파일을 수정했다면 모델이 생성한 문장보다 파일의 새 해시와 테스트 결과가 다음 상태가 된다. 행동의 효과를 독립적으로 관찰하지 않으면 모델이 성공했다고 말한 내용을 사실로 되먹여 잘못된 계획을 강화할 수 있다.
계획은 현재 상태에서 목표 상태로 가기 위한 행동 가설이다. 새 관찰이 이전 전제를 반박하면 남은 단계를 다시 계산하며, 모든 단계를 처음부터 자유롭게 만들 필요는 없다. 안정된 절차는 워크플로로 고정하고 예외 분기만 모델이 선택하게 하면 행동 공간을 줄일 수 있다. 각 계획 단계에는 완료 판정, 필요한 권한, 최대 비용과 실패 뒤 대체 경로를 둔다. 이 정보가 없으면 에이전트는 같은 도구를 반복하거나 목표와 무관한 탐색을 계속해도 스스로 중단하기 어렵다.
구성 요소와 처리 흐름
섹션 제목: “구성 요소와 처리 흐름”관찰기, 상태 표현, 계획기, 행동 실행기, 결과 평가기와 종료 판정으로 구성된다.
구성 요소 사이의 계약에는 자료형, 텐서 또는 메시지 모양, 단위, 허용 범위와 오류 처리 규칙이 포함된다. 각 요소의 버전과 소유자를 기록하고 중간 산출물을 재현할 수 있게 해야 전체 결과가 달라졌을 때 원인을 분리할 수 있다. 구현을 교체할 때는 이름의 일치가 아니라 동일한 기준 입력과 실패 조건을 만족하는지로 호환성을 판단한다.
상태 전이와 사건 기록
섹션 제목: “상태 전이와 사건 기록”순환을 구현할 때는 상태를 자연어 대화 하나로만 보관하지 않는다. 목표, 확정된 사실, 아직 검증되지 않은 가설, 완료한 행동, 남은 예산과 승인 상태를 구분한다. 행동은 도구 이름과 구조화된 인자, 요청 식별자로 기록하고, 관찰은 원본 응답과 정규화 결과를 연결한다. 이렇게 만든 사건 로그는 어느 관찰이 어느 계획 변경을 일으켰는지 재생할 수 있게 한다. 모델에 제공하는 요약은 이 원본에서 파생하며, 요약이 틀려도 원본 사건으로 복구할 수 있어야 한다.
여러 순환이 동시에 실행되면 같은 외부 자원을 바꾸거나 서로의 오래된 상태를 읽을 수 있다. 작업별 상태를 격리하고 공유 자원에는 버전 또는 잠금을 사용한다. 재시작 뒤 행동을 이어 갈 때는 마지막 모델 메시지가 아니라 실제로 완료된 외부 효과를 확인한다. 쓰기 도구에는 멱등성 키를 전달해 응답을 받지 못해 재시도하더라도 중복 반영을 막는다. 사람 승인도 하나의 상태 전이로 기록하고 승인 대상이 바뀌면 이전 승인을 무효화한다.
활용과 검증
섹션 제목: “활용과 검증”활용 분야와 선택 기준
섹션 제목: “활용 분야와 선택 기준”로봇 제어, 웹 자동화, 업무 에이전트와 게임 에이전트에서 장기 과제를 단계적으로 수행할 때 사용한다.
도입 여부는 정확도 하나가 아니라 지연시간, 계산·저장 비용, 데이터 요구량, 설명 가능성, 접근 권한과 실패 시 피해를 함께 비교해 결정한다. 더 단순한 기준선이 같은 업무 목표를 만족하는지 먼저 확인하고, 복잡한 구성이 실제 데이터에서 의미 있는 개선을 보일 때만 채택한다. 운영 이후에는 사용 환경의 변화와 하위 집단별 결과를 정기적으로 재평가한다.
선정 기준: 고정 워크플로로 처리 가능한 단계와 새 관찰에 따라 판단해야 하는 단계를 먼저 분리한다. 순환형 에이전트는 후자에만 사용하고, 목표 상태를 외부 검사로 판정할 수 없는 업무에는 자동 실행 권한을 주지 않는다. 사람에게 넘기는 조건도 실패가 발생한 뒤가 아니라 예산·권한·불확실성 기준으로 미리 정의한다.
한계와 흔한 오해
섹션 제목: “한계와 흔한 오해”관찰 누락과 잘못된 상태 추정이 뒤 단계 전체에 전파되며 계획 비용과 환경 변화 사이의 균형이 필요하다.
인식-계획-행동 순환을 에이전트 시스템에서 해석할 때는 목표, 관찰 가능한 상태, 사용할 수 있는 도구, 행동 결과와 종료 조건을 분리해야 한다. 같은 결과를 내더라도 계획이 갱신되는 시점과 실패를 복구하는 방식이 다르면 서로 다른 설계다. 실행 기록에는 선택한 행동뿐 아니라 제외한 대안, 도구 응답, 재시도 횟수와 사람에게 이관한 조건을 남겨야 한다. 평균값만으로 한계를 숨기지 않도록 드문 입력, 분포 변화, 악의적 조작과 자원 고갈 조건을 따로 시험한다. 알려진 실패를 탐지할 지표와 자동 중단선, 안전한 대체 경로, 사람이 검토할 사건을 사전에 정한다.
루프가 실패하는 전형적 방식
섹션 제목: “루프가 실패하는 전형적 방식”관찰이 불완전하면 계획은 논리적으로 일관돼 보여도 현실과 어긋난다. 도구가 빈 결과를 성공으로 반환하거나 오래된 캐시를 제공하는 상황, 외부 문서에 악성 지시가 섞인 상황을 별도 오류로 다뤄야 한다. 계획이 지나치게 길면 초기에 세운 가정이 뒤 단계까지 고정되고, 매 단계 다시 계획하면 비용이 커지며 목표가 흔들릴 수 있다. 중요한 체크포인트와 예외가 발생했을 때만 재계획하는 정책을 기준선과 비교한다.
종료 조건을 모델의 “완료” 판단에만 맡기면 거짓 성공과 무한 반복을 막기 어렵다. 목표별 검증식, 최대 행동 수, 총 토큰·시간·금액, 연속 실패 횟수를 실행기에서 강제한다. 예산이 끝났을 때는 성공으로 포장하지 않고 완료한 단계, 미완료 상태와 복구 방법을 반환한다. 되돌릴 수 없는 행동 전에 최신 상태와 승인 내용을 다시 확인하고, 이후 관찰이 실패하면 사람에게 사건을 넘긴다.
관련 개념과의 구분
섹션 제목: “관련 개념과의 구분”단순한 일회성 도구 호출과 달리 실행 결과가 다음 계획에 되먹임되며, 반응형 정책보다 명시적인 계획 상태를 유지한다.
- ai-agent: 이 표제어를 이해하기 위한 상위 또는 선행 개념이다.
- agent-loop: 구현 또는 적용 흐름에서 자주 함께 사용된다.
- react-agent: 같은 문제를 다른 표현이나 평가 관점에서 연결한다.
- tool-calling: 운영·검증 단계에서 함께 확인할 관련 문서다.
용어가 비슷하다는 이유만으로 서로 대체 가능한 것으로 보지 말고 입력, 산출물, 최적화 대상과 실패 양상을 표로 비교한다.
구체적인 적용 예시
섹션 제목: “구체적인 적용 예시”여행 예약 에이전트가 일정과 예산을 읽고 후보를 계획한 뒤 검색 도구를 호출하고, 좌석 부족 결과를 받아 대체 계획을 만드는 과정으로 검증한다.
예제를 실행하기 전에 기대 결과, 허용 오차와 실패 판정을 적는다. 실행 중에는 입력 원본, 변환된 중간 상태, 선택된 설정과 최종 출력을 저장한다. 결과가 예상과 다르면 데이터·구성·구현·환경 중 어느 요인이 달라졌는지 한 번에 하나씩 바꾸어 확인하고, 성공 사례와 함께 가장 가까운 실패 사례를 문서에 남긴다.
실무 적용과 검증 절차
섹션 제목: “실무 적용과 검증 절차”- 목적과 경계 정의: 인식-계획-행동 순환이 해결할 문제와 해결하지 않을 문제를 각각 한 문장으로 적는다.
- 입력·출력 계약: 자료형, 모양, 단위, 권한, 오류 응답과 종료 조건을 고정한다.
- 출처 대조: 정의는 외부 백과와 교차 확인하고 작동 원리와 수치는 논문·표준·공식 문서의 해당 위치로 되돌아가 검토한다.
- 기준선 비교: 더 단순한 방법과 같은 평가 자료에서 품질, 비용과 지연시간을 비교한다.
- 실패 시험: 결측값, 극단값, 분포 변화, 권한 오류, 중단된 처리와 악의적 입력을 포함한다.
- 재현 기록: 데이터 스냅샷, 코드·모델·도구 버전, 난수 시드와 모든 설정을 남긴다.
- 운영 통제: 경고선과 자동 중단선, 롤백 대상, 사람이 승인할 사건을 지정한다.
- 변경 검증: 구성 요소가 바뀔 때 같은 기준 사례와 실패 시험을 반복하고 차이를 분류한다.
검토 질문
섹션 제목: “검토 질문”- 관찰을 내부 상태로 변환하고 목표와 제약을 기준으로 행동 후보를 평가한 뒤 하나를 실행한다. 실행 결과가 예상과 다르면 상태와 계획을 갱신한다.
- 관찰기, 상태 표현, 계획기, 행동 실행기, 결과 평가기와 종료 판정으로 구성된다.
- 관찰 누락과 잘못된 상태 추정이 뒤 단계 전체에 전파되며 계획 비용과 환경 변화 사이의 균형이 필요하다.
검토 결과에는 선택 근거와 제외한 대안, 알려진 한계, 잔여 위험과 다음 검토 날짜를 함께 남긴다. 성능 개선 폭이 복잡성과 운영 위험을 상쇄하지 못하면 단순한 기준선으로 돌아간다.
심화 검토 메모
섹션 제목: “심화 검토 메모”환경을 관찰해 현재 상태를 구성하고, 목표에 맞는 계획을 세운 뒤 행동을 실행하며 결과를 다음 관찰에 반영하는 에이전트 제어 순환이다. 관찰을 내부 상태로 변환하고 목표와 제약을 기준으로 행동 후보를 평가한 뒤 하나를 실행한다. 실행 결과가 예상과 다르면 상태와 계획을 갱신한다. 관찰기, 상태 표현, 계획기, 행동 실행기, 결과 평가기와 종료 판정으로 구성된다. 이 세 문장을 입력·변환·출력의 순서로 다시 써 보고, 로봇 제어, 웹 자동화, 업무 에이전트와 게임 에이전트에서 장기 과제를 단계적으로 수행할 때 사용한다.라는 적용 범위에서 관찰 누락과 잘못된 상태 추정이 뒤 단계 전체에 전파되며 계획 비용과 환경 변화 사이의 균형이 필요하다.라는 한계가 어떤 관측 지표로 나타나는지 정의한다. 여행 예약 에이전트가 일정과 예산을 읽고 후보를 계획한 뒤 검색 도구를 호출하고, 좌석 부족 결과를 받아 대체 계획을 만드는 과정으로 검증한다. 예시를 정상·경계·실패 사례로 나누고 각 사례의 기대 결과와 허용 오차, 중단 조건을 표로 만든다. 마지막으로 관련 문서와의 차이를 용어가 아니라 데이터 요구량, 계산 절차, 출력 형식과 실패 비용으로 비교한다.
단계별 시험 설계
섹션 제목: “단계별 시험 설계”시험 과제는 초기 상태, 허용 도구, 목표 상태와 금지된 부작용을 명시한다. 정상 경로뿐 아니라 시간 초과, 권한 거부, 모순된 검색 결과, 중복 응답과 사람의 승인 거절을 주입한다. 최종 답변 점수와 별개로 유효한 행동 비율, 불필요한 반복, 잘못된 성공 선언, 예산 초과와 복구 가능성을 측정한다. 동일 과제를 여러 번 실행해 계획 경로가 달라도 목표와 안전 조건이 안정적으로 충족되는지 본다.
운영에서는 순환 단계별 지연과 비용, 도구 오류, 재계획 이유, 종료 유형을 집계한다. 반복이 많은 과제를 찾아 도구 설명이 모호한지, 필요한 상태가 누락됐는지, 목표 판정이 약한지 조사한다. 성공 추적만 보존하면 위험을 과소평가하므로 중단·거절·사람 수정 사례를 같은 기간에 검토한다. 새 도구를 추가하면 행동 공간이 달라지므로 기존 루프 평가를 다시 실행하고 권한과 종료 예산을 갱신한다.
학습 체크
섹션 제목: “학습 체크”- 인식-계획-행동 순환의 입력, 처리와 출력을 각각 설명할 수 있는가?
- 인접 개념과의 차이를 실제 사례로 구분할 수 있는가?
- 운영 전 검증할 실패 조건과 기록 항목을 제시할 수 있는가?
문서 관계
섹션 제목: “문서 관계”선행 개념
섹션 제목: “선행 개념”관련 문서
섹션 제목: “관련 문서”이 문서를 가리키는 문서
섹션 제목: “이 문서를 가리키는 문서”해당 문서가 없다.
이 문서를 포함하는 코스
섹션 제목: “이 문서를 포함하는 코스”포함된 코스가 없다.
참고와 다음 학습
섹션 제목: “참고와 다음 학습”참고 문헌
섹션 제목: “참고 문헌”- ReAct: Synergizing Reasoning and Acting in Language Models — paper
- Model Context Protocol Specification — standard
- OpenAPI Specification — standard
- NIST AI Risk Management Framework — standard
- Intelligent agent — Wikipedia — encyclopedia
코스에서 계속 읽기
섹션 제목: “코스에서 계속 읽기”이 문서에서 이어지는 코스가 없다.
