게임 AI / 보상과 종료

점수는 높은데 도착하지 않는 정책

왕복·위험한 지름길·안전한 우회에 같은 보상식을 적용해 보세요.

선택된 후보 정책—
누적 점수 / 실제 결과—
현재 전이의 학습 타깃 y—

후보 정책할인 보상실제 결과스텝

원인과 해결

점수는 높은데 도착하지 않는 정책

기본 보상은 안전한 도착보다 왕복의 점수를 높게 만듭니다. ‘목표 중심 보상 예시’를 누르고 선택되는 후보가 바뀌는지 확인하세요.

문제 · 점수와 목적의 분리

모든 이동에 +1을 주면 제자리 왕복도 이득입니다. Δx는 뒤로 간 만큼 보상을 되돌리고, 최초 방문은 방문 기록이 있어야 중복을 막습니다. 다만 γ<1이면 +1, −1 왕복의 할인합도 1−γ이므로 Δx만으로 모든 왕복 이득이 사라지지는 않습니다. 도착 보상과 실패 벌점은 실제 종료 상태에서 한 번 적용합니다.

종료와 외부 중단

도착·죽음은 terminated이므로 타깃 y는 현재 보상입니다. 외부 데이터 수집이 끝났을 뿐 게임이 계속될 상태는 truncated로 다음 가치 γQ를 남깁니다. ‘시간 내 도착’ 자체가 규칙이면 제한 도달은 진짜 종료이며 남은 시간을 관측 상태에 포함합니다.

Double DQN의 구분

온라인 값 8,7은 왼쪽을 선택합니다. 타깃 값 4,9 중 선택한 왼쪽의 4로 평가합니다. DQN의 타깃 최댓값 9와 다릅니다. 단순히 네트워크가 두 개 있다는 설명만으로 Double DQN을 정의하지 않습니다.

대가와 실험 범위

왕복·지름길·우회의 세 가지 고정 후보를 같은 환경 규칙에서 실행하고 할인 보상을 비교합니다. 전체 정책 공간의 최적화나 신경망 학습은 하지 않습니다. 순위가 바뀌어도 일반적인 게임 성공률 개선을 증명하지 않습니다. 표시하는 점수, 도착 여부, 종료 플래그를 함께 보세요.

Double DQN 원 논문 · 선택과 평가 분리 ↗Gymnasium · Termination / Truncation ↗