낯선 적·보상·조작을 동시에 요구하면 무엇 때문에 실패했는지 분리하기 어렵습니다.
레벨은 시도할 공간과 실패 비용을 정하고 제어 규칙은 이동량을 정합니다. 바닥 있는 틈과 낭떠러지는 다른 실패 조건입니다.
안전한 구간의 이동, 반사되어 돌아오는 보상, 바닥 있는 틈, 낭떠러지를 순서대로 경험합니다. 같은 짧은 점프를 재생해 중력 설정별 최고점과 착지점을 비교합니다.
강한 제동은 멈추기 쉽지만 관성을 바꿉니다. 자체 2D 모형으로 원작 수치를 복원하지 않았습니다. 보상 접촉과 실패 횟수는 기록하지만 학습 성공률을 주장하지 않습니다.