25% 추첨에도 긴 실패가 생긴다

목록으로

0<p<1인 독립 추첨에 실패 보장을 더하면 장기 성공률도 높아집니다. p=1이면 이미 매번 성공합니다. 추첨을 누적하여 이론값과 관측값, 가장 긴 실패를 분리해 보세요.

규칙마다 진행한 횟수—
독립 추첨 · 첫 10회 모두 실패—
실패 누적 상수 C—

서로 다른 기억과 분포

완료된 성공 간격의 분포

같은 동전, 행동 전후의 정보

공개 전 안전/위험의 이론 기대값은 모두 +1입니다. 공개 후 앞이면 위험, 뒤이면 안전을 고르면 +5.5입니다.

계산 중입니다.

평균과 최악, 정보 공개를 구분하기

문제와 원인

독립 추첨의 평균 성공 간격은 1/p입니다. 0<p<1이면 성공 시점의 상한이 없지만 p=1이면 매번 성공합니다. p=0.25이면 첫 10회가 모두 실패할 확률은 0.75¹⁰≈5.63%입니다. 긴 플레이 전체에서 한 번이라도 10연패가 나올 확률과는 다릅니다.

해결 · 기억을 가진 규칙

천장은 K번째에 강제 성공하고 실패 횟수를 초기화합니다. 누적 규칙은 qₙ=min(nC,1)이며 성공마다 n=1로 돌아갑니다. C=.25를 그대로 쓰면 평균 간격 2.21875, 장기 성공률 약45.07%입니다. 보정 모드는 생존 확률 합으로 평균을 구하고 이분법으로 목표 성공률에 맞춥니다.

셔플백은 20개 중 정해진 성공 수를 섞어 소진 후 보충합니다. 가방 경계에서는 실패나 성공이 연속할 수 있습니다. Godot 공식 예제를 참고했습니다. 가방은 갱신 과정 사이 독립 간격을 가정하지 않습니다.

대가와 정보 공개

히스토그램은 완료한 성공 간격만 포함하고 아직 끝나지 않은 실패는 제외합니다. 이론 평균은 장기 평균이며 유한 표본과 다릅니다. 초기 상태와 가방 잔량도 저장 계약의 일부입니다.

동전은 앞/뒤 각½, 안전+1, 위험+10/−8입니다. 먼저 보고 행동을 고르면 같은 동전 분포도 다른 보상 분포가 됩니다. 정책 비교는 동일한 100개 동전으로 세 정책을 평가합니다. 실제 재미나 통제감의 우월성을 이 수치로 증명하지 않습니다.