1링크 열기
이 웹페이지는 처음 접속할 때 인터넷이 필요해요. 내려받은 단독 index.html은 인터넷 없이 열 수 있어요. ZIP이라면 먼저 압축을 풀어요.
PLAY · LEARN · DISCOVER
내가 먼저 두고, AI는 경험으로 배워요.
01 / 직접 대결
처음은 무학습 + 학습만이에요. 가중치가 0이라 아직 약해요.
강한 AI를 바로 만나려면 ‘사전학습 모델’과 ‘학습 + 고정 전술/검색’을 각각 선택하세요. 고정 검색은 선택적 4수 탐색과 강제방어 연장(최대 4수)을 사용해요. 학습만으로 모든 상대에게 승리하지는 않아요.
AI가 수를 고르면 학습/고정 전술의 선택 근거를 표시해요.
가로·세로·대각선으로 같은 돌 5개 이상을 연결해요. 금수 없이 흑백 모두 같은 규칙이에요.
키보드: 방향키로 이동 · Enter 또는 스페이스로 놓기
02 / 경험으로 배우기
AI가 무작위·전술·2수 위협 상대와 대결하고, 자기 자신과도 연습해요.
한 판의 최종 승패로 가중치를 고치는 강화학습이에요.
학습·저장 대상은 항상 현재 학습 모델이에요. 처음에는 0에서 시작해요. 대국용 사전학습 모델을 선택해도 학습 대상은 바뀌지 않아요.
복사하면 기존 현재 모델·학습 전 모델과 평가 기록을 교체해요. 필요한 현재 모델은 먼저 저장하세요. 대국 방법 선택은 바꾸지 않아요.
실제 누적 가중치 업데이트: 0회 · 이번 학습 전 대비 가중치 거리: 0.0000
1~20,000판 · 처음에는 3,000판을 추천해요.
학습 난수 시작값: 31415926 · 같은 출발에서 다시 실험할 수 있어요.
준비됐어요. 먼저 AI와 대결해도 좋아요.
전후 평가는 현재 모델의 이번 세션 시작·종료 복사본으로 해요. 각각 40판, AI는 백돌 후공, 같은 전술 상대와 대결해요. 평가 대상 AI의 전술/검색은 꺼요. 일시정지 중에도 대국은 잠겨요.
목표 = 그 수를 둔 쪽의 최종 승패 × 할인율종국까지 남은 수
예상 차이 = 목표 − 업데이트 직전 예상 Q
종국 반환 Monte Carlo 강화학습 + 경험 재사용이에요. 전체 반환을 쓰는 TD(λ=1) 관점으로도 설명할 수 있어요. 고정 전술/검색 규칙 자체를 배우는 것은 아니에요. 많이 연습해도 반드시 더 강해지지는 않아요.
03 / 같은 조건으로 확인
학습 기여 평가: 학습만(검색 끔) vs 고정 전술 상대
평가 대상 AI는 백돌·후공 · 전후 각각 40판 · 같은 난수 시작값 20260914 · 학습판과 별개
대국의 방법 선택과 무관하게 이 평가는 항상 검색을 꺼요. 검색을 켠 실력을 비교하려면 전후 모두 같은 검색을 적용해야 해요. 오목 규칙과 실험 조건은 미니오목 설명서를 보세요.
아직 평가하지 않았어요. 학습을 시작하면 먼저 측정해요.
| 학습 판 | 시점 | 승 / 무 / 패 | 평가 판 | 승률 |
|---|---|---|---|---|
| 평가를 끝내면 기록이 나타나요. | ||||
평가 결과는 이 페이지를 열어 둔 동안만 남아요. 40판은 작은 표본이며, 한 상대에게 잘해도 모든 상대에게 강하다는 뜻은 아니에요. 자동 대결 한 판은 통계 평가가 아니에요.
돋보기 / 한 판 들여다보기
학습에서 실제로 끝난 마지막 한 판을 보여 줘요.
탐험 여부도 함께 확인해요.
관찰판은 내 대국판과 별개예요. 슬라이더로 실제 기록을 봐요. 고정 상대의 수는 가중치를 업데이트하지 않아요. 표시한 변화량은 그 수의 첫 업데이트이며, 누적 업데이트 횟수에는 경험 재사용도 포함해요.
각 특징에 붙인 숫자(가중치)가 경험에 따라 바뀌어요. 모든 판을 외우는 방식은 아니에요.
자동 저장하지 않아요. 창을 닫기 전에 JSON 파일로 저장하세요.
파일에는 모델과 누적 학습 판 수가 담겨요. 대국·관찰·평가 기록은 저장되지 않아요.
불러오기는 JSON만, 최대 1MB예요. 학습·평가가 끝나야 불러오거나 초기화할 수 있어요.
다섯 개를 잇고, AI를 연습시키고,
정말 달라졌는지 확인해요.
제목을 다시 누르면 설명이 접혀요.
이 웹페이지는 처음 접속할 때 인터넷이 필요해요. 내려받은 단독 index.html은 인터넷 없이 열 수 있어요. ZIP이라면 먼저 압축을 풀어요.
나는 흑돌로 먼저, AI는 백돌로 둬요. 9×9 판의 빈칸을 눌러 가로·세로·대각선 다섯 개 이상을 이어요. 6개 이상의 장목도 승리하고, 3·3이나 4·4 금수는 없어요. 처음 AI는 아직 배우지 않아 약해요.
판 수를 넣고 학습 시작을 눌러요. 전후 각각 40판, 같은 상대·백돌 후공·검색 끔으로 비교해요. 끝나면 현재 모델로 새 대국이 열려요.
모델 저장으로 현재 모델의 JSON을 받고, 다음에는 모델 불러오기로 이어 배워요. 대국·평가 기록은 저장되지 않아요.
한 판의 최종 승패로 지난 수를 되짚어요. 지난 경험도 다시 연습해요. 가중치는 수를 고를 때 쓰는 숫자예요.
검색을 켜면 안 배운 AI도 강할 수 있어요. 그 실력을 전부 학습 덕분이라고 볼 수는 없어요.
강한 AI를 바로 만나려면 사전학습 모델 · 배포본과 학습 + 고정 전술/검색을 각각 골라요.
9×9 판에서 흑백 모두 연속 5개 이상이면 승리해요. 4개만으로는 이기지 않아요. 장목·3·3·4·4를 금지하지 않는 자유 규칙이며, 렌주 규칙과 달라요.
5칸 길의 1·2·3·4돌 특징과 다음 승리점을 사용해요. 미니사목 가중치를 옮기지 않고 오목에서 새로 학습해요.
다른 게임의 승률을 이 오목의 성적으로 제시하지 않아요. 배포 모델의 학습 판 수·업데이트 횟수는 대국 영역에 표시해요.
학습 전후 각각 40판을 같은 고정 전술 상대에게 백돌 후공·검색 끔으로 평가해요. 작은 표본이라 결과는 달라질 수 있으며, 학습이 항상 승률을 높이지는 않아요.