1링크 열기
이 웹페이지는 처음 접속할 때 인터넷이 필요해요. 내려받은 단독 index.html은 인터넷 없이 열 수 있어요. ZIP이라면 먼저 압축을 풀어요.
PLAY · LEARN · DISCOVER
내가 먼저 두고, AI는 경험으로 배워요.
01 / 직접 대결
처음은 무학습 + 학습만이에요. 가중치가 0이라 아직 약해요.
강한 AI를 바로 만나려면 ‘사전학습 모델’과 ‘학습 + 고정 전술/검색’을 각각 선택하세요. 고정 검색은 선택적 4수 탐색과 강제방어 연장(최대 4수)을 사용해요. 학습만으로 모든 상대에게 승리하지는 않아요.
AI가 수를 고르면 학습/고정 전술의 선택 근거를 표시해요.
가로·세로·대각선으로 같은 돌 4개를 연결해요.
키보드: 방향키로 이동 · Enter 또는 스페이스로 놓기
02 / 경험으로 배우기
AI가 무작위·전술·2수 위협 상대와 대결하고, 자기 자신과도 연습해요.
한 판의 최종 승패로 가중치를 고치는 강화학습이에요.
학습·저장 대상은 항상 현재 학습 모델이에요. 처음에는 0에서 시작해요. 대국용 사전학습 모델을 선택해도 학습 대상은 바뀌지 않아요.
복사하면 기존 현재 모델·학습 전 모델과 평가 기록을 교체해요. 필요한 현재 모델은 먼저 저장하세요. 대국 방법 선택은 바꾸지 않아요.
실제 누적 가중치 업데이트: 0회 · 이번 학습 전 대비 가중치 거리: 0.0000
1~20,000판 · 처음에는 3,000판을 추천해요.
학습 난수 시작값: 31415926 · 같은 출발에서 다시 실험할 수 있어요.
준비됐어요. 먼저 AI와 대결해도 좋아요.
전후 평가는 현재 모델의 이번 세션 시작·종료 복사본으로 해요. 각각 40판, AI는 백돌 후공, 같은 전술 상대와 대결해요. 평가 대상 AI의 전술/검색은 꺼요. 일시정지 중에도 대국은 잠겨요.
목표 = 그 수를 둔 쪽의 최종 승패 × 할인율종국까지 남은 수
예상 차이 = 목표 − 업데이트 직전 예상 Q
종국 반환 Monte Carlo 강화학습 + 경험 재사용이에요. 전체 반환을 쓰는 TD(λ=1) 관점으로도 설명할 수 있어요. 고정 전술/검색 규칙 자체를 배우는 것은 아니에요. 많이 연습해도 반드시 더 강해지지는 않아요.
03 / 같은 조건으로 확인
학습 기여 평가: 학습만(검색 끔) vs 고정 전술 상대
평가 대상 AI는 백돌·후공 · 전후 각각 40판 · 같은 난수 시작값 20260914 · 학습판과 별개
대국의 방법 선택과 무관하게 이 평가는 항상 검색을 꺼요. 검색을 켠 실력을 비교하려면 전후 모두 같은 검색을 적용해야 해요. 배포본의 별도 검증 조건·결과는 미니사목 설명서를 보세요.
아직 평가하지 않았어요. 학습을 시작하면 먼저 측정해요.
| 학습 판 | 시점 | 승 / 무 / 패 | 평가 판 | 승률 |
|---|---|---|---|---|
| 평가를 끝내면 기록이 나타나요. | ||||
평가 결과는 이 페이지를 열어 둔 동안만 남아요. 40판은 작은 표본이며, 한 상대에게 잘해도 모든 상대에게 강하다는 뜻은 아니에요. 자동 대결 한 판은 통계 평가가 아니에요.
돋보기 / 한 판 들여다보기
학습에서 실제로 끝난 마지막 한 판을 보여 줘요.
탐험 여부도 함께 확인해요.
관찰판은 내 대국판과 별개예요. 슬라이더로 실제 기록을 봐요. 고정 상대의 수는 가중치를 업데이트하지 않아요. 표시한 변화량은 그 수의 첫 업데이트이며, 누적 업데이트 횟수에는 경험 재사용도 포함해요.
각 특징에 붙인 숫자(가중치)가 경험에 따라 바뀌어요. 모든 판을 외우는 방식은 아니에요.
자동 저장하지 않아요. 창을 닫기 전에 JSON 파일로 저장하세요.
파일에는 모델과 누적 학습 판 수가 담겨요. 대국·관찰·평가 기록은 저장되지 않아요.
불러오기는 JSON만, 최대 1MB예요. 학습·평가가 끝나야 불러오거나 초기화할 수 있어요.
네 개를 잇고, AI를 연습시키고,
정말 달라졌는지 확인해요.
제목을 다시 누르면 설명이 접혀요.
이 웹페이지는 처음 접속할 때 인터넷이 필요해요. 내려받은 단독 index.html은 인터넷 없이 열 수 있어요. ZIP이라면 먼저 압축을 풀어요.
나는 흑돌로 먼저, AI는 백돌로 둬요. 10×10 판의 빈칸을 눌러 가로·세로·대각선 네 개를 이어요. 처음 AI는 아직 배우지 않아 약해요.
판 수를 넣고 학습 시작을 눌러요. 전후 각각 40판, 같은 상대·백돌 후공·검색 끔으로 비교해요. 끝나면 현재 모델로 새 대국이 열려요.
모델 저장으로 현재 모델의 JSON을 받고, 다음에는 모델 불러오기로 이어 배워요. 대국·평가 기록은 저장되지 않아요.
한 판의 최종 승패로 지난 수를 되짚어요. 지난 경험도 다시 연습해요. 가중치는 수를 고를 때 쓰는 숫자예요.
검색을 켜면 안 배운 AI도 강할 수 있어요. 그 실력을 전부 학습 덕분이라고 볼 수는 없어요.
강한 AI를 바로 만나려면 사전학습 모델 · 배포본과 학습 + 고정 전술/검색을 각각 골라요.
v1: 점수만 좇다가 당장 이길 자리나 꼭 막을 자리를 놓쳤어요.
v2: 위험을 더 잘 구분하고 최종 승패로 배워요. 별도의 고정 검색도 고쳤고, 학습이 끝나면 새 모델로 대국을 열어요.
기존 v2 독립 평가 · 각 조건 200판
AI는 백돌 후공 · 무학습 → 사전학습
좋아진 경우도, 나빠진 경우도 있어요. 사람 전체에 대한 승률은 아니에요.
출처: 원본 results/v2-evaluation.json
tactical / threat2 · 기존 평가 요약
이번 설명 UI 테스트의 성적은 아니에요.