AI NATIVE COMPANY

PLAY · LEARN · DISCOVER

미니오목 연구소

내가 먼저 두고, AI는 경험으로 배워요.

AI 강화학습 체험
01 먼저 대결하기02 AI 학습시키기03 달라졌는지 확인하기

01 / 직접 대결

다섯 개를 이으면 승리!

9 × 9 · 자유 오목
나 · 흑돌 · 먼저AI · 백돌

처음은 무학습 + 학습만이에요. 가중치가 0이라 아직 약해요.

강한 AI를 바로 만나려면 ‘사전학습 모델’과 ‘학습 + 고정 전술/검색’을 각각 선택하세요. 고정 검색은 선택적 4수 탐색과 강제방어 연장(최대 4수)을 사용해요. 학습만으로 모든 상대에게 승리하지는 않아요.

내 차례예요. 빈칸에 흑돌을 놓아 보세요.

AI가 수를 고르면 학습/고정 전술의 선택 근거를 표시해요.

가로·세로·대각선으로 같은 돌 5개 이상을 연결해요. 금수 없이 흑백 모두 같은 규칙이에요.
키보드: 방향키로 이동 · Enter 또는 스페이스로 놓기

고정 전술/검색은 사람이 미리 만든 규칙이에요. 켜면 무학습 모델도 강해질 수 있으므로, 그 실력을 전부 학습 덕분이라고 할 수 없어요.
모델·방법을 바꾸면 새 대국이 시작돼요. 학습·평가 중에는 대국을 잠그고, 모두 끝나면 현재 학습 모델로 새 대국을 열어요.

02 / 경험으로 배우기

AI의 연습 시간

강화학습

AI가 무작위·전술·2수 위협 상대와 대결하고, 자기 자신과도 연습해요.
한 판의 최종 승패로 가중치를 고치는 강화학습이에요.

학습·저장 대상은 항상 현재 학습 모델이에요. 처음에는 0에서 시작해요. 대국용 사전학습 모델을 선택해도 학습 대상은 바뀌지 않아요.

복사하면 기존 현재 모델·학습 전 모델과 평가 기록을 교체해요. 필요한 현재 모델은 먼저 저장하세요. 대국 방법 선택은 바꾸지 않아요.

현재 학습 모델의 누적 학습0판
이번 연습에서 끝낸 판0/ 3,000

실제 누적 가중치 업데이트: 0회 · 이번 학습 전 대비 가중치 거리: 0.0000

판

1~20,000판 · 처음에는 3,000판을 추천해요.
학습 난수 시작값: 31415926 · 같은 출발에서 다시 실험할 수 있어요.

준비됐어요. 먼저 AI와 대결해도 좋아요.

전후 평가는 현재 모델의 이번 세션 시작·종료 복사본으로 해요. 각각 40판, AI는 백돌 후공, 같은 전술 상대와 대결해요. 평가 대상 AI의 전술/검색은 꺼요. 일시정지 중에도 대국은 잠겨요.

AI는 무엇을 배우나요?
  1. 탐험 — 연습 중 가끔 다른 수를 시험해요. 실제 대결과 평가에서는 탐험을 꺼요.
  2. 보상과 결과 — 마지막 이기는 수의 보상은 +1, 그 전 수와 무승부는 0이에요. 하지만 이전 수도 마지막 승패에서 배워요.
  3. 생각 고치기 — 한 판이 끝나면 각 수를 둔 쪽의 승패(승리 +1, 패배 −1, 무승부 0)를 목표로 삼아요. 끝에서 먼 수는 할인하고, 지난 경험도 다시 연습해요(replay).

목표 = 그 수를 둔 쪽의 최종 승패 × 할인율종국까지 남은 수
예상 차이 = 목표 − 업데이트 직전 예상 Q

종국 반환 Monte Carlo 강화학습 + 경험 재사용이에요. 전체 반환을 쓰는 TD(λ=1) 관점으로도 설명할 수 있어요. 고정 전술/검색 규칙 자체를 배우는 것은 아니에요. 많이 연습해도 반드시 더 강해지지는 않아요.

03 / 같은 조건으로 확인

실력이 달라졌을까?

실제 평가

학습 기여 평가: 학습만(검색 끔) vs 고정 전술 상대
평가 대상 AI는 백돌·후공 · 전후 각각 40판 · 같은 난수 시작값 20260914 · 학습판과 별개

대국의 방법 선택과 무관하게 이 평가는 항상 검색을 꺼요. 검색을 켠 실력을 비교하려면 전후 모두 같은 검색을 적용해야 해요. 오목 규칙과 실험 조건은 미니오목 설명서를 보세요.

아직 평가하지 않았어요. 학습을 시작하면 먼저 측정해요.

이번 학습 전 승률—평가 전
이번 학습 후 승률—평가 전
세로: 승률(승 ÷ 평가 완료 판 수) · 가로: 누적 학습 판 수
평가 기록 — 그래프와 같은 실제 결과
학습 판시점승 / 무 / 패평가 판승률
평가를 끝내면 기록이 나타나요.

평가 결과는 이 페이지를 열어 둔 동안만 남아요. 40판은 작은 표본이며, 한 상대에게 잘해도 모든 상대에게 강하다는 뜻은 아니에요. 자동 대결 한 판은 통계 평가가 아니에요.

돋보기 / 한 판 들여다보기

AI가 방금 배운 한 수

학습에서 실제로 끝난 마지막 한 판을 보여 줘요.

기록 대기 중
이 수의 보상
—
지금 예상 Q
—
고칠 목표
—
예상 차이 TD
—
생각의 변화량
—

탐험 여부도 함께 확인해요.

관찰판은 내 대국판과 별개예요. 슬라이더로 실제 기록을 봐요. 고정 상대의 수는 가중치를 업데이트하지 않아요. 표시한 변화량은 그 수의 첫 업데이트이며, 누적 업데이트 횟수에는 경험 재사용도 포함해요.

AI가 살피는 판의 특징

    각 특징에 붙인 숫자(가중치)가 경험에 따라 바뀌어요. 모든 판을 외우는 방식은 아니에요.

    배운 내용 챙겨 가기

    자동 저장하지 않아요. 창을 닫기 전에 JSON 파일로 저장하세요.
    파일에는 모델과 누적 학습 판 수가 담겨요. 대국·관찰·평가 기록은 저장되지 않아요.

    불러오기는 JSON만, 최대 1MB예요. 학습·평가가 끝나야 불러오거나 초기화할 수 있어요.

    미니오목 그림 사용법

    다섯 개를 잇고, AI를 연습시키고,
    정말 달라졌는지 확인해요.

    제목을 다시 누르면 설명이 접혀요.

    1링크 열기

    웹 링크는 인터넷으로 열고, 내려받은 단독 HTML은 파일로 열어요.웹 링크는 인터넷으로 열고, 내려받은 단독 HTML은 파일로 열어요.웹 링크 열기↓브라우저에서 바로 대결

    이 웹페이지는 처음 접속할 때 인터넷이 필요해요. 내려받은 단독 index.html은 인터넷 없이 열 수 있어요. ZIP이라면 먼저 압축을 풀어요.

    2흑돌 다섯 개 잇기

    흑돌 다섯 개를 가로, 세로 또는 대각선으로 이으면 승리해요.흑돌 다섯 개를 가로, 세로 또는 대각선으로 이으면 승리해요.

    나는 흑돌로 먼저, AI는 백돌로 둬요. 9×9 판의 빈칸을 눌러 가로·세로·대각선 다섯 개 이상을 이어요. 6개 이상의 장목도 승리하고, 3·3이나 4·4 금수는 없어요. 처음 AI는 아직 배우지 않아 약해요.

    3연습하고 비교하기

    학습 시작 뒤 같은 조건의 학습 전과 학습 후 승률을 비교해요.학습 시작 뒤 같은 조건의 학습 전과 학습 후 승률을 비교해요.학습 시작↓학습 전학습 후

    판 수를 넣고 학습 시작을 눌러요. 전후 각각 40판, 같은 상대·백돌 후공·검색 끔으로 비교해요. 끝나면 현재 모델로 새 대국이 열려요.

    4배운 내용 챙기기

    현재 학습 모델을 JSON으로 저장하고 다음에 불러와요.현재 학습 모델을 JSON으로 저장하고 다음에 불러와요.현재모델→←JSON파일

    모델 저장으로 현재 모델의 JSON을 받고, 다음에는 모델 불러오기로 이어 배워요. 대국·평가 기록은 저장되지 않아요.

    AI가 실제로 배우는 순서

    실제 학습: 대국 경험을 쌓고 최종 승패로 가중치를 고친 뒤 다음 수 선택에 사용해요.실제 학습: 대국 경험을 쌓고 최종 승패로 가중치를 고친 뒤 다음 수 선택에 사용해요.경험여러 수를 두기↓승패한 판의 결과 보기↓가중치판단에 쓰는 숫자 고치기↓다음 선택고친 숫자로 수 고르기

    한 판의 최종 승패로 지난 수를 되짚어요. 지난 경험도 다시 연습해요. 가중치는 수를 고를 때 쓰는 숫자예요.

    두 방법은 달라요

    학습만은 배운 숫자로 선택하고, 학습 더하기 고정 전술 검색은 사람이 만든 규칙도 사용해요.학습만은 배운 숫자로 선택하고, 학습 더하기 고정 전술 검색은 사람이 만든 규칙도 사용해요.학습만배운 숫자로 선택학습 + 고정 전술/검색배운 숫자 + 사람의 규칙앞으로 둘 수도 살펴보기

    검색을 켜면 안 배운 AI도 강할 수 있어요. 그 실력을 전부 학습 덕분이라고 볼 수는 없어요.

    강한 AI를 바로 만나려면 사전학습 모델 · 배포본과 학습 + 고정 전술/검색을 각각 골라요.

    작은 판, 자유 오목

    9×9 판에서 흑백 모두 연속 5개 이상이면 승리해요. 4개만으로는 이기지 않아요. 장목·3·3·4·4를 금지하지 않는 자유 규칙이며, 렌주 규칙과 달라요.

    5칸 길의 1·2·3·4돌 특징과 다음 승리점을 사용해요. 미니사목 가중치를 옮기지 않고 오목에서 새로 학습해요.

    성적은 직접 확인해요

    다른 게임의 승률을 이 오목의 성적으로 제시하지 않아요. 배포 모델의 학습 판 수·업데이트 횟수는 대국 영역에 표시해요.

    학습 전후 각각 40판을 같은 고정 전술 상대에게 백돌 후공·검색 끔으로 평가해요. 작은 표본이라 결과는 달라질 수 있으며, 학습이 항상 승률을 높이지는 않아요.

    대국판으로 돌아가기 ↑

    현재 학습 내용을 초기화할까요?

    현재 모델과 학습 전 모델은 가중치 0이 되고 평가 기록도 사라져요. 배포 사전학습 모델은 유지돼요.
    필요한 모델은 먼저 JSON으로 저장해 주세요.