AI NATIVE COMPANY

PLAY · LEARN · DISCOVER

미니사목 연구소

내가 먼저 두고, AI는 경험으로 배워요.

AI 강화학습 체험
01 먼저 대결하기02 AI 학습시키기03 달라졌는지 확인하기

01 / 직접 대결

네 개를 이으면 승리!

10 × 10 · 4목
나 · 흑돌 · 먼저AI · 백돌

처음은 무학습 + 학습만이에요. 가중치가 0이라 아직 약해요.

강한 AI를 바로 만나려면 ‘사전학습 모델’과 ‘학습 + 고정 전술/검색’을 각각 선택하세요. 고정 검색은 선택적 4수 탐색과 강제방어 연장(최대 4수)을 사용해요. 학습만으로 모든 상대에게 승리하지는 않아요.

내 차례예요. 빈칸에 흑돌을 놓아 보세요.

AI가 수를 고르면 학습/고정 전술의 선택 근거를 표시해요.

가로·세로·대각선으로 같은 돌 4개를 연결해요.
키보드: 방향키로 이동 · Enter 또는 스페이스로 놓기

고정 전술/검색은 사람이 미리 만든 규칙이에요. 켜면 무학습 모델도 강해질 수 있으므로, 그 실력을 전부 학습 덕분이라고 할 수 없어요.
모델·방법을 바꾸면 새 대국이 시작돼요. 학습·평가 중에는 대국을 잠그고, 모두 끝나면 현재 학습 모델로 새 대국을 열어요.

02 / 경험으로 배우기

AI의 연습 시간

강화학습

AI가 무작위·전술·2수 위협 상대와 대결하고, 자기 자신과도 연습해요.
한 판의 최종 승패로 가중치를 고치는 강화학습이에요.

학습·저장 대상은 항상 현재 학습 모델이에요. 처음에는 0에서 시작해요. 대국용 사전학습 모델을 선택해도 학습 대상은 바뀌지 않아요.

복사하면 기존 현재 모델·학습 전 모델과 평가 기록을 교체해요. 필요한 현재 모델은 먼저 저장하세요. 대국 방법 선택은 바꾸지 않아요.

현재 학습 모델의 누적 학습0판
이번 연습에서 끝낸 판0/ 3,000

실제 누적 가중치 업데이트: 0회 · 이번 학습 전 대비 가중치 거리: 0.0000

판

1~20,000판 · 처음에는 3,000판을 추천해요.
학습 난수 시작값: 31415926 · 같은 출발에서 다시 실험할 수 있어요.

준비됐어요. 먼저 AI와 대결해도 좋아요.

전후 평가는 현재 모델의 이번 세션 시작·종료 복사본으로 해요. 각각 40판, AI는 백돌 후공, 같은 전술 상대와 대결해요. 평가 대상 AI의 전술/검색은 꺼요. 일시정지 중에도 대국은 잠겨요.

AI는 무엇을 배우나요?
  1. 탐험 — 연습 중 가끔 다른 수를 시험해요. 실제 대결과 평가에서는 탐험을 꺼요.
  2. 보상과 결과 — 마지막 이기는 수의 보상은 +1, 그 전 수와 무승부는 0이에요. 하지만 이전 수도 마지막 승패에서 배워요.
  3. 생각 고치기 — 한 판이 끝나면 각 수를 둔 쪽의 승패(승리 +1, 패배 −1, 무승부 0)를 목표로 삼아요. 끝에서 먼 수는 할인하고, 지난 경험도 다시 연습해요(replay).

목표 = 그 수를 둔 쪽의 최종 승패 × 할인율종국까지 남은 수
예상 차이 = 목표 − 업데이트 직전 예상 Q

종국 반환 Monte Carlo 강화학습 + 경험 재사용이에요. 전체 반환을 쓰는 TD(λ=1) 관점으로도 설명할 수 있어요. 고정 전술/검색 규칙 자체를 배우는 것은 아니에요. 많이 연습해도 반드시 더 강해지지는 않아요.

03 / 같은 조건으로 확인

실력이 달라졌을까?

실제 평가

학습 기여 평가: 학습만(검색 끔) vs 고정 전술 상대
평가 대상 AI는 백돌·후공 · 전후 각각 40판 · 같은 난수 시작값 20260914 · 학습판과 별개

대국의 방법 선택과 무관하게 이 평가는 항상 검색을 꺼요. 검색을 켠 실력을 비교하려면 전후 모두 같은 검색을 적용해야 해요. 배포본의 별도 검증 조건·결과는 미니사목 설명서를 보세요.

아직 평가하지 않았어요. 학습을 시작하면 먼저 측정해요.

이번 학습 전 승률—평가 전
이번 학습 후 승률—평가 전
세로: 승률(승 ÷ 평가 완료 판 수) · 가로: 누적 학습 판 수
평가 기록 — 그래프와 같은 실제 결과
학습 판시점승 / 무 / 패평가 판승률
평가를 끝내면 기록이 나타나요.

평가 결과는 이 페이지를 열어 둔 동안만 남아요. 40판은 작은 표본이며, 한 상대에게 잘해도 모든 상대에게 강하다는 뜻은 아니에요. 자동 대결 한 판은 통계 평가가 아니에요.

돋보기 / 한 판 들여다보기

AI가 방금 배운 한 수

학습에서 실제로 끝난 마지막 한 판을 보여 줘요.

기록 대기 중
이 수의 보상
—
지금 예상 Q
—
고칠 목표
—
예상 차이 TD
—
생각의 변화량
—

탐험 여부도 함께 확인해요.

관찰판은 내 대국판과 별개예요. 슬라이더로 실제 기록을 봐요. 고정 상대의 수는 가중치를 업데이트하지 않아요. 표시한 변화량은 그 수의 첫 업데이트이며, 누적 업데이트 횟수에는 경험 재사용도 포함해요.

AI가 살피는 판의 특징

    각 특징에 붙인 숫자(가중치)가 경험에 따라 바뀌어요. 모든 판을 외우는 방식은 아니에요.

    배운 내용 챙겨 가기

    자동 저장하지 않아요. 창을 닫기 전에 JSON 파일로 저장하세요.
    파일에는 모델과 누적 학습 판 수가 담겨요. 대국·관찰·평가 기록은 저장되지 않아요.

    불러오기는 JSON만, 최대 1MB예요. 학습·평가가 끝나야 불러오거나 초기화할 수 있어요.

    미니사목 그림 사용법

    네 개를 잇고, AI를 연습시키고,
    정말 달라졌는지 확인해요.

    제목을 다시 누르면 설명이 접혀요.

    1링크 열기

    웹 링크는 인터넷으로 열고, 내려받은 단독 HTML은 파일로 열어요.웹 링크는 인터넷으로 열고, 내려받은 단독 HTML은 파일로 열어요.웹 링크 열기↓브라우저에서 바로 대결

    이 웹페이지는 처음 접속할 때 인터넷이 필요해요. 내려받은 단독 index.html은 인터넷 없이 열 수 있어요. ZIP이라면 먼저 압축을 풀어요.

    2흑돌 네 개 잇기

    흑돌 네 개를 가로, 세로 또는 대각선으로 이으면 승리해요.흑돌 네 개를 가로, 세로 또는 대각선으로 이으면 승리해요.

    나는 흑돌로 먼저, AI는 백돌로 둬요. 10×10 판의 빈칸을 눌러 가로·세로·대각선 네 개를 이어요. 처음 AI는 아직 배우지 않아 약해요.

    3연습하고 비교하기

    학습 시작 뒤 같은 조건의 학습 전과 학습 후 승률을 비교해요.학습 시작 뒤 같은 조건의 학습 전과 학습 후 승률을 비교해요.학습 시작↓학습 전학습 후

    판 수를 넣고 학습 시작을 눌러요. 전후 각각 40판, 같은 상대·백돌 후공·검색 끔으로 비교해요. 끝나면 현재 모델로 새 대국이 열려요.

    4배운 내용 챙기기

    현재 학습 모델을 JSON으로 저장하고 다음에 불러와요.현재 학습 모델을 JSON으로 저장하고 다음에 불러와요.현재모델→←JSON파일

    모델 저장으로 현재 모델의 JSON을 받고, 다음에는 모델 불러오기로 이어 배워요. 대국·평가 기록은 저장되지 않아요.

    AI가 실제로 배우는 순서

    실제 학습: 대국 경험을 쌓고 최종 승패로 가중치를 고친 뒤 다음 수 선택에 사용해요.실제 학습: 대국 경험을 쌓고 최종 승패로 가중치를 고친 뒤 다음 수 선택에 사용해요.경험여러 수를 두기↓승패한 판의 결과 보기↓가중치판단에 쓰는 숫자 고치기↓다음 선택고친 숫자로 수 고르기

    한 판의 최종 승패로 지난 수를 되짚어요. 지난 경험도 다시 연습해요. 가중치는 수를 고를 때 쓰는 숫자예요.

    두 방법은 달라요

    학습만은 배운 숫자로 선택하고, 학습 더하기 고정 전술 검색은 사람이 만든 규칙도 사용해요.학습만은 배운 숫자로 선택하고, 학습 더하기 고정 전술 검색은 사람이 만든 규칙도 사용해요.학습만배운 숫자로 선택학습 + 고정 전술/검색배운 숫자 + 사람의 규칙앞으로 둘 수도 살펴보기

    검색을 켜면 안 배운 AI도 강할 수 있어요. 그 실력을 전부 학습 덕분이라고 볼 수는 없어요.

    강한 AI를 바로 만나려면 사전학습 모델 · 배포본과 학습 + 고정 전술/검색을 각각 골라요.

    v1 → v2, 무엇을 고쳤나요?

    v1: 점수만 좇다가 당장 이길 자리나 꼭 막을 자리를 놓쳤어요.

    v2: 위험을 더 잘 구분하고 최종 승패로 배워요. 별도의 고정 검색도 고쳤고, 학습이 끝나면 새 모델로 대국을 열어요.

    기록으로 확인한 결과

    기존 v2 독립 평가 · 각 조건 200판
    AI는 백돌 후공 · 무학습 → 사전학습

    학습만 / 공격·방어 상대0% → 96.5%
    검색 켬 / 더 까다로운 상대75% → 68.5%

    좋아진 경우도, 나빠진 경우도 있어요. 사람 전체에 대한 승률은 아니에요.

    출처: 원본 results/v2-evaluation.json
    tactical / threat2 · 기존 평가 요약
    이번 설명 UI 테스트의 성적은 아니에요.

    대국판으로 돌아가기 ↑

    현재 학습 내용을 초기화할까요?

    현재 모델과 학습 전 모델은 가중치 0이 되고 평가 기록도 사라져요. 배포 사전학습 모델은 유지돼요.
    필요한 모델은 먼저 JSON으로 저장해 주세요.