AI NATIVE COMPANY

AX4U / ACADEMY / INDEPENDENT STUDY

Academy로 돌아가기 ↖

CS329A 공개 9편 한국어 독자 해설

원리에서 검증까지. 각 강연의 생각을 내 말로 설명하고 합성 사례로 직접 점검하세요.

교육자 독립 해설; Stanford 공식 교재·제휴·인증이 아니며 공개 재생목록 9편은 Autumn 2025 학기 전체가 아니다.

공개 9편 재생목록 ↗

먼저 읽을 출처 범위

제3자 공개 전사와 그 연구 기록을 바탕으로 작성한 교육자 독립 해설이다. 원영상 음성·슬라이드·공식 교정자막은 대조하지 않았다. 별도 웹 발췌 대조가 없는 대상은 두 번째 강연인 Part 2 한 편이며, 두 편이라는 뜻이 아니다. 다른 8편도 일부 발췌의 일치만 확인했을 뿐 원음 정확도나 전사 생성 출처의 독립성을 입증한 것은 아니다. 주장 요약과 해설에는 교육자의 재구성·적용 조언이 포함되며, 실습은 원 강의 과제가 아닌 자체 합성 예제다. 주요 명칭·정의는 관련 원논문으로 국소 대조했지만 강의 발언·시각의 음성 일치나 모든 논문의 재현을 검증하지 않았다. 미확인 성능 수치는 싣지 않는다.

제3자 편집 재생목록의 9편만 다루며 공식 Autumn 2025 전체 강의가 아닙니다. Part 2(두 번째 강연)는 별도 웹 본문 발췌 교차검증이 없습니다. “두 편이 미검증”이라는 뜻이 아닙니다. 모든 장면 시각은 비공식 전사 표지이며 원영상 음성·슬라이드 대조 전입니다. 실습은 교육자 합성 종이 사례이며 모델 실행·성능 측정이 아닙니다.

01 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 1 | Course Overview

자기개선은 답을 반복해 쓰는 마술이 아니라 목표·후보 생성·검증·피드백·재사용을 구분해 설계하는 과정이다.

Part 1 원영상 보기 ↗ 1:09:42 · 영상 ID 6YnLB0XbTnI

01 / 쉬운 원리와 비유

한눈에 보는 원리 자기개선은 답을 반복해 쓰는 마술이 아니라 목표·후보 생성·검증·피드백·재사용을 구분해 설계하는 과정이다.

쉬운 비유 책방에서 추천문을 한 장 쓰는 사람과, 여러 초안을 만들어 사실을 대조하고 반응을 기록해 다음 기획에 반영하는 편집팀의 차이로 떠올려 보자.

비유의 한계 편집팀 비유는 역할을 보여줄 뿐, AI가 스스로 사실을 판정하거나 실제로 학습했다는 뜻은 아니다. 다음 프롬프트에 넣는 기억과 가중치 갱신도 다르다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

출발점: 문맥의 예시와 학습

비슷한 예시를 질문 안에 넣으면 모델은 이번 요청의 형식을 따라갈 수 있다. 그러나 이 변화는 현재 입력 문맥에 의존한다. 사람 선호를 보상 신호로 삼아 모델을 조정하는 학습과도 구분해야 한다. 그래서 무엇이 바뀌었는지 먼저 묻는다: 입력, 추론 절차, 아니면 가중치인가?

관련 근거: e1 · 6:10 · e2 · 17:24

추론 중 후보 생성과 선택

고정된 모델로 여러 답을 뽑으면 그중 하나에 정답이 있을 기회는 늘어날 수 있다. 후보에 정답이 존재하는 비율과 실제 선택기가 정답을 고른 비율은 다른 기록이다. 다양성만 무작정 키우면 말이 안 되는 후보도 늘어난다. 검증 기준이 약하면 계산만 더 쓰고 틀린 답을 자신 있게 채택한다.

관련 근거: e3 · 23:56 · e6 · 50:56

추론에서 학습으로 이어지는 고리

후보를 만들고 검증 가능한 것만 남겨 이후 학습 자료에 쓰면 비로소 모델을 바꾸는 순환을 설계할 수 있다. 이때 검증 오류가 학습 자료로 누적될 위험도 따라온다. 검증할 수 없는 창의적 과제에서는 사람의 판단이 병목이 될 수 있어, 모든 분야를 같은 자동 채점으로 처리하면 안 된다.

관련 근거: e4 · 29:31 · e6 · 50:56

에이전트와 연구 작업

에이전트는 목표를 받고 환경에 행동하고 관찰에 따라 다음 행동 또는 종료를 고른다. 연구 지원이라면 자료 찾기에서 바로 결론을 쓰는 대신 출처 선별, 개요, 주장별 근거, 종합을 차례로 확인한다. 관찰이 다음 행동을 바꾸는지, 단순한 고정 작업 흐름인지 살펴보면 챗봇과의 차이가 보인다.

관련 근거: e5 · 42:46 · e7 · 56:30

무엇을 개선했다고 말할 수 있나

보기 좋은 앱 시연만으로 개선을 입증하지 않는다. 비교 가설, 같은 문제 묶음, 후보 정답 존재와 최종 성공의 구분, 오류 사례를 기록해야 한다. 이 공개 영상들은 과목 전체가 아니라 일부 강연이므로 이후 장의 방법도 원 연구의 모든 조건을 재현한 것으로 간주하지 않는다.

관련 근거: e8 · 1:05:10

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이 또는 로컬 메모장. 가상 행사 사실표: 장소=열람실, 시작=토요일, 비용=무료. 실제 행사·고객정보 사용 금지.

합성 입력 후보 A 「토요일 열람실, 무료」, B 「일요일 열람실, 무료」, C 「토요일 강당, 무료」.

진행 순서

  1. 사실표를 가린 뒤 후보 중 사실에 맞는 문장이 있는지 표시한다.
  2. 사실표를 펼쳐 장소·요일·비용을 각 후보와 대조하고 최종 하나만 고른다.
  3. 후보 안 정답 존재 여부와 선택 결과를 다른 칸에 적고, 정보표가 틀렸을 경우를 토론한다.

예상 결과 A만 사실표와 일치하며 후보 존재와 최종 선택은 별도 판정이다.

실습 내 확인 사실표의 세 항목을 줄별로 대조한다. 종이 실습이며 모델 학습·실제 AI 실행은 하지 않는다.

실패·반례 B를 다수의 추천으로 골라도 틀리며 원래 사실표가 오기라면 검증 결과도 신뢰할 수 없다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 사실표의 세 항목을 줄별로 대조한다. 종이 실습이며 모델 학습·실제 AI 실행은 하지 않는다.

반례 B를 다수의 추천으로 골라도 틀리며 원래 사실표가 오기라면 검증 결과도 신뢰할 수 없다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. 프롬프트에 예시를 넣는 것과 모델을 재학습하는 것은 어떻게 다른가?
  2. 후보에 정답이 있는 것과 최종 출력이 맞는 것의 차이를 책방 사례로 설명하라.

동료에게 공유할 검증 과제 동료에게 익명 후보·사실표·선택 이유를 공유하고 누락된 검증 항목 한 개를 받아 수정한다.

06 / 출처 · 시각 링크와 검토 범위 (8개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 6:10 장면 ↗ e1

    퓨샷 학습은 질문과 함께 몇 가지 예시를 문맥에 넣어 작업 형식을 보여주는 것이다. 예시를 넣는 일과 모델 가중치를 미세조정하는 일을 구분해 설명한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 17:24 장면 ↗ e2

    RLHF에서는 사람의 선호를 이용해 보상 모델을 만들고, 그 보상이 높아지는 방향으로 언어 모델을 조정한다. 모범 답안을 그대로 따라 배우는 지도학습과 학습 신호가 다르다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 23:56 장면 ↗ e3

    추론 시 계산 확대는 고정된 모델에서 여러 답을 생성하고 골라 성능을 높이는 접근이다. 추론 과정에서 답을 수정했다고 가중치까지 학습한 것은 아니다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 29:31 장면 ↗ e4

    생성한 풀이 가운데 검증된 것을 다시 학습 자료로 사용하면 추론과 학습이 연결된다. 자기개선의 핵심은 단순한 반복 호출이 아니라 생성·검증·재학습의 순환이다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 42:46 장면 ↗ e5

    에이전트는 목표를 받고 환경에 행동하며 피드백에 따라 다음 행동과 종료를 정한다. 질문에 문장으로 답하는 챗봇과 달리 목표 달성을 위한 작업 과정이 필요하다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 50:56 장면 ↗ e6

    답을 많이 만드는 능력과 좋은 답을 가려내는 능력 사이에 간격이 있다. 창작처럼 자동 판정이 어려운 분야에서는 사람의 피드백이 개선 속도의 병목이 될 수 있다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 56:30 장면 ↗ e7

    연구 지원은 자료 수집 뒤 바로 글을 쓰는 일이 아니다. 관련 참고자료를 고르고 개요를 만들고 각 자료의 내용을 요약한 뒤 종합하는 다단계 작업으로 소개된다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 1:05:10 장면 ↗ e8

    강의 후반의 프로젝트 기준은 앱 시연만으로 끝내지 말고 가설과 실험으로 주장을 확인하라는 것이다. 학습자용 해설에서도 무엇이 개선됐는지 비교할 질문을 먼저 세우게 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑

02 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 2 | Test-Time Compute Scaling

추론 시간의 계산을 늘릴 때는 더 많이 만들기, 고쳐 보기, 단계별 채점, 답 융합 중 어디에 예산을 쓰는지 정해야 한다.

Part 2 원영상 보기 ↗ 1:03:21 · 영상 ID -Ggc37xLj_Y

01 / 쉬운 원리와 비유

한눈에 보는 원리 추론 시간의 계산을 늘릴 때는 더 많이 만들기, 고쳐 보기, 단계별 채점, 답 융합 중 어디에 예산을 쓰는지 정해야 한다.

쉬운 비유 견적서를 여러 업체에서 받는 일과 한 업체의 초안을 몇 번 수정받는 일은 둘 다 시간과 비용을 쓰지만 얻는 정보가 다르다.

비유의 한계 다수의 견적 중 최저가를 고르는 기준과 수학·코드의 정답 판정은 같지 않다. 완벽한 검사자가 있다는 가정은 실제 단위테스트에 적용되지 않는다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

왜 여러 번 뽑나

반복 생성의 첫 효과는 정답 후보를 발견할 기회다. 특히 어려운 문제가 길게 남아 있는 묶음에서는 쉬운 문제의 평균 증가만 보고 전체 향상을 예상하기 어렵다. 여러 후보에 정답 하나가 있는 비율은 최종 선택의 정확도와 구분한다. 드문 정답은 다수결에서 오히려 밀릴 수 있다.

관련 근거: e1 · 3:43 · e2 · 9:35 · e3 · 18:48

폭과 깊이의 예산

병렬 샘플은 다른 길을 넓히고 순차 수정은 한 풀이의 오류를 따라가며 고친다. 혼합 방법도 가능하지만 동일 호출 예산에서 어느 실패가 더 흔한지 봐야 한다. 코드를 실행해 확인할 수 있어도 공개 테스트가 모든 입력을 대표하지는 않는다. 추론을 많이 쓰는 것이 사전학습을 항상 대체하는 것도 아니다.

관련 근거: e4 · 27:34

결과 점수와 과정 점수

결과 보상 모델은 완성된 응답에, 과정 보상 모델은 풀이의 각 단계에 점수를 준다. 단계 점수는 탐색 중 어떤 경로를 더 살필지 정하는 데 사용할 수 있다. 다만 어느 방식이 더 빠르거나 정확한지는 모델·구현·문제에 따라 확인해야 한다. 교육자 주의: 점수는 정답 보증이 아니므로 높은 점수를 받은 응답도 오류가 없는지 별도로 살핀다.

관련 근거: e5 · 29:33

선택이 아닌 융합

후반의 Archon 소개에서는 생성, 비평, 순위, 융합 등을 조합해 추론 구조를 찾는다. 융합은 있는 후보를 고르기만 하는 대신 후보를 재료로 새 답을 생성한다. 따라서 새로운 답이 정말 맞는지 다시 점검해야 하며, 구조를 최적화했다는 말은 기초 LLM 가중치를 바꿨다는 말과 다르다.

관련 근거: e6 · 49:13 · e7 · 59:43 · e8 · 1:02:14

공정한 비교

교육자 비교 지침: 추론 전략의 효율을 비교할 때는 같은 문제와 채점 기준을 쓰고, 어떤 자원을 예산으로 맞췄는지 먼저 정한다. 호출 횟수만 같아도 모델 크기와 응답 길이에 따라 계산량·비용은 달라질 수 있으므로 토큰 수와 벽시계 시간도 따로 기록한다. 계산 예산을 늘리는 효과를 보려면 다른 조건을 가능한 한 통제하고 예산별 결과를 비교한다. 강의 도표의 구체적 성능 수치는 이 해설에 싣지 않는다.

관련 근거: e4 · 27:34 · e7 · 59:43

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이와 시계. 가상 공지 원문 「둘째 화요일 휴관」을 정답표로 두고 온라인 요청·모델 호출 없이 진행.

합성 입력 A 둘째 화요일, B 첫째 화요일, C 첫째 화요일, D 셋째 화요일.

진행 순서

  1. 후보 하나만 쓰는 경우와 네 후보에서 다수결하는 경우의 선택을 기록한다.
  2. 원문을 펼쳐 후보별 판정 후 검증 기반 하나를 고른다.
  3. 각 방법의 후보 수, 작업 시간, 후보 내 정답 존재, 최종 정답을 별도 칸에 적는다.

예상 결과 다수결 B·C의 첫째 화요일은 오답, 원문 검증 시 A가 정답이다.

실습 내 확인 공지 원문에 밑줄을 긋고 답안과 글자별로 대조한다. 이 예시는 종이 시뮬레이션이며 모델 추론 성능 실험이 아니다.

실패·반례 원문이 갱신됐는데 오래된 정답표를 쓰면 엄격한 선택도 오답을 낸다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 공지 원문에 밑줄을 긋고 답안과 글자별로 대조한다. 이 예시는 종이 시뮬레이션이며 모델 추론 성능 실험이 아니다.

반례 원문이 갱신됐는데 오래된 정답표를 쓰면 엄격한 선택도 오답을 낸다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. 후보 중 정답이 드물 때 다수결은 왜 실패할 수 있나?
  2. 구조를 최적화하는 일과 모델 가중치를 학습하는 일을 구분해 보라.

동료에게 공유할 검증 과제 익명 비교표에 후보 수·작업 시간·선택 실패를 함께 적어 공유하고 동료가 반례를 하나 추가하게 한다.

06 / 출처 · 시각 링크와 검토 범위 (8개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 3:43 장면 ↗ e1

    반복 샘플링의 coverage는 후보 가운데 적어도 하나가 문제를 푼 비율이다. 답을 여러 번 뽑아 잠재적 정답을 발견하는 능력과 최종 답을 고르는 능력은 별개다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 9:35 장면 ↗ e2

    한 문제의 성공 확률에 따른 곡선과 여러 난도의 문제를 합친 곡선은 다르다. 강의는 매우 어려운 문제가 길게 남는 분포를 전체 샘플링 스케일링의 해석에 연결한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 18:48 장면 ↗ e3

    어려운 문제의 정답은 많은 후보 속에 드물게 나타날 수 있어 다수결로 놓칠 수 있다. 가장 자주 등장한 답이 반드시 맞는 답은 아니라는 점이 검증 병목의 출발점이다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 27:34 장면 ↗ e4

    병렬 샘플링은 서로 다른 후보를 늘리고, 순차 수정은 기존 답을 다시 살펴 고친다. 같은 계산 예산을 탐색의 폭과 수정의 깊이 중 어디에 쓸지 정하는 문제다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 29:33 장면 ↗ e5

    결과 보상 모델은 완성된 답에 점수를 매기고 과정 보상 모델은 풀이 단계에 점수를 매긴다. 단계 점수로 유망한 가지를 남기면 탐색을 안내할 수 있다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 49:13 장면 ↗ e6

    Archon의 융합은 후보 하나를 고르는 대신 여러 답을 보고 새 답을 합성한다. 따라서 기존 후보 중 최선을 고르는 이상적 선택기와 비교할 때에도 새 생성 단계의 효과를 구분해야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 59:43 장면 ↗ e7

    Archon은 생성·비평·순위 매기기·융합 등의 조합을 제한된 호출 예산에서 탐색한다. 후반에서는 검색 공간을 줄인 뒤 베이지안 최적화로 정확도와 비용을 함께 고려하는 설계를 설명한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 1:02:14 장면 ↗ e8

    마지막에는 특정 과제에 맞춘 추론 구조와 여러 과제에 공통으로 쓰는 구조를 구분한다. 여기서 구조를 학습·최적화한다는 말은 구성 요소 LLM의 가중치를 다시 학습한다는 뜻과 다르다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑

03 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 3 | Robust Verification

검증기는 답을 선택하는 도구이지만 그 자체도 틀릴 수 있으므로 결과·과정·검증기의 오류를 따로 평가해야 한다.

Part 3 원영상 보기 ↗ 1:12:59 · 영상 ID p7TdPUcPoik

01 / 쉬운 원리와 비유

한눈에 보는 원리 검증기는 답을 선택하는 도구이지만 그 자체도 틀릴 수 있으므로 결과·과정·검증기의 오류를 따로 평가해야 한다.

쉬운 비유 교정자가 오탈자를 표시해도 잘못된 교정표를 들고 있으면 맞는 원고를 망친다. 여러 교정자의 표를 합칠 때에도 같은 착각을 공유하는지 봐야 한다.

비유의 한계 문장 교정은 계산의 정답표와 다르다. 자동 생성된 단계 표지는 최종 정답을 알고 있다는 가정이나 후속 풀이 능력에 의존할 수 있다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

검증기를 학습하고 사용하는 순서

문제와 풀이 후보를 만들고, 알려진 정답과 비교해 표지를 붙여 검증기를 학습한다. 사용 단계에서는 새로운 문제에 여러 풀이를 생성하고 검증 점수로 선택한다. 생성기와 검증기의 역할을 분리해야 선택 성능이 어디서 나왔는지 알 수 있다.

관련 근거: e1 · 4:54

후보 확대의 역설

답 후보가 늘면 맞는 풀이가 섞여 있을 확률은 커질 수 있다. 하지만 많은 오답 중 검증기가 자신 있게 높게 평가한 오답도 나타난다. 따라서 후보 존재율이 높아진 것만으로 최종 답이 개선되었다고 보고할 수 없다.

관련 근거: e2 · 17:52

답만 보기와 단계 살피기

최종 답은 맞았지만 앞 단계의 계산이 틀린 풀이가 있다. 결과 감독은 이를 놓칠 수 있어 과정 감독은 중간 판단을 별도로 표지한다. Math-Shepherd 소개는 특정 중간 단계에서 여러 후속 풀이를 뽑아 최종 성공으로 신호를 만드는 식이다. 성공 횟수나 한번이라도 성공했는지에 따라 표지의 의미가 달라진다.

관련 근거: e3 · 25:29 · e4 · 39:24

자동 표지의 맹점

어려운 문제를 생성기가 계속 풀지 못하면 후속 샘플은 양질의 신호를 주지 않는다. 또 중간 단계가 틀려도 운 좋게 마지막 답이 맞을 수 있다. 단계별 사람 주석을 줄인다는 표현은 최종 정답표나 사람의 감사가 필요 없다는 뜻이 아니다.

관련 근거: e5 · 42:54

약한 판정들을 묶을 때

Weaver 소개는 검증기 점수를 정규화하고 품질이 낮은 검증기를 걸러 가중 결합한다. 교육자 주의: 여러 검증기가 같은 오류를 공유할 수 있으므로 수가 많다는 사실만으로 독립적인 근거라고 보지 않는다. 앙상블의 판단을 작은 검증 모델로 옮기는 증류는 추론 비용을 줄이려는 방법이므로 선택 정확도와 비용을 함께 비교한다. 이와 별도로 후반 질의응답은 생성 모델이 한 번에 좋은 답을 내도록 학습하는 과정에서 풀이의 다양성을 잃을 수 있다는 문제를 제기한다.

관련 근거: e6 · 55:43 · e7 · 1:04:49 · e8 · 1:11:25

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이 계산. 개인정보 없는 합성 계산과 정답표 12+8=20.

합성 입력 풀이 A: 중간 12+8=21, 마지막 20. 풀이 B: 중간 12+8=20, 마지막 21.

진행 순서

  1. 최종 숫자만 보고 A와 B를 채점한다.
  2. 중간 등식과 마지막 숫자를 각각 다른 칸에 채점한다.
  3. 어느 점수로 후보를 고르면 어떤 오류가 남는지 적는다.

예상 결과 결과 기준은 A를, 과정 기준은 B의 중간 단계만 통과시킨다. 완전한 정답은 둘 다 아니다.

실습 내 확인 손으로 12+8을 계산해 과정·결과 칸을 따로 대조한다. 실제 검증기 학습은 하지 않는다.

실패·반례 최종만 보면 A의 거짓 근거를 놓치고 단계만 보면 B의 잘못된 출력이 통과할 수 있다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 손으로 12+8을 계산해 과정·결과 칸을 따로 대조한다. 실제 검증기 학습은 하지 않는다.

반례 최종만 보면 A의 거짓 근거를 놓치고 단계만 보면 B의 잘못된 출력이 통과할 수 있다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. 정답 후보 수가 늘어도 선택 정확도가 나빠질 수 있는 이유는?
  2. 자동 단계 표지는 왜 진리 자체가 아닌가?

동료에게 공유할 검증 과제 동료에게 오류가 다른 두 풀이를 익명 카드로 제공하고 평가 기준이 놓친 오류를 표시받아 채점표를 고친다.

06 / 출처 · 시각 링크와 검토 범위 (8개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 4:54 장면 ↗ e1

    생성기가 만든 풀이를 정답과 비교해 맞음·틀림 표지를 만들고 검증기를 학습한다. 추론 때는 여러 풀이에 검증 점수를 매겨 하나를 고른다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 17:52 장면 ↗ e2

    후보를 더 많이 만들면 정답을 포함할 가능성이 커져도 최종 선택의 정확도가 떨어질 수 있다. 부정확한 검증기가 높은 점수를 준 오답이 선택될 수 있기 때문이다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 25:29 장면 ↗ e3

    최종 답만 맞아도 중간 풀이가 잘못됐을 수 있다. 과정 감독은 풀이 단계별 판단을 제공해 이런 우연한 정답을 구별하려는 접근이다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 39:24 장면 ↗ e4

    Math-Shepherd는 중간 단계에서 여러 후속 풀이를 생성해 정답에 도달할 가능성으로 단계 표지를 만든다. 하나라도 성공했는지를 쓰는 방식과 성공 빈도를 쓰는 방식을 구분한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 42:54 장면 ↗ e5

    자동 단계 표지는 생성기가 풀지 못하는 어려운 문제에서 유용한 신호를 주지 못할 수 있다. 잘못된 중간 단계에서 우연히 정답에 도달하는 경우도 있어 자동 표지를 진리로 취급하면 안 된다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 55:43 장면 ↗ e6

    Weaver는 기존 검증기의 점수를 정규화하고 낮은 품질의 검증기를 거른 뒤 가중 결합하여 답을 선택한다. 검증기를 무작정 많이 모으는 것과 품질을 따져 결합하는 것은 다르다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 1:04:49 장면 ↗ e7

    검증기 묶음을 매번 실행하는 비용을 줄이기 위해 묶음의 판단을 작은 모델로 증류하는 후속 접근을 소개한다. 정확도뿐 아니라 전체 추론 비용을 함께 비교해야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 1:11:25 장면 ↗ e8

    후반 질의응답은 한 번에 잘 답하도록 학습하면서 풀이의 다양성을 잃을 수 있다는 긴장을 짚는다. 단일 응답 개선과 새로운 풀이 탐색 능력을 함께 살펴봐야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑

04 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 4 | Learning from Feedback with Tools/Code

도구를 쓰는 에이전트의 피드백은 관찰·코드 실행·원칙 기반 비평처럼 출처가 다르며, 실제 관찰과 학습 신호를 혼동하면 안 된다.

Part 4 원영상 보기 ↗ 1:11:13 · 영상 ID Lxh9RF5S-K0

01 / 쉬운 원리와 비유

한눈에 보는 원리 도구를 쓰는 에이전트의 피드백은 관찰·코드 실행·원칙 기반 비평처럼 출처가 다르며, 실제 관찰과 학습 신호를 혼동하면 안 된다.

쉬운 비유 길 찾기에서 표지판을 읽고 갈림길을 바꾸는 것, 연습장에서 길을 걸어보기, 안내 규칙을 점검하는 것은 서로 다른 피드백이다.

비유의 한계 표지판도 틀릴 수 있고 지도상의 관찰 기록은 실제 실행과 다르다. 언어로 적은 행동 이유는 모델 내부 사고의 완전한 공개가 아니다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

행동 가능한 범위를 먼저 만든다

목표를 받은 에이전트에 허용 도구와 입력 형식을 명시하면 실행 불가능한 행동을 줄일 수 있다. ReAct 소개는 행동 뒤 실제 관찰을 읽고 다음 행동을 다시 정하는 교대 방식이다. 먼저 계획을 끝까지 고정하면 검색 실패나 모순된 결과를 반영하기 어렵다.

관련 근거: e1 · 1:36 · e3 · 8:22 · e2 · 14:07

검색 결과는 증거 후보

읽기 전용 검색 결과가 상충할 수 있으므로 “검색했다”는 사실과 “참이다”는 판단을 분리한다. 호출 기록에는 요청·반환된 관찰·다음 행동·중단 이유를 따로 적는다. 잡음이 있으면 되돌아갈 수 있는지, 모르면 보류할지 미리 정해야 한다.

관련 근거: e2 · 14:07

코드를 실행해 피드백 받기

RLEF 설명에서는 생성한 코드의 실행 결과를 수정에 이용하고, 공개 테스트와 학습 보상에 쓰는 비공개 테스트를 구별한다. 후자는 최종 독립 평가 세트와 동일한 뜻이 아니다. 토큰별 코드 생성과 턴 단위 가치 평가는 해상도가 다르다. 테스트 통과는 보지 못한 모든 입력의 증명이 아니다.

관련 근거: e4 · 30:12 · e5 · 32:40

원칙에 따른 비평과 학습

Constitutional AI는 사람이 쓴 원칙을 사용해 응답을 비평·수정한 자료로 지도학습하고, AI 선호 평가를 거쳐 추가 학습 신호를 만드는 흐름으로 소개된다. AI가 스스로 평가해도 사람의 원칙 정의와 품질 감사가 사라지지는 않는다. 실습의 문구 교정은 전체 학습 파이프라인의 재현이 아니다.

관련 근거: e6 · 50:55 · e7 · 57:45

설계의 남은 일

더 강한 학습법도 특정 업무의 성공 조건, 사용할 도구, 위험한 행동의 승인 기준을 자동으로 대신 정해 주지 않는다. 외부 발송·구매는 실습에서 제외하고, 관찰이 불확실할 때 사람에게 넘기는 종료 규칙을 설계한다.

관련 근거: e8 · 1:08:26

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이 카드 두 장: 구 공지 「월요일 휴관」, 신 공지 「둘째 화요일 휴관」(각각 구/신이라고 명시). 실제 검색·발송 금지.

합성 입력 질문 「이번 달 둘째 화요일 문을 여나요?」와 허용 행동 카드 열람·대조·보류만 제공.

진행 순서

  1. 첫 카드를 읽고 주장·날짜를 관찰란에 적는다.
  2. 둘째 카드를 읽고 충돌을 표시한 뒤 다음 행동을 정한다.
  3. 우선순위 근거가 부족하면 정답 작성 대신 보류와 사람 확인 요청을 기록한다.

예상 결과 공지 충돌을 감지하고 최신성 확인 또는 보류로 분기한다.

실습 내 확인 행동 전 예상과 카드에서 실제 읽은 정보를 다른 색으로 적는다. 학습·외부 도구 실행 없음.

실패·반례 검색 첫 결과만 인용하거나 갱신 날짜 없는 카드에 “최신”이라고 꾸며 붙이면 실패다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 행동 전 예상과 카드에서 실제 읽은 정보를 다른 색으로 적는다. 학습·외부 도구 실행 없음.

반례 검색 첫 결과만 인용하거나 갱신 날짜 없는 카드에 “최신”이라고 꾸며 붙이면 실패다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. 관찰과 보상은 어떻게 다른가?
  2. 공개 테스트를 통과했는데도 실제 환경에서 오류가 나는 이유는?

동료에게 공유할 검증 과제 동료가 검토할 수 있게 합성 카드와 행동·관찰 기록을 공유하고 중단 규칙의 빈틈을 한 가지 수정한다.

06 / 출처 · 시각 링크와 검토 범위 (8개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 1:36 장면 ↗ e1

    세 접근의 공통점은 피드백으로 개선한다는 것이고 차이는 피드백의 출처다. ReAct는 환경 관찰, RLEF는 코드 실행, Constitutional AI는 사람이 쓴 원칙에 따른 AI 평가를 중심으로 설명된다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 14:07 장면 ↗ e2

    ReAct는 계획을 모두 만든 뒤 실행하는 고정 순서가 아니라 생각·행동·관찰을 번갈아 수행한다. 검색 실패 같은 관찰이 다음 검색어나 행동을 바꾸게 된다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 8:22 장면 ↗ e3

    실행 가능한 행동 집합을 명시하면 모델이 유효한 도구 호출을 고르는 데 도움이 된다. 자유롭게 문장을 생성하는 것과 환경이 받아들일 수 있는 행동을 생성하는 것은 다르다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 30:12 장면 ↗ e4

    RLEF의 두 층 테스트는 수정 과정에서 보여주는 공개 테스트와 학습 보상을 정하는 비공개 테스트를 구분한다. 추론 중 수정을 돕는 정보와 외부 학습 신호를 분리하는 설계다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 32:40 장면 ↗ e5

    코드는 토큰마다 생성하지만 가치 평가는 응답 턴 단위로 수행하는 혼합 설계를 소개한다. 행동 생성의 세밀함과 보상·가치 계산의 단위를 혼동하지 않게 가르친다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 50:55 장면 ↗ e6

    Constitutional AI의 지도학습 단계는 원칙에 따라 스스로 비평하고 수정한 응답을 학습 자료로 삼는다. 이어 AI 선호 평가로 별도 선호 모델을 만들고 RL에 사용한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 57:45 장면 ↗ e7

    AI 피드백을 쓰더라도 평가가 맞는지 사람과 대조할 검증 자료가 필요하다고 설명한다. 사람이 원칙을 쓰는 일과 피드백 품질을 감사하는 일이 남는다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 1:08:26 장면 ↗ e8

    후반 질의응답은 RL이 발전해도 모든 직무의 작업 순서와 탐색 공간이 자동으로 정해지지는 않는다고 강조한다. 에이전트 설계에는 도메인별 목표·도구·종료 조건을 정의하는 일이 필요하다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑

05 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 5 | Planning and Multi-Step Reasoning

긴 작업에는 탐색, 의존성에 따른 병렬화, 도구 사용 학습이 필요하지만 되돌리기 가능성과 지연 비용에 따라 전략이 달라진다.

Part 5 원영상 보기 ↗ 1:14:56 · 영상 ID Ml_fp9XkB8Y

01 / 쉬운 원리와 비유

한눈에 보는 원리 긴 작업에는 탐색, 의존성에 따른 병렬화, 도구 사용 학습이 필요하지만 되돌리기 가능성과 지연 비용에 따라 전략이 달라진다.

쉬운 비유 서로 다른 책 진열안을 종이 위에서 지웠다 다시 그릴 수는 있지만, 실제 행사 홍보물을 이미 보낸 뒤에는 같은 방식으로 되돌릴 수 없다.

비유의 한계 트리의 방문 통계를 갱신하는 작업을 모델 가중치의 역전파 학습과 동일시하지 않는다. 병렬 팀이 많다고 총 노동량이나 비용이 자동으로 줄지는 않는다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

되돌릴 수 있는 탐색

LATS는 행동과 결과를 가지로 펼치고 유망한 경로의 활용과 덜 본 경로의 탐색을 균형 잡는다. 한 경로의 성과를 이전 노드의 값과 방문 정보에 되돌려 다음 탐색에 반영하고, 언어적 회고도 남긴다. 이는 추론 중 탐색의 갱신이지 기초 모델 가중치 훈련의 역전파가 아니다.

관련 근거: e1 · 14:08 · e2 · 15:40

실세계 행동의 경계

텍스트 게임의 실패 경로는 리셋하기 쉽다. 반면 외부 결제·발송·기록 변경은 가지를 시험해 본다는 말로 실행해서는 안 된다. 안전한 모의 환경에서 후보를 비교하고 실제로 바꿀 때는 별도 권한과 인간 승인을 둔다.

관련 근거: e3 · 20:07

작업을 의존 그래프로 나누기

SPRINT 설명에서는 기존 풀이를 계획과 실행 단위로 나눠 어떤 단계가 다른 단계의 결과를 필요로 하는지 표시한다. 독립 단계는 동시에 진행하되 나중에 합치며 충돌을 검사한다. 짧은 일은 계획·조율 오버헤드가 더 클 수 있다. 순차 경로 단축을 총 토큰이나 비용 절감과 혼동하지 않는다.

관련 근거: e4 · 29:15 · e5 · 45:57

도구 학습을 위한 문맥

SWiRL은 도구 호출 결과를 앞서 수집하고 그 문맥에서 다음 행동을 평가하는 학습 설계로 소개된다. “도구 없는 에이전트”가 아니라 학습 중 지연과 실패를 줄이는 방법이다. 저장된 도구 결과가 바뀐 현실을 대표하지 않을 수 있으므로 실제 배포 시 새 관찰을 다시 확인한다.

관련 근거: e6 · 1:01:11

모방과 탐색의 차이

정답 경로만 골라 모방하면 이미 아는 쉬운 예시로 쏠릴 수 있다. 강화학습에서는 같은 문맥에서 새 행동을 시험하고 결과를 평가할 수 있어 적절한 데이터 선택 기준도 달라진다. 강의의 전이 결과는 특정 실험의 관찰이지 모든 업무 도구에 통한다는 보장이 아니다.

관련 근거: e7 · 1:07:31 · e8 · 1:09:34 · e9 · 1:13:26

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이. 합성 작업: 장소 확인 A, 포스터 B(A 이후), 안전문구 C(독립), 종합 D(B·C 이후). 실제 발송·구매 금지.

합성 입력 A→B→D와 C→D라는 의존관계.

진행 순서

  1. 네 작업을 카드로 만들고 화살표로 선행조건을 잇는다.
  2. A와 C를 동시에 할 수 있는지, B와 D를 동시에 할 수 있는지 표시한다.
  3. 마지막에 B·C의 날짜/장소 표현이 서로 같은지 확인한다.

예상 결과 A와 C는 병행 가능하지만 D는 B와 C가 끝나야 시작한다.

실습 내 확인 화살표를 거꾸로 따라 선행작업 누락이 없는지 검토한다. 병렬 실행 시간을 실제 측정한 실험은 아니다.

실패·반례 B가 A의 미확정 장소를 확정 사실로 적거나 D가 C 완료 전에 게시되면 실패한다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 화살표를 거꾸로 따라 선행작업 누락이 없는지 검토한다. 병렬 실행 시간을 실제 측정한 실험은 아니다.

반례 B가 A의 미확정 장소를 확정 사실로 적거나 D가 C 완료 전에 게시되면 실패한다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. LATS에서 뒤로 전파하는 값은 어떤 것인가?
  2. 병렬로 할 수 없는 일을 나눌 때 왜 기다림이 남는가?

동료에게 공유할 검증 과제 익명 의존 그래프와 병합 오류 한 사례를 공유하고 동료가 누락된 선행조건을 추가하게 한다.

06 / 출처 · 시각 링크와 검토 범위 (9개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 14:08 장면 ↗ e1

    LATS는 트리 탐색으로 잘될 것 같은 행동을 더 시도하면서 덜 살핀 행동에도 기회를 준다. 이미 유망한 길을 활용하는 것과 새 길을 탐색하는 것의 균형이 핵심이다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 15:40 장면 ↗ e2

    한 경로의 성공·실패 결과를 앞선 노드의 값에 반영해 다음 탐색을 바꾼다. 여기에 실패·성공에 관한 언어적 회고를 문맥에 남기는 과정이 붙는다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 20:07 장면 ↗ e3

    탐색은 되돌아갈 수 있는 실험 환경에서 편하지만 실제 결제처럼 취소하기 어려운 행동에는 그대로 적용하기 어렵다. 가상의 가지 탐색과 현실의 실행 권한을 구별해야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 29:15 장면 ↗ e4

    SPRINT는 기존 풀이를 계획과 실행 단계로 나누고 의존관계를 방향성 비순환 그래프로 표현한다. 서로 의존하지 않는 단계는 병렬로 실행하도록 자료를 재구성해 학습한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 45:57 장면 ↗ e5

    병렬화는 공짜가 아니다. 짧고 쉬운 문제에는 계획을 분리하는 추가 작업이 손해일 수 있고 긴 풀이에서 독립 작업이 많을 때 이득을 기대할 수 있다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 1:01:11 장면 ↗ e6

    SWiRL은 도구 결과를 미리 수집해 놓고 RL 단계에서는 그 문맥에 이어질 행동의 품질을 평가한다. 학습 중 도구 지연과 실패를 줄이려는 설계이며 도구를 전혀 쓰지 않는 방식은 아니다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 1:07:31 장면 ↗ e7

    SWiRL의 해당 실험에서는 최종 답이 맞은 경로만 고르기보다 과정 평가로 고른 자료가 RL에 더 도움이 됐다고 보고한다. 이미 풀 수 있는 문제만 남기는 선택 편향을 생각하게 하는 결과다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 1:09:34 장면 ↗ e8

    계산기 과제와 검색 과제 사이의 전이 결과를 통해 특정 도구 암기보다 단계적으로 생각하고 도구를 부르는 능력이 학습됐을 가능성을 제시한다. 모든 도구로 일반화한다는 증명은 아니다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  9. 원영상 1:13:26 장면 ↗ e9

    마지막 비교에서 지도학습은 주어진 경로를 모방하지만 RL은 같은 이전 문맥에서도 새 행동을 시도해 평가받는다는 차이를 강조한다. 따라서 데이터 필터링의 최선 조건도 학습 방식에 따라 달라질 수 있다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑

06 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 6 | Train Time Scaling/Scaling RL

학습 시 계산 확대는 검증된 산출물을 다시 훈련 자료나 보상으로 쓰는 순환이며, 추론만 오래 하는 것과 다르다.

Part 6 원영상 보기 ↗ 1:12:39 · 영상 ID yVnmHSAy3ck

01 / 쉬운 원리와 비유

한눈에 보는 원리 학습 시 계산 확대는 검증된 산출물을 다시 훈련 자료나 보상으로 쓰는 순환이며, 추론만 오래 하는 것과 다르다.

쉬운 비유 문제집을 여러 번 들여다보는 것과 풀이를 채점해 오답 노트를 만들고 다음 연습 방식 자체를 바꾸는 일의 차이로 생각하자.

비유의 한계 오답 노트만 만들었다고 모델 가중치가 바뀐 것은 아니다. 정답이 맞다는 표지는 중간 추론이 올바르다는 증명이 아니다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

추론 기록을 학습 자료로

답을 여러 번 만드는 추론 단계에서 검증한 풀이를 모아 재학습한다는 것이 출발점이다. 강의의 STaR 설명에서는 맞힌 풀이를 우선 사용하고 실패한 문제에는 정답 힌트로 근거를 다시 작성하게 한다. 학습 자료에서는 힌트를 떼어 문제→풀이 형태로 만들지만, 잘못된 근거를 따라 배울 위험은 남는다.

관련 근거: e1 · 5:29 · e2 · 18:47 · e3 · 20:21

강한 출발점과 상대 비교

DeepSeekMath 소개는 코드 기반 사전학습과 선별된 수학 자료 같은 출발 조건 뒤의 RL을 다룬다. GRPO는 같은 문제에 대한 답 여러 개의 보상을 집단 내에서 비교해 별도 가치 모델에 덜 의존하는 직관을 제시한다. 집단이 모두 맞거나 모두 틀리면 어느 행동이 더 나은지 배우기 어렵다.

관련 근거: e4 · 43:19 · e5 · 45:19

안정성과 탐색을 함께

DAPO 소개는 비교 신호가 없는 그룹을 걸러내는 동적 샘플링과 긴 응답의 길이·손실·클리핑 문제를 다룬다. 장치 이름만 외우기보다 무엇이 실패하는지: 단조로운 보상, 지나치게 긴 풀이, 다양성 상실을 먼저 보라. 공식 수식과 수치의 재현은 이 해설의 범위 밖이다.

관련 근거: e6 · 56:01 · e7 · 1:00:33

성공 한 건과 범위 확대

한 번 내는 답이 좋아지는 것과 많은 후보 중 하나라도 풀 수 있는 문제의 범위가 넓어지는 것은 다른 성질이다. 예전 쉬운 문제를 계속 푸는지도 봐야 한다. RL이 새 능력을 절대 만들 수 없다는 단정 대신 어느 자료·검증기·예산에서 어떤 지표가 달라졌는지 묻는다.

관련 근거: e8 · 1:06:50

데이터와 검증의 두 병목

판정기를 더 많이 붙여도 새로운 문제·좋은 자료가 모자라면 학습 신호가 풍부해지지 않는다. 성능 도표에 얽힌 벤치마크·모델 크기 표현은 비공식 전사에서 혼선이 있어 여기서는 정량 재주장을 하지 않는다.

관련 근거: e9 · 1:12:10

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이. 실제 모델 미세조정 금지; 자료 구성과 사람 감사만 한다.

합성 입력 문제 12+8, 알려진 답 20, 풀이 A 「12+8=20」, 풀이 B 「12+8=21, 정답 20」, 풀이 C 「12+8=21」.

진행 순서

  1. 최종 답과 알려진 답이 같은 카드를 표시한다.
  2. 중간 등식을 사람이 확인해 잘못된 카드를 별도 표시한다.
  3. 정답 힌트로 다시 써야 할 풀이와 학습자료 후보를 구분하고 힌트 표시를 제거했는지 확인한다.

예상 결과 A만 과정과 결과가 모두 맞고 B는 최종 답만 맞다. C는 답부터 틀리다.

실습 내 확인 직접 산수를 검산하고 힌트 포함 여부를 살핀다. 출력은 훈련용 카드 분류표이지 학습된 모델이 아니다.

실패·반례 B를 최종답만으로 채택하면 오류가 후속 자료에 쌓인다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 직접 산수를 검산하고 힌트 포함 여부를 살핀다. 출력은 훈련용 카드 분류표이지 학습된 모델이 아니다.

반례 B를 최종답만으로 채택하면 오류가 후속 자료에 쌓인다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. STaR의 정답 힌트는 언제 사용하고 왜 제거하나?
  2. 한 문제의 여러 보상이 모두 같으면 상대 비교 신호는 어떻게 되는가?

동료에게 공유할 검증 과제 오류 있는 합성 풀이 카드와 필터 규칙을 공유해 동료가 거짓 근거 한 건을 찾아내게 한다.

06 / 출처 · 시각 링크와 검토 범위 (9개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 5:29 장면 ↗ e1

    추론 때 만들어 검증한 출력을 다시 미세조정 자료로 돌려보내는 순환이 이 강의의 학습 시 계산 확대 설명이다. 더 오래 답하게 하는 것에서 한 단계 더 나아가 모델 자체를 갱신한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 18:47 장면 ↗ e2

    STaR는 먼저 맞힌 풀이로 학습하고, 실패한 문제에는 정답을 힌트로 주어 근거를 다시 생성하게 한다. 미세조정 자료에는 힌트를 제거해 문제에서 풀이를 만드는 형식으로 사용한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 20:21 장면 ↗ e3

    STaR의 답 정답 여부는 근거 품질을 대신 측정하는 대리 지표다. 정답을 알고 그럴듯한 설명만 붙이는 위험이 있으며 기초 모델이 힌트로도 풀 수 없는 문제까지 자동 해결하지는 못한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 43:19 장면 ↗ e4

    DeepSeekMath 설명은 RL만 강조하지 않는다. 코드로 사전학습된 출발점과 수학 웹 자료의 선별로 기초 능력을 준비한 뒤 RL로 이어지는 구성이 중요하다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 45:19 장면 ↗ e5

    GRPO는 한 질문에 대한 여러 답의 보상을 비교해 각 답이 집단 평균보다 얼마나 좋은지 계산한다. 별도 가치 모델 대신 집단 기준을 활용해 메모리 부담을 줄인다는 직관으로 설명한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 56:01 장면 ↗ e6

    DAPO의 동적 샘플링은 모두 맞거나 모두 틀려 비교 신호가 없는 질문 그룹을 제외하고 신호가 남은 그룹을 모은다. 개별 오답을 전부 버리는 방식과 구별한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 1:00:33 장면 ↗ e7

    긴 풀이를 RL로 학습할 때는 손실 하나만 보지 말고 응답 길이와 탐색 다양성을 함께 살펴야 한다. DAPO는 비대칭 클리핑, 토큰 단위 손실, 과도한 길이 처리 같은 안정화 장치를 소개한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 1:06:50 장면 ↗ e8

    후반의 연구 질문은 다수결 정확도 개선과 후보 중 정답이 존재하는 범위의 확대가 같은 현상인지 묻는다. 정답을 더 자주 내는 것과 새로운 문제를 풀 수 있게 되는 것을 나누어 평가한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  9. 원영상 1:12:10 장면 ↗ e9

    마지막 질의응답은 검증기를 늘리는 문제와 학습 데이터가 충분한지의 문제를 분리한다. 검증기 앙상블이 곧 데이터 부족을 해결한다고 요약하면 안 된다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑

07 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 7 | Self-Improvement and Deep Research Agents

코드 후보를 찾는 탐색과 외부 문서를 찾는 검색은 목적이 다르지만, 둘 다 후보를 선택하고 근거를 다시 확인해야 한다.

Part 7 원영상 보기 ↗ 1:12:27 · 영상 ID Uni9dqyuuDM

01 / 쉬운 원리와 비유

한눈에 보는 원리 코드 후보를 찾는 탐색과 외부 문서를 찾는 검색은 목적이 다르지만, 둘 다 후보를 선택하고 근거를 다시 확인해야 한다.

쉬운 비유 책방 진열안을 여러 개 시험하는 일과 지역사 기록을 찾아 출처를 확인하는 일은 모두 “찾기”라 부르지만 비교 대상이 다르다.

비유의 한계 예제 입력에서 행동이 같다고 모든 입력에서 같은 프로그램은 아니다. 검색한 문서를 읽었다는 것만으로 내용이 정확하거나 질문에 충분하다는 보장도 없다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

프로그램 공간에서 찾기

AlphaCode 소개는 많은 코드 후보를 생성한 뒤 문제에서 공개한 예제 테스트로 일부를 걸러낸다. 남은 후보는 제한된 제출 기회에 맞춰 실행 행동이 비슷한 것끼리 묶어 다양성을 유지한다. 예제 통과는 보이지 않는 테스트 통과 보장이 아니며 문자 모양만 다른 같은 풀이를 여럿 세는 것도 이득이 적다.

관련 근거: e1 · 7:26 · e3 · 21:29

발견과 제한된 제출

후보 중 통과 가능한 해답이 하나라도 있는지와 실제 고른 제한된 답안이 통과하는지 분리해야 한다. AlphaCode 2의 설명에서는 출발 모델, 여러 방식의 미세조정, 후보 채점도 함께 바뀐다. 그래서 성능 차이를 샘플 수 하나의 인과효과로 설명하지 않는다. 특이한 지표의 정확한 정의·수치는 원논문 대조 전 보류한다.

관련 근거: e2 · 14:39 · e4 · 25:55

문서를 단계별로 찾기

Search-o1 소개는 첫 검색 결과 하나로 끝내지 않는다. 추론 중 새로 생긴 빈칸에 맞춰 후속 검색어를 만들고 문서에서 현재 질문에 필요한 내용을 추려 메모에 남긴다. 코드 탐색과 달리 여기서는 출처의 신뢰도와 주장-인용 연결이 핵심이다.

관련 근거: e5 · 49:49 · e6 · 56:56

검색 루프와 학습 구분

검색 시점에 프롬프트로 도구 사용을 반복하는 설계와 검색 행동을 RL로 학습하는 접근을 혼동하지 않는다. 후반에 Search-R1은 짧게 대비된다. 어느 방식이든 잘못된 자료를 읽으면 유창한 설명도 거짓일 수 있으므로 근거 문장과 최종 주장 사이를 사람 눈으로 대조한다.

관련 근거: e8 · 1:08:34

자신감이 아니라 판정

더 많이 검색한 뒤 확신하는 말투를 쓰는 것은 실제 정답률의 증명이 아니다. 알고 있는 것과 모르는 것을 명시하고, 검증할 자료가 없으면 유보한다. 특정 벤치마크에서 전문가와의 비교도 모든 분야의 전문가 대체로 일반화하지 않는다.

관련 근거: e7 · 1:02:40 · e9 · 1:10:26

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이 카드: 카드 A 「2001년 개관」, 카드 B 「정정 공지: 2002년 개관」. 전부 합성 자료이며 실제 지역사 주장 아님.

합성 입력 질문 「개관 연도는?」와 카드 A·B 및 각 카드의 출처 유형.

진행 순서

  1. A만 보고 임시 답과 출처를 기록한다.
  2. 새 정보가 필요하다고 판단해 B를 읽고 답을 수정하거나 보류한다.
  3. 최종 답 옆에 어떤 카드가 정정 자료인지와 남은 불확실성을 적는다.

예상 결과 B를 더 신뢰할 근거가 충분하다면 합성 시나리오의 답은 2002년으로 수정된다.

실습 내 확인 카드 A만 본 경우와 B까지 본 경우의 근거표를 비교한다. 실제 검색·코드 생성·모델 학습 없음.

실패·반례 정정 공지의 발행 주체가 불명이라면 최신 문서라는 이유만으로 단정하면 안 된다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 카드 A만 본 경우와 B까지 본 경우의 근거표를 비교한다. 실제 검색·코드 생성·모델 학습 없음.

반례 정정 공지의 발행 주체가 불명이라면 최신 문서라는 이유만으로 단정하면 안 된다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. 예제 테스트가 통과한 코드의 숨은 실패는 어떻게 찾아낼 수 있나?
  2. 단계별 검색이 단순 검색 반복과 다른 이유는?

동료에게 공유할 검증 과제 합성 카드의 주장-출처 표를 공유하고 동료에게 근거가 부족한 칸을 표시받는다.

06 / 출처 · 시각 링크와 검토 범위 (9개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 7:26 장면 ↗ e1

    AlphaCode는 많은 프로그램 후보를 만든 뒤 문제에 주어진 테스트로 걸러낸다. 남은 후보도 모두 제출하지 않고 실행 행동의 유사성을 이용해 묶어 제한된 제출 기회를 활용한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 14:39 장면 ↗ e2

    pass@k는 생성 후보 중 정답 존재를 보는 반면, 강의의 10@k는 많은 후보에서 제한된 제출 후보를 고르는 성능까지 포함한다. 생성 능력과 선택 능력을 따로 평가해야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 21:29 장면 ↗ e3

    샘플 수가 늘어도 실질적으로 같은 풀이만 반복하면 탐색 범위가 넓어지지 않는다. 프로그램의 글자 차이보다 행동·접근법의 다양성을 확보하는 일이 중요하다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 25:55 장면 ↗ e4

    AlphaCode 2는 더 강한 기초 모델을 여러 방식으로 미세조정해 다양한 후보를 생성하고 별도의 채점 모델로 후보를 고른다. 성능 향상을 단순히 샘플 수 하나의 효과로 설명할 수 없다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 49:49 장면 ↗ e5

    Search-o1은 처음 한 번 검색하고 끝내지 않고 추론 중 새로 필요한 정보가 생길 때 검색어를 만든다. 여러 자료를 거쳐야 하는 질문에는 단계마다 다른 근거가 필요하다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 56:56 장면 ↗ e6

    문서를 그대로 모두 넣기보다 현재 질문과 이전 추론에 관련된 내용을 추출해 메모로 넣는다. 읽은 자료의 양보다 다음 판단에 필요한 정보를 정확히 남기는 일이 중요하다는 설명이다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 1:02:40 장면 ↗ e7

    전문가와의 비교는 특정 벤치마크 문제와 평가 조건 안의 결과다. 강의도 이를 사람 전문가 전반을 능가했다는 주장과 구분한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 1:08:34 장면 ↗ e8

    끝부분은 Search-o1의 프롬프트 기반 검색 순환과 Search-R1의 RL 기반 학습을 구분한다. Search-R1은 짧게 차이를 소개했을 뿐 상세히 다룬 논문은 아니다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  9. 원영상 1:10:26 장면 ↗ e9

    마지막 질의응답은 모델이 자신 있게 말하거나 높은 생성 확률을 보이는 것과 실제 정답 가능성이 일치하지 않는 과신 문제를 다룬다. 검색 후 불확실한 표현이 줄어드는 것만으로 사실 검증이 끝났다고 보면 안 된다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑

08 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 8 | Agentic Evaluations and Long Horizon Tasks

에이전트 평가에는 긴 과제의 성공 가능성, 실제 산출물 품질, 인용의 검증 가능성이 서로 다른 축으로 필요하다.

Part 8 원영상 보기 ↗ 1:15:18 · 영상 ID 8JAqLnTaZu4

01 / 쉬운 원리와 비유

한눈에 보는 원리 에이전트 평가에는 긴 과제의 성공 가능성, 실제 산출물 품질, 인용의 검증 가능성이 서로 다른 축으로 필요하다.

쉬운 비유 한 번 완주한 사람이 매일 같은 길을 안전하게 배달할 수 있는지는 다르다. 배달 거리, 제시간 도착, 물건의 상태를 따로 적어야 한다.

비유의 한계 사람이 끝내는 데 오래 걸리는 과제의 성공률을 다룬 시간 지평은 모델의 연속 실행시간이 아니다. 산출물 비교도 한 직업의 완전 자동화를 뜻하지 않는다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

시간 지평은 어떤 축인가

METR 소개는 사람이 과제를 완수하는 데 드는 시간을 기준으로 과제 난도를 묶고 모델의 성공 가능성과 관계를 본다. 성공률 조건이 높아지면 안정적으로 달성 가능한 범위는 더 좁아질 수 있다. 긴 과제를 한 번 성공했다고 같은 작업을 매번 맡길 수 있다는 결론은 아니다.

관련 근거: e1 · 5:29 · e2 · 20:26

실패를 종류별로 기록

계획을 잘못 세우는 일, 틀린 도구를 고르는 일, 계산 실수, 너무 일찍 포기하는 일, 같은 실패를 되풀이하는 일은 처방이 다르다. 따라서 점수 하나와 멋진 실행 기록만 보지 않는다. 참고자료를 열겠다고 말해놓고 열지 않은 경우는 실제 접근 기록과 결과를 맞춰 검사한다.

관련 근거: e3 · 24:23 · e5 · 39:07

직무 산출물 비교의 의미

GDPVal 소개는 실제 직무에 가까운 과제에서 전문가 산출물과 모델 산출물을 비교하는 평가를 다룬다. 한정된 작업의 선호도나 품질 판단을 업무 전체의 자동화 가능성, 제도적 허용, 경제 효과로 등치할 수 없다. 과제 정의와 직장 맥락이 충분한지도 따져야 한다.

관련 근거: e4 · 28:14 · e6 · 47:02

연구 답변의 출처 품질

DeepScholar-Bench 소개는 찾기, 사실 추출, 종합, 인용 검증을 나눠 본다. 인용이 붙어 있어도 그 문서가 바로 옆 주장을 뒷받침하는지, 인용할 주장에 근거가 누락됐는지 별도 평가한다. 훌륭한 자료를 미리 주어도 핵심 사실을 빼먹을 수 있다.

관련 근거: e7 · 54:46 · e8 · 57:22

예측이 아니라 경계 지정

평가축마다 모집단, 시간 기준, 사람 검수 방법이 다르다. 세 결과를 하나의 성장 그래프로 합치거나 미래 직업 대체 시점을 계산하지 않는다. 희귀한 특수 업무의 실패는 자료 부족과 모델 한계가 섞일 수 있다. 수치와 도표는 원 논문 재확인 전 옮기지 않는다.

관련 근거: e9 · 1:08:14 · e10 · 1:14:09

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이. 사람의 소요시간 20분, 모의 도우미 소요시간 1분은 수업용 가상값(연구 수치 아님). 사실표 「행사 장소=열람실」.

합성 입력 시도 A: 장소=강당, 출처 확인 없음. 시도 B: 장소=열람실, 사실표 확인 기록 있음.

진행 순서

  1. 사람 소요시간, 도우미 소요시간, 각 시도 성공 여부를 다른 칸에 쓴다.
  2. 두 시도의 문서 접근 기록과 장소를 사실표로 검증한다.
  3. 장기과제 가능 범위 또는 실무 대체율을 이 작은 사례에서 계산할 수 있는지 토론한다.

예상 결과 A는 실패, B는 이 제한된 사실검사에서 성공; 가상 시간값으로 일반적인 시간 지평을 추정하지 않는다.

실습 내 확인 사실표와 로그의 존재를 각각 확인한다. 이 데이터는 합성이며 실제 METR/GDPVal 평가나 모델 실행 결과가 아니다.

실패·반례 B 한 번의 성공을 반복 신뢰도 또는 직무 전체의 자동화로 일반화하면 실패다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 사실표와 로그의 존재를 각각 확인한다. 이 데이터는 합성이며 실제 METR/GDPVal 평가나 모델 실행 결과가 아니다.

반례 B 한 번의 성공을 반복 신뢰도 또는 직무 전체의 자동화로 일반화하면 실패다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. 사람 완료시간 기준과 모델 실행시간은 왜 다른 열인가?
  2. 인용이 많지만 주장과 맞지 않으면 어떤 평가축에서 실패하나?

동료에게 공유할 검증 과제 합성 평가표에 성공·실패의 근거와 빠진 맥락을 적고 동료가 채점 기준을 재현하도록 한다.

06 / 출처 · 시각 링크와 검토 범위 (10개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 5:29 장면 ↗ e1

    METR의 시간 지평은 사람이 과제를 완료하는 데 걸리는 시간을 기준으로 모델의 성공 가능성을 살핀다. 모델이 실제로 몇 시간 연속 작동했는지와 같은 뜻이 아니며, 성공률 기준도 함께 제시해야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 20:26 장면 ↗ e2

    할 수 있는 과제의 범위와 안정적으로 성공하는 정도는 별도 축이다. 강의에서 성공률 조건을 높이면 달성 가능한 시간 지평은 짧아지므로, 한 번 성공한 긴 작업을 곧바로 실무 자동화 능력으로 보지 않는다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 24:23 장면 ↗ e3

    평가 점수만 보지 말고 실패 원인을 분류한다. 계획·도구 선택의 오류, 잘못된 계산, 조기 포기, 실패 행동 반복을 구분해야 무엇을 고칠지 알 수 있다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 28:14 장면 ↗ e4

    GDPVal은 여러 직업의 실제 과제에서 모델 산출물이 전문가 산출물과 비교해 얼마나 선호되는지를 살핀다. 작업 길이, 산출물 품질, 직업 전체의 대체 가능성은 서로 같은 지표가 아니다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 39:07 장면 ↗ e5

    지시를 따르겠다고 말하면서 실제 참고자료는 열어보지 않는 실패가 소개된다. 보고서의 말투가 아니라 자료 접근 기록과 최종 결과를 확인해야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 47:02 장면 ↗ e6

    실무는 조직·업무 맥락에 의존한다. 잘 명시된 과제를 푸는 능력과 어떤 과제를 우선해야 하며 필요한 맥락이 무엇인지 스스로 알아내는 능력을 구분한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 54:46 장면 ↗ e7

    DeepScholar-Bench 설명은 지식 종합, 검색 품질, 검증 가능성을 나눈다. 인용이 실제 주장을 뒷받침하는지와 근거가 필요한 주장에 인용이 빠지지 않았는지를 각각 평가한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 57:22 장면 ↗ e8

    좋은 자료 목록을 제공해도 핵심 사실을 충분히 추출하고 종합하는 문제가 남는다. 검색 성공, 문장 유창성, 사실의 포괄성은 독립적으로 점검해야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  9. 원영상 1:08:14 장면 ↗ e9

    마지막 종합은 시간 지평·경제적 과제 품질·연구 종합 품질을 함께 보고 사람의 평가와 대조할 것을 강조한다. 하나의 성장 곡선만으로 미래의 신뢰도나 직업 대체를 예측할 수 없다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  10. 원영상 1:14:09 장면 ↗ e10

    마지막 질의응답은 드물고 특수한 작업에서의 한계를 데이터 부족과 모델 능력 문제의 혼합으로 설명한다. 데이터만 늘리면 모든 실패가 해결된다는 단일 원인 설명을 경계한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑

09 / SELF-IMPROVING AGENTS

Stanford CS329A Self-Improving AI Agents | Part 9 | Future Research Areas

미래 자기개선 연구는 생성·비평·과제 설계·환경 피드백을 더 깊게 연결하지만, 검증기 자체와 환경 대표성도 검사해야 한다.

Part 9 원영상 보기 ↗ 1:07:42 · 영상 ID AyO6wyu4DEg

01 / 쉬운 원리와 비유

한눈에 보는 원리 미래 자기개선 연구는 생성·비평·과제 설계·환경 피드백을 더 깊게 연결하지만, 검증기 자체와 환경 대표성도 검사해야 한다.

쉬운 비유 글쓴이, 편집자, 편집 검토자가 함께 일하고 연습문제까지 만드는 교실을 떠올리자. 교실에서 잘하는 일이 실제 현장에서도 통할지는 따로 확인한다.

비유의 한계 역할이 늘어도 독립적 판단이나 진실이 자동으로 생기지 않는다. 자체 생성 과제가 실제 세상을 닮지 않았으면 내부 점수만 올라갈 수 있다.

02 / 강연별 해설 · 근거를 연결해 읽기

강연별 해설

앞선 강의를 다시 연결

목표·환경 상호작용·피드백이라는 에이전트의 정의로 돌아와 생성과 선택, 추론 중 개선과 학습 시 개선을 구분한다. 이번 편은 공식 학기 전체를 압축 전사한 것이 아니라 회고와 선택된 연구 방향이다. 재생목록에 없는 수업 내용을 이 한 편에서 상세히 배웠다고 말할 수 없다.

관련 근거: e1 · 2:50

생성기와 비평기의 상호작용

여러 생성·비평 역할을 나누어 다양한 해답과 토론 자료로 미세조정하는 접근을 소개한다. 한 모델의 비슷한 답만 반복하는 문제에 대응하지만 모두가 같은 실수를 하면 다수의 비평도 소용이 없다. 역할 분리의 유용성은 독립된 근거와 후속 평가에서 확인해야 한다.

관련 근거: e2 · 8:56

비평의 이유까지 검증

DeepSeekMath-V2를 설명하는 부분은 생성기, 결함을 찾는 검증기, 그 검증 분석을 다시 점검하는 메타 검증기를 구별한다. 검증기가 없는 결함을 꾸며내면 올바른 답을 잘못 고칠 수 있다. 메타 검증은 오류 확률을 줄이려는 단계이지 형식적 무오류 보증이 아니다.

관련 근거: e3 · 18:03 · e4 · 19:04

문제 생성과 현실 피드백

자체 과제를 제안할 때 지나치게 쉬운 문제와 해결 불가능한 문제를 구별하고 실행 가능성·안전성·일관성을 확인한다. 실험 또는 시뮬레이션이 느릴 때 예측 보상을 쓰더라도 그 오차가 학습을 비틀 수 있다. 무엇보다 생성한 환경이 현실 과제와 피드백을 대표하는지 외부에서 점검해야 한다.

관련 근거: e5 · 27:40 · e6 · 28:22 · e7 · 38:21 · e11 · 1:05:04

효율과 계속 배우기

후반은 정확도만이 아니라 전력·자원에 따른 로컬/클라우드 처리와 지속학습의 차이를 묻는다. 전력과 에너지·시간·돈을 하나의 수치로 바꾸지 말며, 소비전력을 측정하지 않았다면 보고하지 않는다. 새 사실을 기억 저장소에 넣는 일은 가중치를 바꿔 새 행동 기술을 배우는 일과 다르다.

관련 근거: e8 · 47:30 · e9 · 57:14 · e10 · 1:03:03

03 / 합성 사례와 종이 실습

사례 · 직접 해보기

사전 준비 종이. 가상 원문 「좌석 12석」, 답안 「좌석 12석」, 비평 「원문은 10석이므로 고치라」. 실제 기관 수치 아님.

합성 입력 생성 답, 비평, 확인 가능한 원문을 서로 다른 카드로 둔다.

진행 순서

  1. 답안과 비평을 읽고 어느 쪽이 더 그럴듯한지 임시 판단한다.
  2. 원문을 열어 각 카드의 숫자를 독립 대조한다.
  3. 비평 수용/거부와 근거를 기록하고 다음 과제에는 출처 확인을 필수로 둔다.

예상 결과 답안은 이 합성 원문과 맞고 비평의 오류 지적은 거짓이다.

실습 내 확인 원문의 12석을 다시 대조한다. 모델 학습·전력 측정·실세계 실험은 하지 않았다.

실패·반례 비평이 권위 있어 보인다는 이유로 10석으로 수정하면 메타 검증 실패다.

사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님

04 / 검증 · 현실 적용의 한계

검증 기준

검증 방법 원문의 12석을 다시 대조한다. 모델 학습·전력 측정·실세계 실험은 하지 않았다.

반례 비평이 권위 있어 보인다는 이유로 10석으로 수정하면 메타 검증 실패다.

현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.

05 / 스스로 설명하기 · 동료 검토

Teach-back 질문

  1. 검증기의 근거를 왜 다시 검사해야 하는가?
  2. 기억 저장과 모델 가중치 학습, 실제 환경 성능 검증을 각각 설명하라.

동료에게 공유할 검증 과제 익명 생성·비평·원문 삼중 카드를 공유해 동료가 거짓 비평을 찾고 추가 검증 규칙을 제안하게 한다.

06 / 출처 · 시각 링크와 검토 범위 (11개)

근거와 출처

출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토

원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.

  1. 원영상 2:50 장면 ↗ e1

    종합 강의는 에이전트를 목표를 갖고 환경과 상호작용하며 피드백으로 행동을 고치는 시스템으로 다시 설명한다. LLM 한 번 호출하기와 여러 단계의 계획·도구·검증을 운영하는 일을 구분한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  2. 원영상 8:56 장면 ↗ e2

    Multi-agent finetuning은 생성 역할과 비평 역할을 나누고 여러 모델의 답과 토론을 학습에 활용한다. 하나의 모델이 비슷한 합성답만 되풀이하는 다양성 부족을 줄이려는 접근이다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  3. 원영상 18:03 장면 ↗ e3

    DeepSeekMath-V2 설명은 증명을 만드는 생성기, 문제점을 찾는 검증기, 그 검증 분석의 타당성을 살피는 메타 검증기를 구분한다. 정답 점수가 맞더라도 비평 이유가 틀릴 수 있다는 문제를 다룬다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  4. 원영상 19:04 장면 ↗ e4

    검증기도 존재하지 않는 오류를 만들어낼 수 있다. 따라서 비평이 그럴듯하다는 이유만으로 답을 수정하기보다 지적된 결함이 실제로 있는지 다시 확인해야 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  5. 원영상 27:40 장면 ↗ e5

    Absolute Zero로 후반 질문에서 지칭하는 접근은 과제 제안자와 풀이 역할을 함께 학습한다. 너무 쉽거나 풀 가능성이 없는 과제 대신 현재 능력으로 일부 성공·일부 실패하는 과제를 선택하여 학습 순서를 발전시킨다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  6. 원영상 28:22 장면 ↗ e6

    자체 생성한 코드 과제도 유효성 확인을 거친다. 실행 오류, 안전성, 반복 실행의 일관성 등을 확인하고 과제 버퍼에 경험을 남겨 학습이 무의미한 문제 생성으로 흐르지 않게 한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  7. 원영상 38:21 장면 ↗ e7

    실험·시뮬레이션이 너무 느리면 결과를 예측하는 보상 모델을 쓸 수 있지만, 그 예측의 부정확성이 학습 방향을 잘못 이끌 수 있다. 검증이 비싸다는 문제와 원리상 검증할 수 없다는 문제를 분리해 설명한다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  8. 원영상 47:30 장면 ↗ e8

    후반은 지능의 성능뿐 아니라 전력 효율을 함께 보는 intelligence per watt 지표를 소개한다. 강의의 정의는 평균 과제 정확도를 평균 소비전력으로 나눈 것이며, 평가 과제·모델·하드웨어 조건을 명시해야 해석할 수 있다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  9. 원영상 57:14 장면 ↗ e9

    로컬과 클라우드 중 하나만 택하기보다 과제 복잡도와 자원 조건에 따라 처리를 나누는 하이브리드 추론을 연구 방향으로 제시한다. 작은 모델의 유용성과 전력 효율은 실제 업무 분포에서 따로 측정할 대상이다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  10. 원영상 1:03:03 장면 ↗ e10

    지속학습 질의응답은 기억 저장소 업데이트와 가중치 학습의 선택이 응용에 달려 있다고 답한다. 새 사실을 데이터베이스에 추가하는 일과 새 영역의 추론·행동 기술을 익히는 일은 같지 않다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

  11. 원영상 1:05:04 장면 ↗ e11

    마지막 내용 질의응답은 환경을 자동 생성했는지보다 그것이 실제 세계의 과제와 피드백을 잘 대표하는지 묻는다. 시뮬레이션에서의 자기개선을 바로 실제 환경의 능력 향상으로 간주하지 않는다.

    비공식 공개 전체전사 기반 시각표지(영상 음성 미대조) · 제3자 전사 출처 ↗ (원문은 이 페이지에 게시하지 않음)

강의 목차로 ↑