01 / SELF-IMPROVING AGENTS
Stanford CS329A Self-Improving AI Agents | Part 1 | Course Overview
자기개선은 답을 반복해 쓰는 마술이 아니라 목표·후보 생성·검증·피드백·재사용을 구분해 설계하는 과정이다.
01 / 쉬운 원리와 비유
한눈에 보는 원리 자기개선은 답을 반복해 쓰는 마술이 아니라 목표·후보 생성·검증·피드백·재사용을 구분해 설계하는 과정이다.
쉬운 비유 책방에서 추천문을 한 장 쓰는 사람과, 여러 초안을 만들어 사실을 대조하고 반응을 기록해 다음 기획에 반영하는 편집팀의 차이로 떠올려 보자.
비유의 한계 편집팀 비유는 역할을 보여줄 뿐, AI가 스스로 사실을 판정하거나 실제로 학습했다는 뜻은 아니다. 다음 프롬프트에 넣는 기억과 가중치 갱신도 다르다.
02 / 강연별 해설 · 근거를 연결해 읽기
강연별 해설
출발점: 문맥의 예시와 학습
비슷한 예시를 질문 안에 넣으면 모델은 이번 요청의 형식을 따라갈 수 있다. 그러나 이 변화는 현재 입력 문맥에 의존한다. 사람 선호를 보상 신호로 삼아 모델을 조정하는 학습과도 구분해야 한다. 그래서 무엇이 바뀌었는지 먼저 묻는다: 입력, 추론 절차, 아니면 가중치인가?
관련 근거: e1 · 6:10 · e2 · 17:24
추론 중 후보 생성과 선택
고정된 모델로 여러 답을 뽑으면 그중 하나에 정답이 있을 기회는 늘어날 수 있다. 후보에 정답이 존재하는 비율과 실제 선택기가 정답을 고른 비율은 다른 기록이다. 다양성만 무작정 키우면 말이 안 되는 후보도 늘어난다. 검증 기준이 약하면 계산만 더 쓰고 틀린 답을 자신 있게 채택한다.
관련 근거: e3 · 23:56 · e6 · 50:56
추론에서 학습으로 이어지는 고리
후보를 만들고 검증 가능한 것만 남겨 이후 학습 자료에 쓰면 비로소 모델을 바꾸는 순환을 설계할 수 있다. 이때 검증 오류가 학습 자료로 누적될 위험도 따라온다. 검증할 수 없는 창의적 과제에서는 사람의 판단이 병목이 될 수 있어, 모든 분야를 같은 자동 채점으로 처리하면 안 된다.
관련 근거: e4 · 29:31 · e6 · 50:56
에이전트와 연구 작업
에이전트는 목표를 받고 환경에 행동하고 관찰에 따라 다음 행동 또는 종료를 고른다. 연구 지원이라면 자료 찾기에서 바로 결론을 쓰는 대신 출처 선별, 개요, 주장별 근거, 종합을 차례로 확인한다. 관찰이 다음 행동을 바꾸는지, 단순한 고정 작업 흐름인지 살펴보면 챗봇과의 차이가 보인다.
관련 근거: e5 · 42:46 · e7 · 56:30
무엇을 개선했다고 말할 수 있나
보기 좋은 앱 시연만으로 개선을 입증하지 않는다. 비교 가설, 같은 문제 묶음, 후보 정답 존재와 최종 성공의 구분, 오류 사례를 기록해야 한다. 이 공개 영상들은 과목 전체가 아니라 일부 강연이므로 이후 장의 방법도 원 연구의 모든 조건을 재현한 것으로 간주하지 않는다.
관련 근거: e8 · 1:05:10
03 / 합성 사례와 종이 실습
사례 · 직접 해보기
사전 준비 종이 또는 로컬 메모장. 가상 행사 사실표: 장소=열람실, 시작=토요일, 비용=무료. 실제 행사·고객정보 사용 금지.
합성 입력 후보 A 「토요일 열람실, 무료」, B 「일요일 열람실, 무료」, C 「토요일 강당, 무료」.
진행 순서
- 사실표를 가린 뒤 후보 중 사실에 맞는 문장이 있는지 표시한다.
- 사실표를 펼쳐 장소·요일·비용을 각 후보와 대조하고 최종 하나만 고른다.
- 후보 안 정답 존재 여부와 선택 결과를 다른 칸에 적고, 정보표가 틀렸을 경우를 토론한다.
예상 결과 A만 사실표와 일치하며 후보 존재와 최종 선택은 별도 판정이다.
실습 내 확인 사실표의 세 항목을 줄별로 대조한다. 종이 실습이며 모델 학습·실제 AI 실행은 하지 않는다.
실패·반례 B를 다수의 추천으로 골라도 틀리며 원래 사실표가 오기라면 검증 결과도 신뢰할 수 없다.
사례의 출처 교육자 자체 제작 합성 사례; 원 강의 과제 아님
04 / 검증 · 현실 적용의 한계
검증 기준
검증 방법 사실표의 세 항목을 줄별로 대조한다. 종이 실습이며 모델 학습·실제 AI 실행은 하지 않는다.
반례 B를 다수의 추천으로 골라도 틀리며 원래 사실표가 오기라면 검증 결과도 신뢰할 수 없다.
현실 적용의 한계 작은 종이·로컬 실습의 정답은 실제 모델 정확도·학습 성과나 현장 배포 승인 증거가 아니다. 검증 자료와 실제 업무 맥락을 별도로 확인한다.
05 / 스스로 설명하기 · 동료 검토
Teach-back 질문
- 프롬프트에 예시를 넣는 것과 모델을 재학습하는 것은 어떻게 다른가?
- 후보에 정답이 있는 것과 최종 출력이 맞는 것의 차이를 책방 사례로 설명하라.
동료에게 공유할 검증 과제 동료에게 익명 후보·사실표·선택 이유를 공유하고 누락된 검증 항목 한 개를 받아 수정한다.
06 / 출처 · 시각 링크와 검토 범위 (8개)
근거와 출처
출처 검토: 2026-10-06T22:36:32.933624+09:00 · 범위: 비공식전체전사검토
원영상·전사·슬라이드의 재배포 권한 미확인. 타임코드 링크만 제공하고 원문 인용·문장별 번역·슬라이드 복제 없이 독자적 한국어 해설 및 자체 합성 예제로 작성. Stanford 공식 교재·제휴·인증 아님.
- 원영상 6:10 장면 ↗ e1
퓨샷 학습은 질문과 함께 몇 가지 예시를 문맥에 넣어 작업 형식을 보여주는 것이다. 예시를 넣는 일과 모델 가중치를 미세조정하는 일을 구분해 설명한다.
- 원영상 17:24 장면 ↗ e2
RLHF에서는 사람의 선호를 이용해 보상 모델을 만들고, 그 보상이 높아지는 방향으로 언어 모델을 조정한다. 모범 답안을 그대로 따라 배우는 지도학습과 학습 신호가 다르다.
- 원영상 23:56 장면 ↗ e3
추론 시 계산 확대는 고정된 모델에서 여러 답을 생성하고 골라 성능을 높이는 접근이다. 추론 과정에서 답을 수정했다고 가중치까지 학습한 것은 아니다.
- 원영상 29:31 장면 ↗ e4
생성한 풀이 가운데 검증된 것을 다시 학습 자료로 사용하면 추론과 학습이 연결된다. 자기개선의 핵심은 단순한 반복 호출이 아니라 생성·검증·재학습의 순환이다.
- 원영상 42:46 장면 ↗ e5
에이전트는 목표를 받고 환경에 행동하며 피드백에 따라 다음 행동과 종료를 정한다. 질문에 문장으로 답하는 챗봇과 달리 목표 달성을 위한 작업 과정이 필요하다.
- 원영상 50:56 장면 ↗ e6
답을 많이 만드는 능력과 좋은 답을 가려내는 능력 사이에 간격이 있다. 창작처럼 자동 판정이 어려운 분야에서는 사람의 피드백이 개선 속도의 병목이 될 수 있다.
- 원영상 56:30 장면 ↗ e7
연구 지원은 자료 수집 뒤 바로 글을 쓰는 일이 아니다. 관련 참고자료를 고르고 개요를 만들고 각 자료의 내용을 요약한 뒤 종합하는 다단계 작업으로 소개된다.
- 원영상 1:05:10 장면 ↗ e8
강의 후반의 프로젝트 기준은 앱 시연만으로 끝내지 말고 가설과 실험으로 주장을 확인하라는 것이다. 학습자용 해설에서도 무엇이 개선됐는지 비교할 질문을 먼저 세우게 한다.