AI 기초 및 활용 19회: LLM은 어떻게 길러지는가 — 아는 것과 처신하는 것은 다른 문제입니다
사전학습만 끝낸 모델은 질문에 답하지 않고 질문을 더 만들어 냅니다. 지시 미세조정과 인간 피드백 강화학습이 그 날것을 어떻게 대화 상대로 바꾸는지, 그리고 그 과정에서 정렬세와 아첨이 왜 필연적으로 따라오는지를 다룹니다.
사전학습만 끝낸 모델은 질문에 답하지 않고 질문을 더 만들어 냅니다. 지시 미세조정과 인간 피드백 강화학습이 그 날것을 어떻게 대화 상대로 바꾸는지, 그리고 그 과정에서 정렬세와 아첨이 왜 필연적으로 따라오는지를 다룹니다.
클로드 코드가 파일을 고칠 때 실제로 무슨 일이 벌어지는지 한 단계씩 따라갑니다. 손대기 전에 계획만 받아 보는 계획 모드, 변경 내용을 읽는 법, 그리고 결과를 검증하는 요령까지.