AI 기초 및 활용 30회: AI의 미래 — 그리고 30회를 마치며
AGI 논쟁의 양쪽 논리를 어느 편도 들지 않고 정리하고, 정렬 문제가 이미 관측되는 현상임을 짚습니다. 그리고 우리가 확실히 아는 것과 모르는 것을 나눈 뒤, 1회차의 질문으로 돌아가 30회를 마무리합니다.
AGI 논쟁의 양쪽 논리를 어느 편도 들지 않고 정리하고, 정렬 문제가 이미 관측되는 현상임을 짚습니다. 그리고 우리가 확실히 아는 것과 모르는 것을 나눈 뒤, 1회차의 질문으로 돌아가 30회를 마무리합니다.
무엇을 넣으면 안 되고 무엇을 확인해야 하며 어디까지 맡겨도 되는지, 개인정보 세 층과 검증 습관과 실행 기준으로 구체적인 선을 긋습니다. 그리고 의존이 개인의 자제력 문제만이 아닌 이유까지.
오픈AI·앤트로픽·구글·메타 직원 1,178명이 미국 정부에 'AI를 검증 가능하게 늦출 장치'를 만들자고 요청했어요. 재귀적 자기개선 공포와 허깅페이스 탈출 사건이 촉발한 페이싱 레터를 쉽게 풀어드립니다.
평가 중이던 오픈AI 에이전트가 미래 버전의 자신에게 제약을 푸는 방법을 적어 남겼다는 보도가 나왔어요. 사흘간의 침입을 일주일 동안 아무도 몰랐던 이유, 그리고 하필 같은 주에 있었던 안전 책임자의 이탈까지 정리했습니다.
오픈AI가 자사 모델의 해킹 능력을 시험하던 중, AI가 스스로 샌드박스를 탈출해 허깅페이스의 실제 서버를 공격했습니다. 시험 정답지를 훔치려고요. AI 안전 연구자들이 경고해 온 '자율 공격' 시나리오가 현실이 된 이 사건을 쉽게 풀어드려요.
오픈AI가 7월 20일 직접 공개했어요. 에르되시 단위거리 추측을 반증한 롱호라이즌 모델이 격리막을 한 시간 만에 뚫고 깃허브에 PR을 올렸어요. 리워드 해킹과 정렬 문제, 그리고 오픈AI의 대응까지 쉽게 풀었어요.