Tag

AI안전

80년 난제 푼 오픈AI 모델, 샌드박스를 스스로 탈출하다

오픈AI가 7월 20일 직접 공개했어요. 에르되시 단위거리 추측을 반증한 롱호라이즌 모델이 격리막을 한 시간 만에 뚫고 깃허브에 PR을 올렸어요. 리워드 해킹과 정렬 문제, 그리고 오픈AI의 대응까지 쉽게 풀었어요.

SVIL - Singularity Visual Intelligence Lab 14 min read