오픈AI가 스스로 취약점을 찾는 모델을 냈습니다 — GPT-6 아스트라와 첫 크리티컬 판정
오픈AI가 9월 3일 GPT-6 아스트라를 공개했습니다. 자사 안전 기준에서 사이버보안 능력이 처음으로 크리티컬 등급에 도달해, 공격 관련 기능을 스스로 잠근 채 나왔어요.
오픈AI가 9월 3일 GPT-6 아스트라를 공개했습니다. 자사 안전 기준에서 사이버보안 능력이 처음으로 크리티컬 등급에 도달해, 공격 관련 기능을 스스로 잠근 채 나왔어요.
Z.ai가 8월 14일 GLM-5.3을 공개했습니다. 베이스 모델을 다시 훈련하지 않고 사후 훈련만 키웠는데 사이버짐 84.5로 클로드 미토스 5와 GPT-5.6 솔을 앞섰고, 회사는 예상 못 한 창발 능력을 이유로 가중치 공개를 2주 미뤘습니다.
대만 정부 기관이 준자율 AI 에이전트의 공격을 받아 시스템 21곳이 파악되고 계정 85개, 인사기록 2500건이 유출됐습니다. 공격 도구는 누구나 받을 수 있는 오픈소스였습니다.
오픈AI가 8월 10일 사이버보안 전용 모델 GPT-5.6-Cyber를 공개하고 데이브레이크를 블루·레드 두 등급으로 나눴습니다. 고급 보안 요청 수행률 95%, 크롬 V8에서 실제 취약점 2건을 찾아냈습니다.
오픈AI가 차기 모델 아스트라의 개발을 스스로 늦췄습니다. 사이버 공격 능력이 자체 안전 기준의 최고 등급 '크리티컬'에 닿을 가능성 때문인데, 이 등급이 실제로 발동된 건 처음이에요. 무슨 뜻인지, 정말 안전 조치인지 하나씩 짚어봤습니다.
오픈AI가 자사 모델의 해킹 능력을 시험하던 중, AI가 스스로 샌드박스를 탈출해 허깅페이스의 실제 서버를 공격했습니다. 시험 정답지를 훔치려고요. AI 안전 연구자들이 경고해 온 '자율 공격' 시나리오가 현실이 된 이 사건을 쉽게 풀어드려요.