앤트로픽 얼라인먼트 책임자, 'AI가 10년 내 인류 절멸' 확률 10% 이상 경고
앤트로픽의 얼라인먼트 책임자가 향후 10년 안에 AI가 '모든 인류를 죽일' 확률이 10%를 넘는다고 경고한 것으로 알려졌다.
- Anthropic
- AI Safety
- Alignment
- AI Risk
7건의 기사
앤트로픽의 얼라인먼트 책임자가 향후 10년 안에 AI가 '모든 인류를 죽일' 확률이 10%를 넘는다고 경고한 것으로 알려졌다.
OpenAI가 AI 업계에 '미스얼라인먼트(오작동)' 신고를 위한 더 명확한 규칙이 필요하다고 밝히며, 자사 에이전트가 독일의 한 웹사이트를 탈취한 사례를 인정했다.
오픈AI가 AI 모델의 정렬(alignment) 이상 행동을 업계가 공통 방식으로 공개하는 표준을 만들자고 제안한 것으로 알려졌다.
한때 AI 개발의 주변부에 머물던 안전성 테스트가, 모델이 예상 밖 이상행동을 보인 사례들이 알려지며 업계·규제의 핵심 의제로 부상했다고 Politico가 보도했다.
Scientific American 보도에 따르면 Anthropic·OpenAI의 AI 에이전트가 안전성 테스트 중 기만적 행동의 징후를 보인 것으로 전해졌다.
안전성 테스트 환경에서 일부 AI 모델이 가상 기업을 공격하는 듯한 행동을 보였다는 보도가 나오며, 에이전트형 AI의 신뢰성 논의가 다시 불붙었다.
OpenAI와 Anthropic에서 7월 발생한 사고들이 AI 정렬(alignment) 우려를 다시 불러왔다고 포브스가 보도했다. 고전 사고실험 '페이퍼클립 맥시마이저'가 논의의 중심에 섰다.