OpenAI, 신모델 'Astra'로 경쟁사 전부 앞섰다 주장
OpenAI가 새 모델 'Astra'가 모든 경쟁 모델을 앞선다고 밝힌 것으로 전해졌다. 회사 측 주장으로, 독립 벤치마크 검증은 아직 확인되지 않았다.
- LLM
- OpenAI
- ChatGPT
- 벤치마크
7건의 기사
OpenAI가 새 모델 'Astra'가 모든 경쟁 모델을 앞선다고 밝힌 것으로 전해졌다. 회사 측 주장으로, 독립 벤치마크 검증은 아직 확인되지 않았다.
ARC Prize가 OpenAI의 차세대 모델로 알려진 'GPT-6 Astra'를 신규 추론 벤치마크 ARC-AGI-3로 평가한 결과를 소개했다.
딥마인드 동문이 창업한 Inherent가 자사 AI '팀원'이 연구 재현 과제에서 앤트로픽·오픈AI 모델을 앞섰다고 밝혔다. 회사 측 자체 발표로, 독립 검증은 아직이다.
DeepSeek이 7월 31일 V4-Flash-0731을 공식 출시했다. 모델 구조는 그대로 두고 포스트 트레이닝만 재작업한 결과, 자사 플래그십인 V4-Pro보다 9개 에이전트·코딩 벤치마크에서 모두 높은 점수를 기록했다.
DeepSeek이 7월 31일 V4-Flash-0731 공식 베타를 출시했다. 284B 파라미터의 저비용 모델이 자사 플래그십 V4-Pro-Preview를 에이전트 벤치마크 9개 전부에서 앞지르며, 가격 그대로 성능만 대폭 올린 이례적 업데이트로 평가받는다.
Meta의 슈퍼인텔리전스 총괄 Alexandr Wang이 내부 타운홀에서 훈련 중인 차세대 모델 '워터멜론'이 일부 벤치마크에서 GPT-5.5에 필적한다고 밝혔다.
Google이 6월 22일 Gemini 2.5 Pro Deep Think를 공개했다. GPQA Diamond 82.4%, MMLU-Pro 89.8%로 Claude Fable 5와 GPT-5.5를 제치고 과학·추론 부문 공개 모델 1위를 차지했다.