본문으로 건너뛰기
뉴스 목록

메타 차기 모델 'Watermelon', 내부 벤치마크에서 GPT-5.5 수준 달성

한 줄 요약: 메타 AI 수장 Alexandr Wang이 7월 3일 사내 타운홀에서 차기 플래그십 Watermelon이 GPT-5.5와 동등한 성능을 여러 벤치마크에서 달성했다고 발표했다.

핵심

  • MMLU 92.4%(GPT-5.5와 동일), HumanEval 96.3%(GPT-5.5의 96.1% 소폭 상회) — 내부 미발표 수치
  • 전 세대 Muse Spark 대비 약 10배 더 많은 컴퓨팅으로 학습 중; 공개 출시 일정 미정
  • 메타 내부에서 과잉 컴퓨팅 용량 및 AI 진보 속도 둔화 우려가 제기된 직후 발표
  • Wang의 발언은 외부 검증되지 않은 내부 수치; 재현 가능한 공개 평가 아님

왜 중요한가

Watermelon이 공개 출시 시 내부 성능을 그대로 유지한다면 오픈 웨이트 전략이 프런티어급 모델을 모든 개발자에게 무상 제공하게 되어 클로즈드 vs. 오픈 경쟁 구도를 다시 뒤흔들 수 있다. 다만 현재는 단일 사내 발언 수준이므로, 공개 검증 전까지 확인된 성능이 아닌 방향성 신호로 봐야 한다.

더 보기

이 이야기의 흐름

  1. 구글, 메타의 Gemini AI 사용량 제한…컴퓨트 부족이 빅테크 파트너십에 균열
  2. 저커버그, AI 예측 시장 앱 'Arena' 직접 지시 — Polymarket·Kalshi에 메타가 도전장
  3. 메타, 자체 브랜드 AI 안경 '메타 글라스' 출시 — $299부터, Ray-Ban 없이
  4. OpenAI, 생명과학 AI 벤치마크 LifeSciBench 공개…최강 모델도 33%만 통과
LLM
— Large Language Model의 약자로, '거대 언어 모델'이라고 해요. ChatGPT, Claude 같은 AI가 바로 LLM이에요. 엄청나게 많은 텍스트를 학습해서 사람처럼 글을 쓰고 대화할 수 있어요.
벤치마크
— 여러 AI 모델의 성능을 같은 기준으로 비교하는 시험이에요. 코딩, 수학, 추론 등 항목별 점수로 순위를 매겨요. 실제 사용자 투표로 순위를 정하는 LM Arena가 특히 많이 인용돼요.

뉴스레터 구독

무료 뉴스레터

매주 핵심 AI 소식, 한 번에 받기

쏟아지는 AI·LLM 뉴스 중 꼭 알아야 할 것만 골라 메일로 보내드려요. 뉴스레터 발송이 시작되면 구독자분들께 가장 먼저 보내드립니다.