본문으로 건너뛰기
뉴스 목록

구글 Gemini 3.7 Flash, 코딩 벤치마크 1위 — 분당 340토큰 속도

한 줄 요약: 구글이 8월 13일 코딩·에이전트 특화 Gemini 3.7 Flash를 출시해 FrontierCode 1.1 Main 벤치마크에서 현재 선두를 차지했다.

핵심

  • 벤치마크 선두: FrontierCode 1.1 Main 43.6% (2위 Claude Sonnet 5 42.7%, 3위 GPT-5.6 Terra 41.3%)
  • 코딩 도약: DeepSWE v1.1 65.3% — 전작 Gemini 3.6 Flash(49.0%)에서 3주 만에 16%p 상승
  • 속도: Artificial Analysis 측정 기준 약 340 output token/s — 추론 모델 중 최상위
  • 가격: 입력 $0.75 / 출력 $3.75 (100만 토큰당, 2026년 12월 31일까지 특가; 이후 $1.50/$7.50)
  • 컨텍스트: 1M 토큰 유지 (전작과 동일)

왜 중요한가

Gemini 3.7 Flash는 전작보다 23일 만에 출시되며 구글의 공격적인 코딩 AI 경쟁을 보여준다. 속도와 가격, 벤치마크를 동시에 개선한 조합은 에이전트 워크플로를 구축하는 개발자에게 유력한 선택지가 된다. 다만 연말 이후 가격이 2배로 오를 예정이라 장기 비용 계획에 유의가 필요하다.

더 보기

이 이야기의 흐름

  1. xAI, Grok 4.6 출시 — 파라미터 유지·추론 품질로 Claude Opus 4.8 추월
  2. 앤트로픽, 클로드 코드 '오토 모드' 기본값으로 전환
  3. xAI, Grok 4.5 공개 출시 — Opus급 성능, Claude보다 저렴한 가격
  4. 알리바바, Qwen3-Coder-Next 공개 — 80B 파라미터에 3B만 활성화, SWE-Bench 70.6%

기사에 나온 도구

LLM
— Large Language Model의 약자로, '거대 언어 모델'이라고 해요. ChatGPT, Claude 같은 AI가 바로 LLM이에요. 엄청나게 많은 텍스트를 학습해서 사람처럼 글을 쓰고 대화할 수 있어요.
토큰
— AI가 텍스트를 처리하는 단위예요. 대략 한글 1글자 = 1-2토큰, 영어 1단어 = 1토큰 정도로 생각하면 돼요. AI 서비스 요금은 보통 토큰 수로 계산해요.
벤치마크
— 여러 AI 모델의 성능을 같은 기준으로 비교하는 시험이에요. 코딩, 수학, 추론 등 항목별 점수로 순위를 매겨요. 실제 사용자 투표로 순위를 정하는 LM Arena가 특히 많이 인용돼요.

뉴스레터 구독

무료 뉴스레터

매주 핵심 AI 소식, 한 번에 받기

쏟아지는 AI·LLM 뉴스 중 꼭 알아야 할 것만 골라 메일로 보내드려요. 뉴스레터 발송이 시작되면 구독자분들께 가장 먼저 보내드립니다.