구글 Gemini 3.7 Flash, 코딩 벤치마크 1위 — 분당 340토큰 속도
한 줄 요약: 구글이 8월 13일 코딩·에이전트 특화 Gemini 3.7 Flash를 출시해 FrontierCode 1.1 Main 벤치마크에서 현재 선두를 차지했다.
핵심
- 벤치마크 선두: FrontierCode 1.1 Main 43.6% (2위 Claude Sonnet 5 42.7%, 3위 GPT-5.6 Terra 41.3%)
- 코딩 도약: DeepSWE v1.1 65.3% — 전작 Gemini 3.6 Flash(49.0%)에서 3주 만에 16%p 상승
- 속도: Artificial Analysis 측정 기준 약 340 output token/s — 추론 모델 중 최상위
- 가격: 입력 $0.75 / 출력 $3.75 (100만 토큰당, 2026년 12월 31일까지 특가; 이후 $1.50/$7.50)
- 컨텍스트: 1M 토큰 유지 (전작과 동일)
왜 중요한가
Gemini 3.7 Flash는 전작보다 23일 만에 출시되며 구글의 공격적인 코딩 AI 경쟁을 보여준다. 속도와 가격, 벤치마크를 동시에 개선한 조합은 에이전트 워크플로를 구축하는 개발자에게 유력한 선택지가 된다. 다만 연말 이후 가격이 2배로 오를 예정이라 장기 비용 계획에 유의가 필요하다.
더 보기
- Gemini 3.7 Flash Model Card — Google DeepMind
- Gemini 3.7 Flash: Pricing, Benchmarks and What Changed — FelloAI
이 이야기의 흐름
기사에 나온 도구
- LLM
- — Large Language Model의 약자로, '거대 언어 모델'이라고 해요. ChatGPT, Claude 같은 AI가 바로 LLM이에요. 엄청나게 많은 텍스트를 학습해서 사람처럼 글을 쓰고 대화할 수 있어요.
- 토큰
- — AI가 텍스트를 처리하는 단위예요. 대략 한글 1글자 = 1-2토큰, 영어 1단어 = 1토큰 정도로 생각하면 돼요. AI 서비스 요금은 보통 토큰 수로 계산해요.
- 벤치마크
- — 여러 AI 모델의 성능을 같은 기준으로 비교하는 시험이에요. 코딩, 수학, 추론 등 항목별 점수로 순위를 매겨요. 실제 사용자 투표로 순위를 정하는 LM Arena가 특히 많이 인용돼요.