H컴퍼니, 다국어·멀티모달 인코더 'NeoMME' 공개
H컴퍼니가 여러 언어와 이미지·텍스트를 함께 처리하도록 설계한 경량 인코더 NeoMME를 Hugging Face 블로그를 통해 소개했다.
- 멀티모달
- 인코더
- 다국어
- 오픈모델
- Hugging Face
9건의 기사
H컴퍼니가 여러 언어와 이미지·텍스트를 함께 처리하도록 설계한 경량 인코더 NeoMME를 Hugging Face 블로그를 통해 소개했다.
중국 딥시크가 이미지 인식을 지원하는 새 AI 모델을 공개하며 앤트로픽의 최상위 모델급 성능을 주장했다고 전해졌다.
알리바바가 5일 3세대 이미지 생성 모델 Qwen Image 3.0 Pro를 발표했다. GPT Image 2에 이어 세계 2위 이미지 생성 모델을 자처하지만 벤치마크와 모델 가중치는 공개하지 않아 논란이다.
바이트댄스가 Seedream 5.0 Pro를 공개했다. 딥싱킹 추론, 레이어 정밀 편집, 10개 이상 언어 네이티브 지원, 네이티브 2K 출력을 결합해 OpenAI GPT-Image 2의 직접 경쟁자로 자리잡겠다는 포석이다.
구글이 6월 30일 초고속·저비용 이미지 모델 Nano Banana 2 Lite와 동영상 생성·편집 모델 Gemini Omni Flash를 동시 공개했다.
알리바바가 AI 동영상 생성 모델 HappyHorse 1.1을 출시하며 글로벌 순위 2위에 올랐다. OpenAI Sora 서비스 종료, ByteDance Seedance 글로벌 롤아웃 중단으로 생긴 공백을 중국 빅테크가 빠르게 메우고 있다.
애플이 WWDC 2026에서 제3세대 애플 파운데이션 모델(AFM 3) 5종을 공개했다. 온디바이스 20B 파라미터 멀티모달 모델을 포함하며, 클라우드 버전은 Google Cloud의 NVIDIA GPU 위에서 구동된다.
구글이 Android 17과 6월 Pixel Drop을 배포하며 AI 동영상 편집 기능 Gemini Omni와 음악 창작 도구 Lyria 3를 새롭게 선보였다.
중국 AI 연구소 MiniMax가 6월 1일 오픈웨이트 모델 M3를 출시했다. 새로운 희소 어텐션 구조(MSA)로 100만 토큰 컨텍스트를 구현하고, SWE-Bench Pro에서 GPT-5.5를 상회하는 성능을 GPT-5.5 비용의 5~10% 수준에 제공한다.