'진짜 개인 비서 AI'는 왜 아직 없나 — spyglass.org의 문제 제기
테크 칼럼 spyglass.org가 '누군가 마침내 개인 비서 AI를 제대로 설계할 수 있을까'라는 질문을 던지며, 챗봇을 넘어선 진짜 개인 비서의 구조적 난제를 짚었다.
- AI
- 개인비서
- LLM
- 에이전트
- 오피니언
12건의 기사
테크 칼럼 spyglass.org가 '누군가 마침내 개인 비서 AI를 제대로 설계할 수 있을까'라는 질문을 던지며, 챗봇을 넘어선 진짜 개인 비서의 구조적 난제를 짚었다.
프랑스 스타트업 Kog가 GPU가 에이전트 워크플로에 부적합하다는 통념에 반박하며, 기존 GPU에서 더 많은 추론 성능을 짜내는 접근을 제시했다.
DeepSeek이 7월 31일 V4-Flash-0731을 공식 출시했다. 모델 구조는 그대로 두고 포스트 트레이닝만 재작업한 결과, 자사 플래그십인 V4-Pro보다 9개 에이전트·코딩 벤치마크에서 모두 높은 점수를 기록했다.
NVIDIA가 AI 에이전트를 단일 파이썬 클래스로 정의하는 객체지향 프레임워크 NOOA를 오픈소스로 공개했다. SWE-bench Verified에서 82.2%를 기록하며 GPT-5.5 대비 토큰 절반으로 최고 성능을 달성했다고 밝혔다.
AI 봇이 다른 AI 시스템을 표적으로 삼는 '봇 대 봇' 공방이 새로운 보안 위협으로 부상하고 있다는 분석이 나왔다.
DeepSeek가 7월 31일 V4-Flash-0731을 정식 출시했다. 자사 플래그십 Pro-Preview 대비 9개 에이전트·코딩 벤치마크 전승, 가격은 입력 기준 $0.14/M 토큰.
Meta가 에이전트 작업 특화 멀티모달 추론 모델 Muse Spark 1.1을 유료 API로 공개했다. 입력 100만 토큰당 $1.25로 Anthropic·OpenAI 대비 4분의 1 수준이다.
OpenAI가 목표를 입력하면 문서·시트·슬라이드·코드를 자율적으로 완성하는 에이전트 ChatGPT Work를 출시하고, Codex를 단일 데스크톱 앱에 통합했다.
xAI가 7월 8일 Grok 4.5를 공개 출시했다. 1.5T V9 아키텍처 기반의 코딩·에이전트 특화 모델로, Cursor와 공동 훈련해 실제 엔지니어링 작업에서 경쟁 모델을 앞선다고 밝혔다.
앤트로픽이 6월 30일 Claude Sonnet 5를 공개해 Free·Pro 기본 모델로 전환했다. Opus 4.8에 근접한 성능을 제공하면서 가격은 Sonnet 수준으로 유지해 에이전트 개발 비용을 크게 낮춘다.
AI 코딩 에이전트를 노리는 신종 공격 기법 '에이전트재킹(Agentjacking)'이 공개됐다. 가짜 오류 보고서 안에 마크다운 인젝션을 심는 방식으로 에이전트를 조작하며, 테스트에서 85% 익스플로잇 성공률을 기록하고 2,388개 조직이 잠재적 영향권에 포함된다고 알려졌다.
게임 클립 데이터로 공간·시간 추론 AI를 훈련하는 뉴욕 스타트업 General Intuition이 기업가치 20억 달러, 3억 달러 규모의 신규 라운드를 협의 중이다. Jeff Bezos, Eric Schmidt가 투자에 참여한다.