Google I/O 닷새 전, AI 전선이 세 갈래로 갈라졌다
- 공유 링크 만들기
- X
- 이메일
- 기타 앱

토큰 쓰는 양을 어떻게 줄일까 고민하다가 Qwen3.5 122B를 제 M4에 깔아봤습니다. 그랬더니 토큰이 한 자릿수로 떨어졌습니다.
API 호출이 0이 된 건 의도한 대로였습니다. 그런데 챗 답변이 한 글자씩 깜빡이며 떨어지는 걸 보고 있자니, 초당 토큰 수도 한 자릿수라는 게 그제야 눈에 들어왔습니다. 비용도 한 자릿수, 속도도 한 자릿수. 같은 말이 두 가지 뜻으로 동시에 들렸고, 하나는 제가 원한 거였고 하나는 전혀 원하지 않은 거였습니다. 화면 앞에서 잠깐 멍하게 있었던 것 같습니다.
노트북 한 대에서 생긴 이 어긋남이 회사 단위로 가면 훨씬 커질 거라고 생각합니다. 그리고 요즘 AI 회사들이 싸우는 곳도 결국 이 어긋남 근처인 것 같습니다.
1년 전만 해도 다들 누가 더 똑똑한 모델을 만드는지를 봤습니다. 텍스트를 얼마나 잘 이해하고 얼마나 잘 추론하느냐가 다음 판을 정한다고 생각했습니다. 지금 5월에 와서 보면 그 경쟁은 거의 끝난 것 같고, 다음 싸움은 한 군데가 아니라 세 군데에서 동시에 벌어지는 것처럼 보입니다. 클라우드, 디바이스, 폼팩터입니다. 닷새 뒤에 Google I/O가 열리는데, 그 전에 지금 보이는 그림을 한번 적어두고 싶었습니다.
텍스트 추론 경쟁은 끝난 것 같습니다
Claude Opus 4.7, GPT-5.5, Gemini 3.1 Pro가 지금 거의 같은 줄에 서 있습니다. 에이전트 쪽 벤치에서는 Opus가 조금 앞서 있지만, 텍스트 이해나 추론 벤치로 가면 셋이 서로 몇 점 차이로 왔다 갔다 합니다. 1M 토큰 컨텍스트도 이제 다 됩니다. Gemini는 그보다 먼저 2M까지 갔고요. 내가 더 긴 글을 읽을 수 있다는 말은 더 이상 자랑이 안 됩니다.
1년 전 발표 슬라이드를 떠올려 보면 MMLU 몇 퍼센트, HumanEval 몇 퍼센트, 수학 벤치 몇 퍼센트 향상 같은 숫자가 큼직하게 박혀 있었습니다. 한 자릿수 점수 차이로 누가 일등인지 다퉜습니다. 그 방식이 지금은 잘 안 먹히는 것 같습니다. 셋이 다 비슷하니까요. 쓰는 사람 입장에서는 이 일은 Opus가 낫고 저 일은 GPT가 낫다 정도의 차이만 남았고, 그마저 한두 달이면 순서가 바뀝니다.
새 모델이 나오면 점수표부터 찾아보게 되는데, 요즘은 그렇게 해도 손에 남는 게 별로 없는 것 같습니다. 몇 점 올랐다는 걸 확인하고 나도 다음 날 쓰는 방식은 그대로니까요. 점수 차이가 일하는 방식을 바꿀 만큼 벌어지지 않으면, 회사들도 점수로는 손님을 붙잡기 어렵다는 걸 알고 있을 것 같습니다.
그래서 회사들이 다른 데를 보기 시작한 것 같은데, 보는 방향이 회사마다 다릅니다. 각자 가진 것과 약한 데를 보고 따로 베팅을 하니까 결과적으로 세 군데서 동시에 싸움이 벌어지는 모양이 됩니다.
클라우드에서는 OpenAI가 쪼개고 Anthropic은 한 우물을 팝니다
제일 가까이서 보이는 건 클라우드 API 쪽입니다.
OpenAI는 5월 초에 라인업을 한꺼번에 풀었습니다. ChatGPT 기본 모델이 GPT-5.5 Instant로 바뀌었고, 음성 대화용 Realtime-2, 실시간 통역용 Realtime-Translate, 스트리밍 음성 인식용 Realtime-Whisper가 따로따로 나왔습니다. 이미지 생성 쪽은 GPT Images 2가 같이 나왔습니다.
저는 이렇게 쪼갠 것 자체가 눈에 띄었습니다. 1년 전이었으면 Realtime 2.0 같은 이름으로 하나로 묶어서 냈을 것 같습니다. 음성이든 통역이든 전사든 다 한 모델 안에서 처리하는 식으로요. 지금은 셋으로 나뉘었습니다. 용도별로 모델을 나누면 호출 하나하나에 드는 비용을 모델마다 따로 맞출 수 있습니다. 음성 인식만 필요한 사람이 추론까지 하는 비싼 모델을 부를 이유가 없어지니까요. 저는 이걸 OpenAI가 추론 비용을 호출 단위로 잘게 깎아보려는 시도로 보고 있습니다. 왜 그렇게까지 깎아야 하는지는 뒤에서 돈 얘기를 하면서 다시 나옵니다.
Anthropic은 같은 클라우드에 있으면서도 전혀 다르게 갑니다. 음성이나 통역 같은 쪽으로 라인업을 넓히지 않고 코딩과 에이전트 실행력만 계속 팝니다. Anthropic이 공개한 Rakuten 사례를 보면 Claude Code를 사람 손 없이 7시간 동안 돌렸습니다. 그 사이 도구를 수백 번 부르고, 메모리를 관리하고, 중간중간 스스로 결과를 확인하고 되돌아보는 일이 모델 안에서 계속 일어났습니다. 흔히 긴 호라이즌 작업이라고 부르는 일입니다. OSWorld 점수가 높게 나온 것도 그래서 의미가 있다고 봅니다. 사람이 마우스와 키보드로 하던 데스크톱 조작을 모델이 직접 한다는 얘기니까요.
OpenAI도 Workspace Agents를 내놨고 Agents SDK도 손봤으니 에이전트를 안 하는 건 아닙니다. 다만 OpenAI는 그걸 하면서 라인업을 계속 쪼개고, Anthropic은 거의 쪼개지 않습니다.
제 눈에는 두 회사가 같은 문제, 그러니까 클라우드 추론 비용을 서로 반대 방향에서 풀고 있는 것처럼 보입니다. OpenAI는 호출을 잘게 쪼개서 단가를 낮추고, Anthropic은 한 번 부르면 7시간을 일하게 해서 한 번 부를 때의 가치를 올립니다. 어느 쪽이 맞는지는 저도 아직 모르겠습니다.
쓰는 사람 쪽에서 보면 두 방식은 느낌이 꽤 다릅니다. 잘게 쪼개진 모델은 고르는 수고가 생깁니다. 이 일에는 이 모델, 저 일에는 저 모델을 붙여야 하고, 붙이는 걸 잘못하면 싸게 쓰려다 오히려 품이 더 듭니다. 한 우물 쪽은 고를 게 별로 없는 대신 그 우물이 내 일과 안 맞으면 갈 데가 없습니다. 코딩이나 에이전트 작업을 하는 사람한테는 Anthropic 쪽이 편하고, 음성이나 통역이 필요한 사람한테는 OpenAI 쪽이 편할 텐데, 결국 회사가 어떤 사람을 손님으로 보고 있느냐가 라인업에 그대로 드러나는 것 같습니다.
디바이스에서는 로컬 LLM과 OEM 온디바이스가 따로 돕니다
제가 제일 오래 붙들고 있던 건 이쪽입니다. M4에서 본 한 자릿수 두 개가 사실상 이 이야기라서요.
벤치로는 따라잡았습니다
오픈 웨이트 쪽이 클로즈드 모델과 거의 같은 줄까지 올라왔습니다. 4월 말에 나온 DeepSeek V4-Pro는 코딩 벤치에서 Opus 4.6과 거의 붙은 점수를 냈고 라이선스는 MIT입니다. 프론티어라고 부르는 그 줄에 들어와 있는 겁니다.
제가 깔아본 Qwen3.5 122B는 MoE라서 실제로 도는 파라미터는 훨씬 적습니다. 모델 카드를 보면 GPT-5-mini를 대부분 벤치에서 이기고, 64GB M4 맥북에서 돌아갑니다. Llama 4 Scout는 10M 컨텍스트를 오픈 웨이트로 풀었습니다. Ollama 라이브러리에 올라온 모델 수도 엄청나게 많아졌고, ollama run qwen3.5:122b 한 줄이면 자기 노트북에서 모델이 도는 게 이제 그냥 당연한 셋업이 됐습니다.
여기까지만 보면 오픈 진영이 이겼다고 말하고 싶어집니다. 점수도 따라왔고 라이선스도 자유로우니까요.
써보면 외롭습니다
벤치 점수는 높은데 제 노트북에서 나오는 속도는 초당 한 자릿수입니다. API로 GPT-5.5를 부르면 보통 그보다 열 배 넘게 빠르게 답이 옵니다. 그리고 깔아서 써보니 속도 말고도 걸리는 게 여럿 있었습니다.
M4 Max 64GB에서 Q4로 양자화해서 Qwen 122B를 돌리면 초당 6~8토큰 정도가 나옵니다. 짧은 답이면 기다릴 만한데, 코드 한 파일을 통째로 다시 써달라고 하면 2~3분을 기다려야 합니다. 그동안 다른 걸 해도 되긴 하지만 작업하던 흐름이 끊깁니다.
에이전트로 쓰면 또 다릅니다. 단발 코딩 벤치에서 점수가 높아도 7시간짜리 자율 작업은 아예 다른 종류의 일입니다. 도구를 몇 번 부르는 사이에 컨텍스트가 상하는 속도가 클로즈드 모델보다 빠릅니다. Aider 같은 도구로 오픈 모델을 써본 사람들 말도 비슷했습니다. 5분짜리 일은 되는데 한 시간짜리 일은 중간에 길을 잃는다고요.
NPU 문제도 있습니다. M4에는 NPU가 들어 있고 Apple Silicon이 늘 자랑하는 부분인데, Ollama는 이걸 거의 안 씁니다. CPU와 GPU만 씁니다. Apple이 NPU를 Core ML을 거쳐서만 쓸 수 있게 해두었기 때문입니다. 칩에 가속기를 달아놓고 그걸 놀린 채로 LLM을 돌리는 셈이라, 저는 차 트렁크에 엔진을 하나 더 싣고 다니면서 안 쓰는 느낌이었습니다.
배터리와 발열도 만만치 않습니다. 큰 모델을 한 시간 돌리면 팬이 끝까지 돌고 배터리는 두 시간도 못 갑니다. 카페에서 노트북 펴고 쓰는 그림은 아니고, 책상에 충전기 꽂아두고 쓰는 데스크톱 작업에 가깝습니다.
마지막으로 OS와 붙어 있지 않습니다. Siri처럼 늘 뒤에서 듣고 있다가 불러주면 나오는 비서가 되려면 OS가 손을 잡아줘야 하는데, Ollama는 따로 노는 앱입니다. 글을 쓰다가 이 문장 좀 다듬어줘 하고 툭 묻는 식으로는 안 되고, 매번 앱을 열고 프롬프트를 쳐야 합니다.
그래서 저는 로컬 LLM이 똑똑한데 외롭다고 느꼈습니다. 점수로만 보면 클로즈드 모델과 나란히 앉아 있어야 할 것 같은데, 실제로는 책상 한쪽 구석에서 혼자 돌고 있습니다.
벤치 점수가 이런 건 말해주지 않는다는 게 저한테는 좀 의외였습니다. 점수표에는 답이 얼마나 맞았는지만 있고, 그 답을 받기까지 몇 분을 기다렸는지, 그동안 팬 소리가 얼마나 컸는지, 앱을 몇 번 열었다 닫았는지는 없습니다. 그런데 매일 쓰는 도구냐 아니냐는 오히려 그쪽에서 정해지는 것 같습니다. 똑같이 맞는 답이라도 기다리는 시간이 길면 결국 API 창을 다시 열게 될 것 같습니다. 그러면 토큰을 아끼겠다고 깔았던 처음 이유가 슬그머니 사라집니다.
그리고 토큰을 아끼고 싶은 일이 대개 그렇게 큰 일이 아니라는 생각도 듭니다. 문장 하나 다듬기, 짧은 함수 하나 고치기, 에러 메시지 하나 읽어보기 같은 일이라면 122B까지 갈 필요가 없었을 수도 있습니다. 저는 비용 하나만 보고 제일 큰 걸 노트북에 올렸는데, 이 정도 일에 이걸 쓸 일인가를 먼저 물었으면 처음부터 더 작은 모델을 골랐을지도 모르겠습니다. 작은 모델이었으면 속도도 지금보다 훨씬 나았을 거고요. 그렇게 보면 OpenAI가 Realtime을 셋으로 쪼갠 것도 같은 질문에 대한 답처럼 보입니다. 음성 인식만 하면 되는 일에 추론까지 하는 모델을 부르지 말라는 거니까요. 회사는 그 질문을 라인업으로 대신 해주고, 로컬에서는 제가 직접 해야 한다는 차이가 있을 뿐인 것 같습니다. 다음에 다시 깔 때는 일을 먼저 나눠 보고 모델을 고를 생각입니다.
OEM 온디바이스는 다른 쪽에서 답을 들고 왔습니다
같은 디바이스 안에 다른 흐름이 하나 더 있습니다. Apple, Google, Samsung이 자기 칩에 모델을 직접 넣는 쪽인데, 그냥 OEM 온디바이스라고 부르겠습니다. Google의 Gemini Nano는 몇 B 파라미터짜리 작은 모델을 4비트로 줄여서 1GB 남짓한 크기로 폰에 넣고, 응답은 눈 깜빡할 사이에 나옵니다. Pixel에서 시작해서 Galaxy까지 들어가고 있습니다.
그리고 1월에 큰 소식이 하나 있었습니다. Apple이 Google Gemini를 라이선스해서 Siri와 Apple Intelligence에 쓰기로 한 겁니다. 자체 파운데이션 모델은 사실상 접고, Gemini를 자기 칩에 맞게 증류해서 기기 안에서 돌리는 구조로 간다고 합니다. iOS 27에서는 사용자가 Gemini나 Claude 같은 외부 모델을 직접 고를 수 있게 된다는 얘기도 있습니다.
이 소식을 보고 몇 가지가 한꺼번에 떠올랐습니다. Apple 같은 회사가 직접 모델 만들기를 그만뒀다는 건, 모델을 만드는 데 드는 돈이 빌려 쓰는 돈보다 크다고 판단했다는 뜻 같습니다. 그러면서 온디바이스 AI는 남과 다르게 보이려고 하는 기능이 아니라 그냥 갖춰야 하는 인프라가 된 것 같고요. 모델은 위에서 큰 회사가 만들고 칩에 넣는 일은 다른 회사가 하는 분업도 이걸로 굳어진 것처럼 보입니다.
Apple이 이렇게 했다는 게 저한테는 제일 오래 남았습니다. 칩도 직접 만들고 OS도 직접 만들고, 웬만한 건 남한테 맡기지 않는 회사라고 생각해 왔으니까요. 그런 회사가 제일 중요해 보이는 부분을 남에게서 빌려 온다는 건, 모델이라는 게 생각보다 빨리 남과 다를 게 없는 물건이 돼가고 있다는 뜻일 수도 있습니다. 어차피 다 비슷하다면 직접 만들 이유가 줄어드니까요. 앞에서 텍스트 추론 경쟁이 거의 끝난 것 같다고 했던 것과 같은 얘기를 Apple이 행동으로 한 것처럼 보입니다.
5월 5일에는 Gemini 3.2 Flash가 iOS Gemini 앱과 AI Studio에 조용히 올라왔습니다. 가격이 꽤 쌉니다. 공식 발표는 아마 닷새 뒤 I/O에서 하겠죠. 이름만 보면 작은 업데이트 같지만, 저는 이게 다음 표준이 될 거라고 보고 있습니다.
두 쪽이 따로 도는 게 문제인 것 같습니다
로컬 LLM은 점수는 따라왔는데 실제로 쓰기엔 외롭고, OEM 온디바이스는 인프라가 되는 데는 성공했는데 사용자가 모델을 손댈 수가 없습니다. Gemini Nano가 제 폰에서 도는 건 좋지만 제 입맛대로 파인튜닝하거나 가중치를 바꿀 수는 없습니다. Google이 정해준 대로 써야 합니다.
제 M4를 다시 보면 이게 더 분명하게 보입니다. 칩에 NPU가 있고, 그 위에 macOS가 있고, macOS 안에 Apple Intelligence가 있습니다. 그런데 그 NPU에 제가 고른 Qwen3.5나 DeepSeek V4-Pro를 올릴 수는 없습니다. Apple이 정한 모델만 NPU를 씁니다. 제가 마음대로 할 수 있는 건 Ollama가 도는 CPU와 GPU 쪽뿐입니다. 사용자가 고르는 모델과 칩에 맞춘 최적화가 한 기계 안에서 서로 떨어져 있는 겁니다.
이 둘이 한곳에서 만나면 정말 큰일이 날 것 같습니다. 사용자가 자기가 고른 오픈 웨이트 모델을 NPU에 올릴 수 있게 되든지, 아니면 OEM이 사용자 모델을 받아서 자기 칩에 맞게 증류해주는 방식이 표준으로 생기든지요. 지금은 그런 기미가 안 보입니다. Apple은 자기 모델만, Google은 자기 Nano만 넣고, 오픈 진영은 NPU 근처에도 못 갑니다. 칩을 가진 회사 입장에서는 굳이 남의 모델에게 그걸 내줄 이유가 없을 테니, 저는 이게 꽤 오래갈 거라고 보고 있습니다. 누가 먼저 이 상태를 바꿀지도 잘 떠오르지 않고, 그래서 당분간 로컬 LLM은 좋아하는 사람들끼리 쓰는 물건으로 남을 것 같습니다.
이 외로움은 회사 단위로 가면 다른 숫자로 바뀌는 것 같습니다. 이 글을 쓰고 나서 같은 모델을 회사 GPU 워크스테이션 한 대에 올리고 다섯 명이 붙었을 때 초당 토큰이 어디까지 내려가는지를 시트당 단가로 따져봤는데, 제 노트북에서는 그럭저럭 참을 만하던 한 자릿수가 거기서는 도입을 할지 말지를 정하는 숫자로 읽혔습니다.
OpenAI와 Jony Ive는 스마트폰을 피해 가려는 것 같습니다
세 번째는 결이 좀 다릅니다. 클라우드와 디바이스는 둘 다 웹, 폰, 노트북 같은 기존 기기 위에서 AI를 어떻게 더 잘 쓰느냐의 문제라면, 이쪽은 기존 기기를 아예 건너뛰는 새 기기를 만들 수 있느냐의 문제입니다.
OpenAI가 Jony Ive와 함께 만드는 기기가 올해 하반기에 나온다고 합니다. 코드명은 Sweetpea이고, 화면이 거의 없는 목걸이나 이어버드 같은 모양이라고 합니다. 제조는 Foxconn이 맡고, 첫해 출하 목표가 수천만 대입니다. Apple Watch가 첫해에 팔린 양의 몇 배를 처음부터 노리는 겁니다. Sam Altman은 이걸 스마트폰보다 평화로운 기기라고 부릅니다. 알림이 쏟아지지 않고, 화면이 없고, 늘 듣고 있는 기기요.
저는 이걸 보면서 Humane AI Pin이 먼저 생각났습니다. 화면 없고, 늘 듣고, 비쌌던 그 기기는 나온 지 1년도 안 돼서 사업을 사실상 접었습니다. 그때는 안에 들어간 모델이 지금보다 훨씬 작았고 가격도 높았습니다. 지금은 GPT-5.5급 모델이 들어가고 Jony Ive가 디자인을 합니다. 가격은 아직 안 나왔지만 첫해에 그만큼 팔겠다는 걸 보면 보급형일 가능성이 높아 보입니다.
OpenAI가 왜 이 판을 벌이는지는 두 가지 정도로 보입니다. 하나는 스마트폰을 Apple과 Google이 쥐고 있다는 점입니다. iOS에서 Siri를 밀어내거나 Android에서 Gemini를 밀어내려면 OS를 가진 쪽의 허락이 있어야 합니다. iOS 27에서 외부 모델을 고를 수 있게 된다고 해도 결국 Apple이 정한 규칙 안에서입니다. OpenAI한테는 그 규칙 밖에 있는 자기 기기가 필요한 것 같습니다.
다른 하나는 돈입니다. 클라우드 API는 호출할 때마다 매출이 나니까 들쭉날쭉하고, 뒤에서 보겠지만 지금 적자를 내고 있습니다. 기기는 한 대 팔면 그만큼 수익이 정해집니다. 출하 목표대로만 팔린다면 기기 매출이 지금 OpenAI 전체 매출과 맞먹는 규모가 됩니다.
AI 기기를 새로 정의하겠다는 꿈도 있긴 하겠지만, 저는 스마트폰 OS를 쥔 회사들을 피해 가면서 안정적인 매출 줄을 하나 만들려는 쪽이 더 큰 이유라고 보고 있습니다. 셋 중에 제일 큰 베팅이고, Humane이 한 번 넘어진 길이라 위험도 제일 큽니다.
솔직히 화면 없는 기기를 제가 매일 쓸지는 잘 모르겠습니다. 코드나 표 같은 건 귀로 들어서는 머리에 잘 남을 것 같지 않아서, 이 기기가 개발자를 겨냥한 건 아닐 거라고 생각합니다. 길을 걷거나 운전하거나 손이 바쁠 때 툭 묻고 툭 듣는 사람들, 스마트폰을 꺼내는 일 자체가 귀찮은 사람들을 보고 만드는 것 같습니다. 그런 사람이 수천만 명이나 되는지가 결국 이 베팅의 승부일 텐데, 거기까지는 아직 감이 오지 않습니다.
그리고 그런 사람들이 툭 묻는 건 대개 짧은 질문일 텐데, 거기에 GPT-5.5급 모델이 매번 필요할지도 잘 모르겠습니다. 오늘 일정이 뭐지, 이 길로 가면 몇 분 걸리지 같은 질문마다 제일 큰 모델을 부르면, 적자에서 빠져나가려고 만든 기기가 오히려 추론 비용을 더 많이 쓰는 물건이 될 수도 있습니다. 그래서 이 기기도 결국 안에서는 작은 모델이 대부분을 처리하고 정말 어려운 질문만 클라우드로 보내는 식이 되지 않을까 싶습니다. 그렇게 되면 세 번째 싸움도 두 번째 싸움, 그러니까 디바이스 쪽 얘기와 어딘가에서 만나게 되는 셈입니다. 질문 하나하나의 크기에 맞춰 모델을 고르는 일을 누가 하느냐가 다시 나오는 거죠. 그건 실제로 나와 봐야 알 것 같습니다.
셋이 한꺼번에 벌어지는 건 돈 때문인 것 같습니다
앞에서 미뤄둔 돈 얘기입니다.
OpenAI 내부 문서로는 올해 손실이 140억 달러 정도로 잡혀 있습니다. 현금이 빠져나가는 양으로 보면 그보다 훨씬 크고, 국내 기사에서 흔히 보는 23조 원 적자라는 말은 그 사이 어딘가쯤입니다. 환율이나 무엇을 손실로 치느냐에 따라 숫자는 왔다 갔다 하지만 엄청난 돈이 나간다는 건 같습니다.
더 놀란 건 그 돈이 어디로 가는지였습니다. 모델을 돌리는 추론 비용만으로 매출 전체보다 많이 나갑니다. 연구비나 인건비, 마케팅비를 다 빼고 모델을 한 번 돌리는 비용만 봐도 매출 1달러를 벌 때 2달러가 나가는 구조라고 합니다.
이 얘기를 읽고 제 M4가 다시 생각났습니다. 저는 API 비용이 아까워서 모델을 노트북에 내렸는데, 그 API를 파는 쪽은 팔수록 손해를 보고 있었던 겁니다. 제가 내던 돈이 비싸다고 느꼈는데, 파는 쪽에서는 그것도 원가에 한참 못 미치는 값이었던 셈입니다. 사는 사람도 파는 사람도 둘 다 아깝다고 느끼는 장사라면 어딘가에서 값이 바뀌거나 방식이 바뀌어야 할 것 같습니다.
만약 값이 바뀐다면 제일 먼저 체감하는 건 큰 모델을 작은 일에 쓰던 사람들일 것 같습니다. 지금은 원가보다 싸게 쓰고 있으니 그냥 제일 좋은 모델을 부르는 게 편합니다. 고르는 수고가 아까우니까요. 그런데 값이 원가 쪽으로 올라가면 일마다 어떤 모델을 쓸지를 따지게 될 겁니다. 그때가 되면 한 번에 오래 일하는 모델이든 잘게 쪼갠 모델이든, 쓰는 사람이 먼저 일의 크기를 재야 한다는 건 같아질 것 같습니다. 지금 제일 좋은 모델을 아무 일에나 부를 수 있는 게 어쩌면 잠깐 있는 시기인지도 모르겠습니다. 고르는 게 귀찮아서 비싼 걸 쓰는 습관은 값이 싸게 유지될 때만 성립하니까요. 그때가 오면 제가 M4 앞에서 했던 고민을 회사마다, 일마다 하게 되는 셈인데, 그게 생각보다 품이 드는 일이라는 건 이번에 조금 알게 됐습니다.
이걸 알고 나서 앞에서 본 것들이 다르게 보였습니다. Realtime을 셋으로 쪼갠 것도, 하나로 묶어두면 음성만 쓰는 사람도 비싼 모델을 부르게 되니 호출 하나의 비용을 깎으려는 것 같고요. 화면 없는 기기에 크게 거는 것도 적자가 나는 클라우드에서 빠져나갈 길을 찾는 것처럼 보입니다.
세 군데서 동시에 싸움이 벌어진다고 썼지만, 사실 정확한 말은 아닌 것 같습니다. 적자라는 한 군데에서 압력이 생기고, 그게 세 방향으로 새어 나가는 쪽에 더 가깝습니다. 라인업을 쪼개서 호출 단가를 낮추고, 칩 만드는 회사들과 손잡아서 클라우드에 덜 기대고, 기기를 팔아서 안정적인 돈줄을 만드는 겁니다.
이건 OpenAI만의 얘기도 아닙니다. 다른 회사들도 같은 압력을 받는데 빠져나가는 방향이 다릅니다.
Anthropic은 매출도 적자도 OpenAI보다 한참 작습니다. 저는 라인업을 거의 쪼개지 않고 코딩과 에이전트만 파면서 한 번 부를 때의 가치를 올려온 게 그 이유라고 봅니다. 7시간 자율 작업은 호출 한 번은 아니지만 세션 하나이고, 그 세션 하나에 사람들이 내는 돈이 큽니다. 같은 클라우드에서 단가를 내리는 대신 가치를 올리는 쪽을 고른 것 같습니다.
Google은 또 다릅니다. 검색 광고라는 큰 본업이 있어서 Gemini를 돌리는 비용을 거기서 나눠 짊어질 수 있습니다. 거기에 Gemini를 다른 회사에 빌려주는 데까지 갔고, Apple이 Gemini를 쓰게 된 게 바로 그 결과입니다. 다른 회사 기기에서 자기 모델이 돌게 하면 클라우드 추론 비용도 줄이고 다른 회사 사용자 쪽에도 손이 닿습니다. AI판 AWS 같은 위치라고 부를 수도 있을 것 같습니다.
OpenAI는 쪼개고 기기로 빠져나가고, Anthropic은 가치를 올리면서 버티고, Google은 인프라가 돼서 비용을 나눕니다.
I/O 닷새 전에 적어두는 예상
닷새 뒤 키노트에서 뭐가 나올지, 위 그림을 두고 생각해 보면 조금은 감이 옵니다.
저는 Google이 디바이스 쪽, 그중에서도 OEM 온디바이스를 인프라로 만드는 데 제일 큰 패를 깔 거라고 보고 있습니다. Gemini 3.2 Flash가 이미 조용히 올라와 있으니 I/O에서 공식으로 발표하면서 3.2 Pro나 그 위 티어를 같이 보여줄 것 같습니다. Google은 Android 버전을 몇 번 거치면서 Gemini를 차근차근 OS 안쪽으로 밀어 넣어 왔고, CNBC도 Apple이 AI를 다시 내놓기 전에 Google이 Gemini를 Android 한가운데에 두려고 서두르고 있다고 썼습니다. 6월 WWDC에서 Apple Intelligence가 다시 공개되니까, Google 입장에서는 그 전에 Android 쪽 그림을 먼저 보여줘야 할 겁니다.
키노트에서는 아마 이런 말이 나올 것 같습니다. Gemini는 이제 챗봇이 아니라 Android의 운영 계층이고, 폰에서도 차에서도 노트북에서도 브라우저에서도 같은 Gemini가 돌고, 그중 일부는 클라우드에서 일부는 칩 안에서 돈다는 식으로요.
OpenAI는 I/O가 끝나고 한두 주 안에 뭔가를 낼 것 같습니다. GPT-5.5 Pro나 Thinking 쪽일 수도 있고, Sora 후속일 수도 있고, Agents SDK를 크게 손볼 수도 있습니다. 지금까지 보면 OpenAI는 Google이 큰 키노트를 하고 나면 작은 발표를 여러 번 이어서 하는 편이었습니다. 라인업을 쪼개는 습관이 맞대응할 때도 그대로 나오는 것 같습니다.
Anthropic은 큰 발표를 자주 하지 않습니다. 2월에 Vertex AI에 claude-sonnet-5 라는 이름이 잠깐 떴다가 사라진 적이 있어서, Sonnet 5는 준비 중인 게 거의 확실해 보입니다. 지금까지 하던 대로라면 6월이나 7월쯤 코딩과 에이전트 벤치 점수를 앞세워서 조용히 나올 것 같고, Opus 5는 그 뒤일 겁니다. Opus 4.7에 1M 컨텍스트를 풀어둔 것도 그 다음 단계를 미리 보여준 것처럼 보입니다.
이렇게 써놓고 보니 세 회사가 무엇을 낼지보다 언제 낼지를 서로 보고 있다는 느낌이 더 듭니다. Google은 Apple보다 먼저, OpenAI는 Google 바로 뒤에, Anthropic은 남들이 시끄러울 때를 피해서요. 모델 성능이 다 비슷해지니 발표 타이밍까지 경쟁의 일부가 된 것 같기도 합니다.
순서대로 늘어놓으면 다음 주에 I/O가 있고, Gemini 3.2 Flash 공식 발표와 3.2 Pro 맛보기, Android 통합, Astra 후속 데모 정도가 나올 것 같습니다. 5월 말에서 6월 사이에 OpenAI가 GPT-5.5 변형이나 Sora 후속으로 응수하고, 6월 초 WWDC에서는 Apple이 Gemini 기반이라는 걸 어떻게 포장할지가 볼거리일 것 같습니다. 6월 후반에서 7월 사이에 Sonnet 5가 조용히 나오고, 여름이 지나 9월쯤 Sweetpea가 나오면 셋 중 제일 큰 베팅의 결과를 보게 될 겁니다. Opus 5도 그쯤이지 않을까 싶습니다.
회사가 로컬 LLM을 들이려고 하면 어디서 막히는지, 그래도 누가 쓸 만한지는 다음 편에서 더 파볼 생각입니다. 그리고 I/O가 끝나면 여기 적은 예상이 얼마나 맞았는지 하나씩 맞춰볼 텐데, 미리 말하자면 키노트가 끝나고 한 줄씩 채점했을 때 정확히 맞은 건 둘이었고, 이 글이 아예 보지 못한 변수가 둘 더 튀어나왔습니다.
- 공유 링크 만들기
- X
- 이메일
- 기타 앱
댓글
댓글 쓰기