AdSense 팀과 Firebase 팀이 다른 건 아는데, 욕은 구글이 다 먹습니다

오늘 오전 9시 40분쯤부터 iOS 앱이 켜자마자 꺼진다는 이슈가 GitHub에 올라오기 시작했습니다. Firebase iOS SDK 저장소의 16728번 이슈 입니다. 처음 글을 쓴 사람은 업데이트를 하나도 안 냈는데, 이미 배포돼 있던 빌드 네 개가 같은 시각에 한꺼번에 죽기 시작했다고 적었습니다. 18분 만에 56명이 튕겼다고요. 앱이 켜지면 Firebase Analytics가 서버에서 실험 설정을 받아오는데, 그 응답을 받고 1초도 안 돼서 앱이 죽는다는 내용이었습니다. 크래시 로그까지 붙여서 설정을 롤백해 달라고 요청하고 있었습니다. 댓글은 금방 수백 개가 됐습니다. 읽어 보면 다들 비슷한 말입니다. 우리도 아무것도 안 건드렸는데 죽는다, 몇 시 몇 분부터다, 로그가 똑같다. 그리고 중간중간 "구글 뭐 하냐"는 말이 섞여 있었습니다. 저도 속으로 똑같은 말을 했습니다. 구글 뭐 하는 거냐. 그런데 제 경우는 Firebase 때문만은 아니었습니다. 오늘은 AdSense 재검토 결과도 왔거든요. 「가치가 별로 없는 콘텐츠」. 2월부터 듣고 있는 그 한 줄입니다. 2월부터 같은 한 줄을 듣고 있습니다 처음 거절을 받았을 때는 그냥 "왜 안 되지" 정도였습니다. 블로그를 막 키우던 때라 짧은 글이 많았고, 그러니까 글이 얇아서 그런가 보다 했습니다. 틀린 추측은 아니었던 것 같습니다. 그때 급하게 올린 짧은 글들이 실제로 좀 부끄러웠거든요. 그래서 그 글들을 내렸습니다. 남은 글은 길고, 사진도 있고, 서로 링크도 걸려 있었습니다. 이 정도면 되겠지 하고 다시 신청했습니다. 같은 한 줄이 왔습니다. 두 번째부터는 기분이 좀 달랐습니다. 이번엔 제가 뭘 놓쳤나 싶어서 사이트를 구석구석 뒤졌습니다. 그러다 blog.apple-io.com 이라는 하위 도메인을 찾았습니다. 예전에 워드프레스를 한번 깔아 보고 잊어버린 주소였는데, 설치 직후 화면 그대로 검색엔진에 노출돼 있었습니다. 제목에 오타가 난 채로, 「Hel...

Opus 5.5와 GPT-6 Sol이 같은 날 나왔는데 둘 다 성능 옆에 값을 붙였습니다

9월 4일에 새 모델 발표를 언제부턴가 안 열어보고 있다는 글을 올렸습니다. 사흘 연속으로 모델이 나왔는데 정리할 마음이 안 들었고, 돌아보니 한참 전부터 안 따라가고 있었다는 이야기였습니다.

3주가 지났고, 또 몰렸습니다. 9월 20일에 알리바바가 Qwen-Image-2.1을 냈고, 21일에 xAI가 Grok 4.7을 냈습니다. 22일에는 앤트로픽의 Opus 5.5와 OpenAI의 GPT-6 Sol, Luna가 같은 날 나왔습니다. 23일에는 메타가 Connect 무대에서 뮤즈 이야기를 한참 했습니다. 그리고 한국 시간으로 내일 새벽에는 OpenAI DevDay 키노트가 있습니다.

지난번 글대로라면 이번에도 안 열어보는 게 맞습니다. 성능 이야기만 있었으면 실제로 안 열었을 겁니다. 그 글에 적어둔 구분이 하나 있는데, 순위가 바뀌었다는 소식은 안 보고 라이선스나 접근 조건이나 값을 매기는 방식이 달라졌다는 소식은 본다는 거였습니다. 이번 나흘은 하필 뒤쪽 소식이 한꺼번에 왔습니다. 그래서 이번엔 발표문을 읽었습니다. 옮기려고 읽은 건 아니고, 다들 왜 같은 단어를 들고 나왔는지가 궁금했습니다.

이 글도 뭐가 나왔는지 정리하는 글은 아닙니다. 모델마다 가격을 줄 세우지도 않을 겁니다. 나흘치 발표를 한 화면에 놓고 봤을 때 보이는 것 하나를, 지금 어떻게 보고 있는지 적어두려고 합니다. 지금 드는 생각은 이 정도입니다. 다들 성능 옆에 값을 붙여서 나왔고, 그 값은 제가 실제로 내는 돈과 같은 숫자가 아닌 것 같습니다.

성능 문장 옆에 비용 문장이 붙어 있었습니다

처음에는 "다들 가격 인하를 앞세웠다"고 쓰려고 했습니다. 기사 제목들이 그렇게 보였거든요. The New Stack은 Opus 5.5 소식을 20% 가격 인하로 뽑았고, TechCrunch도 GPT-6 Sol과 Luna를 더 낮은 비용을 내세운 모델로 소개했습니다.

회사가 직접 쓴 발표문을 읽어보면 조금 다릅니다.

앤트로픽의 Opus 5.5 발표문은 부제가 한 문장입니다. 대부분의 일에서 Fable 5.1 수준으로 일하고, Opus 5보다 돌리는 데 40% 덜 든다는 문장입니다. 성능이 먼저 나오고 비용이 같은 문장 뒤에 붙어 있습니다. 그다음 세 문단은 새 제품군 소개와 외부 평가, 정렬 감사 결과입니다. 입력 100만 토큰당 4달러, 출력 20달러라는 단가는 네 번째 절에 가서야 나옵니다. 그리고 부제의 40%는 단가 인하율이 아닙니다. 단가는 20% 내렸고, 나머지는 한 작업에 쓰는 토큰이 줄어서 생긴 차이라고 설명합니다.

OpenAI의 GPT-6 Sol, Luna 발표문은 셋 중에 값을 가장 앞에 뒀습니다. 두 번째 문단에 API 가격을 50% 내린다는 말이 나옵니다. 성능 주장도 돈으로 적었습니다. 업무 자동화 벤치마크에서 Sol이 Claude Opus 5를 넘었는데 작업당 비용은 Opus 5의 9%였다는 식입니다.

xAI의 Grok 4.7 발표문은 부제에 "비슷한 모델의 절반 가격"이라고 적었습니다. 자기 값을 내렸다는 말이 아니라 남의 값과 비교한 말입니다. 실제 단가는 문서 맨 끝에 있고, 이전 버전과 같습니다.

그러니 "가격 인하를 앞세웠다"는 말은 정확하지 않습니다. 인하율을 제목에 건 회사는 없었고, 그 숫자를 제목으로 뽑은 건 기사 쪽이었습니다. 회사들이 한 일은 이쪽에 가까워 보입니다. 성능 문장을 하나 쓰면 바로 옆에 비용 문장을 하나 붙였습니다. 셋이 약속이나 한 것처럼 같은 모양이었습니다.

저한테는 이게 인하율보다 더 눈에 들어왔습니다. 성능만 말해서는 사람을 데려올 수 없다고 회사들이 판단한 것처럼 읽혔기 때문입니다.

지난번 글에서 저는 새 모델을 안 열어보게 된 이유를, 새 모델이 나와도 못 하던 일이 갑자기 되지는 않기 때문이라고 적었습니다. 하던 일을 조금 더 잘할 뿐이고, 그 "조금 더"는 발표 자료로는 확인이 안 된다고요. 그건 쓰는 사람 쪽 사정이라고 생각했는데, 이번 발표문들을 보면 만드는 쪽도 같은 걸 알고 있는 것 같습니다. "Fable 5.1 수준"이라는 말은 새로운 걸 할 수 있게 됐다는 말이 아닙니다. 이미 있는 수준을 더 싸게 준다는 말입니다. 못 하던 일이 되던 시절에는 이런 문장이 필요 없었습니다. 되는 일이 늘었다는 것만으로 사람들이 알아서 옮겼으니까요. 지금은 성능 문장만 올려서는 아무도 안 옮기니까 값을 같이 올려야 하는 때가 왔다고 봅니다.

앤트로픽 문장은 한 번 더 곱씹게 됩니다. Fable 5.1은 앤트로픽이 이달 1일에 낸, Opus보다 한 등급 위의 모델입니다. 그 수준을 더 싼 Opus 5.5로 주겠다는 건, 3주 전에 나온 자기 제품의 값을 스스로 깎는 말이기도 합니다. 경쟁사 모델 대신 자기 상위 모델을 비교 기준으로 꺼냈다는 게 저는 좀 의외였습니다. 한 회사 안에서도 "제일 좋은 모델"과 "제일 많이 팔릴 모델"이 다른 물건이 된 게 아닌가 싶습니다. 제일 좋은 쪽은 이름값을 맡고, 실제로 돈이 오가는 쪽은 한 칸 아래에서 값을 내리는 구조입니다.

숫자를 나란히 놓다가 하나 더 걸린 게 있습니다.

Opus 5.5의 새 단가인 입력 4달러, 출력 20달러는 GPT-5.6 Sol의 프로모션 가격과 정확히 같습니다. GPT-5.6 Sol은 6월에 출력 30달러로 나왔다가 그 뒤 프로모션으로 20달러까지 내려와 있었습니다. 앤트로픽이 그 값까지 내려온 바로 그날, OpenAI는 그 프로모션 가격을 기준으로 절반을 잘라 GPT-6 Sol을 입력 2달러, 출력 10달러에 냈습니다.

앤트로픽이 일부러 그 값을 골랐는지는 모릅니다. 우연일 수도 있습니다. 그래도 같은 날 한쪽은 상대의 어제 가격까지 내려오고 다른 쪽은 그 가격의 절반으로 내려간 걸 보면, 적어도 둘 다 상대 가격표를 보고 있다는 건 분명해 보입니다.

단가표와 청구서는 다른 숫자입니다

이번에 제일 오래 붙들고 있던 건 이 부분입니다.

"싸졌다"는 말을 들으면 보통 단가를 떠올립니다. 100만 토큰에 얼마. 실제로 나가는 돈은 그 단가에 한 작업에서 쓰는 토큰 양을 곱한 값입니다. 단가가 내려도 곱하는 쪽이 커지면 청구서는 안 내려갑니다. 당연한 말인데, 이번 나흘 사이에 그게 숫자로 드러난 경우가 하나 있었습니다.

Grok 4.7입니다. xAI는 단가를 Grok 4.6과 1센트도 다르지 않게 두었습니다. 대신 모델을 키웠습니다. 공식 발표문에는 "더 큰 새 기반 모델"이라고만 적혀 있고 숫자는 없는데, 머스크 쪽에서 나온 말로 파라미터가 1.5조에서 2.1조로 늘었다고 보도됐습니다. 발표문에는 훈련을 몇 시간씩 걸리는 문제 쪽에 무게를 두고 했다는 문장도 있습니다.

그 결과가 Artificial Analysis 측정에 그대로 나옵니다. 같은 지수 과제 하나를 푸는 데 Grok 4.6은 출력 토큰을 3만 8천 개쯤 썼는데, 4.7은 8만 1천 개쯤 썼습니다. 두 배가 넘습니다. 점수는 2점 올랐습니다.

단가가 같고 토큰이 두 배면 과제 하나당 출력 비용도 두 배입니다. "같은 가격에 더 좋은 모델"이라는 말은 단가표 위에서는 맞습니다. 청구서 위에서는 "두 배 값에 조금 더 좋은 모델"로 읽힐 수도 있습니다. 어느 쪽이 맞는지는 쓰는 사람이 무슨 일을 시키느냐에 달렸습니다. 한 번 묻고 끝나는 짧은 질문이면 차이가 거의 없을 거고, 스스로 몇 시간씩 붙잡고 푸는 에이전트 작업이면 차이가 그대로 드러날 겁니다.

xAI만의 이야기로 보이지는 않습니다. 요즘 모델들은 대체로 더 오래 생각하도록 만들어지고 있습니다. OpenAI도 Sol에 추론 단계를 여섯 개 두고 있고 맨 위가 max입니다. 앞에서 본 "작업당 9%"도 그 아래 단계인 xhigh로 잰 값입니다. 단계를 올리면 같은 단가로 더 많은 토큰을 씁니다.

그래서 회사들이 단가 대신 작업당 비용을 앞세운 게 저는 반쯤은 정직하다고 봅니다. 쓰는 사람이 체감하는 건 실제로 그쪽이니까요. 나머지 반은 좀 조심스럽습니다. 작업당 비용은 무슨 작업으로 쟀느냐에 따라 얼마든지 달라지고, 그 작업은 회사가 골랐습니다. 앤트로픽의 40%는 자기네가 본 일반적인 작업량 기준이고, OpenAI의 9%는 자기네가 고른 벤치마크 기준입니다. 지난번 글에서 벤치마크 점수는 남이 고른 문제로 잰 값이라고 적었는데, 작업당 비용도 똑같습니다. 남이 고른 작업으로 잰 비용입니다. 성능을 비교하던 방식이 이제 가격 비교에도 그대로 쓰이고 있습니다.

이 이야기는 Qwen 3.8과 Fable 5.1을 설치하기 전에 찾아봤을 때 한 번 적은 적이 있습니다. 그때 "싸졌다"와 "느려졌다"가 동시에 참이라고 썼습니다. 모델이 더 오래 생각하는 대신 같은 결과를 얻는 값이 내려갔으니, 돈을 시간으로 바꾼 것 같다는 이야기였습니다.

이번에는 반대 방향도 가능하다는 걸 봤습니다. 시간을 더 쓰는데 돈도 더 나가는 경우입니다. Grok 4.7이 제 작업에서 그렇게 될지는 써보지 않아서 모릅니다. 다만 단가를 내리고 토큰을 늘리면, 받는 돈은 비슷하게 유지하면서 가격표에는 인하라고 적을 수 있는 구조인 건 맞습니다. 회사들이 그걸 노렸다고 말할 근거는 없습니다. 쓰는 쪽에서 그 가능성을 한 번쯤 셈에 넣어두면 된다고 보고 있습니다.

예를 하나 들어보겠습니다. 가상의 경우입니다.

어떤 팀이 매일 밤 코드 저장소를 훑어서 문제가 될 만한 곳을 정리하는 작업을 에이전트에 맡겨 두었다고 해보겠습니다. 모델을 새 버전으로 바꾸면서 단가가 20% 내려갔으니 비용도 그만큼 줄 거라고 예상합니다. 한 달 뒤 청구서를 보니 거의 그대로입니다. 새 모델이 더 꼼꼼하게, 더 오래 봤기 때문입니다. 결과물은 확실히 나아졌습니다. 전에는 놓치던 걸 잡아냅니다. 그러면 이 팀은 돈을 아낀 걸까요, 같은 돈으로 더 좋은 걸 산 걸까요. 팀이 원한 게 비용 절감이었다면 좋아진 성능은 부탁하지 않은 선물이고, 청구서는 그대로입니다. 누군가는 이걸 보고 "그래도 품질이 올랐으니 이득"이라고 할 거고, 예산을 맡은 사람은 "줄인다더니 왜 그대로냐"고 물을 겁니다. 둘 다 틀린 말은 아닙니다.

이 장면에서 제가 보는 건 선택권입니다. 추론 단계를 낮춰서 예전 수준으로 돌리면 진짜로 싸질 겁니다. 다만 그러려면 어느 단계에서 어느 정도 결과가 나오는지를 자기 작업으로 재봐야 합니다. 재는 수고가 싸진 만큼보다 크면 대부분은 그냥 기본값으로 씁니다. 저도 그럴 것 같습니다. 그러면 단가 인하의 몫은 대체로 회사가 정한 기본값이 어디에 있느냐에 따라 정해집니다.

이 블로그 글 한 편도 비슷하게 만들어집니다. 리서치를 맡는 에이전트, 쓰는 에이전트, 다듬는 에이전트, 검수하는 에이전트가 차례로 한 번씩 지나갑니다. 한 편에 드는 비용은 단가보다 그 사이에서 에이전트가 파일을 몇 번 다시 읽고, 몇 번 고쳐 쓰고, 검수에서 몇 번 되돌아오느냐에 훨씬 크게 달려 있습니다. 단가가 20% 내려도 검수 기준을 하나 더 세게 걸면 그 20%는 그냥 사라질 겁니다. 그래서 저한테 "싸졌다"는 소식은 청구서를 예측하는 정보라기보다, 곱하기의 한쪽 항이 바뀌었다는 정보 정도로 들어옵니다. 다른 쪽 항은 제가 어떻게 시키느냐가 정합니다.

구독으로 쓰는 사람한테는 또 다른 이야기입니다. 월정액이면 API 단가가 내려도 내는 돈은 원래 안 바뀝니다. OpenAI 발표문에 더 높은 사용 한도라는 말이 같이 나오는데, 구독 쪽에서 체감되는 인하는 아마 이 형태일 겁니다. 같은 돈으로 한도에 덜 부딪히는 것. 그런데 모델이 더 오래 생각하면 한도도 그만큼 빨리 찹니다. 여기서도 두 숫자가 서로 반대로 갑니다. 한도가 늘었다는 공지와 요즘 한도에 더 자주 걸린다는 불평이 같은 달에 같이 나와도 이상하지 않은 구조입니다.

공짜 쪽에는 값 대신 조건이 붙었습니다

가격 경쟁을 끝까지 밀면 공짜가 나옵니다. 오픈웨이트 모델이 그 끝에 있습니다. 내려받는 데 돈이 안 들고, 내 기계에서 돌리면 토큰 값도 없습니다.

9월 20일에 나온 Qwen-Image-2.1이 그런 모델입니다. 이미지를 만드는 부분이 7B라서 집에 있는 그래픽카드로도 돌릴 수 있는 크기이고, GitHub 저장소는 스스로를 가장 강력한 오픈소스 이미지 생성 모델이라고 소개합니다.

라이선스는 바뀌었습니다. 이전 Qwen-Image는 Apache 2.0이었습니다. 받아서 회사 제품에 넣어도 되고 그걸로 돈을 벌어도 되는 라이선스입니다. 2.1은 Qwen Research License로 나왔고, 라이선스 원문에는 대문자로 비상업적 목적으로만 쓸 수 있다고 적혀 있습니다. 비상업의 정의는 연구나 평가이고, 상업적으로 쓰려면 따로 계약을 해야 합니다.

다운로드 값은 여전히 0입니다. 대신 쓰는 조건이 붙었습니다.

이걸 보면서 든 생각은, 공짜가 공짜로 남아 있기 어려워진 것 같다는 겁니다. 유료 모델이 값을 반으로, 또 반으로 내리면 무료 모델의 가장 큰 무기인 "돈이 안 든다"가 점점 덜 특별해집니다. 출력 100만 토큰에 50센트짜리 모델까지 나오면(이번 GPT-6 Luna가 그렇습니다), 직접 설치하고 돌리는 수고를 감수할 이유가 줄어듭니다. 그러면 무료 쪽은 무료라는 사실 말고 다른 걸로 값을 받아야 합니다. 알리바바는 그걸 라이선스로 받기로 한 듯합니다. 누구나 받아서 써보게 두되, 그걸로 돈을 벌 거면 와서 계약하라는 겁니다.

알리바바가 이렇게 한 게 처음은 아닙니다. 지난번 글에 Qwen 3.8을 적으면서, 27B는 Apache 2.0인데 Max급은 자체 라이선스로 나왔다고 썼습니다. 그때는 큰 모델에만 조건을 거는 정도로 읽었습니다. 이번에는 작은 모델에서 원래 풀려 있던 조건을 다시 걸었습니다. 방향이 조금 더 분명해졌습니다.

이 조건이 어느 시점에 청구되는지를 보면 더 흥미롭습니다. 처음 받을 때는 아무것도 안 냅니다. 받아서 써보고, 결과가 마음에 들어서 작은 서비스 시제품에 붙여보고, 몇 주 동안 프롬프트와 설정을 그 모델에 맞춥니다. 그러다 이걸 실제로 팔려고 하는 순간에 라이선스 조건에 걸립니다. 그때 선택지는 계약하러 가거나, 몇 주 동안 맞춘 걸 버리고 다른 모델로 다시 시작하거나 둘뿐입니다. 값을 맨 앞에서 받지 않고, 쓰는 사람이 이미 쌓아둔 게 있을 때 받는 구조입니다. 옮기는 비용이 클수록 계약하러 올 확률이 올라가니까, 무료로 풀어놓는 것 자체가 나중에 값을 받기 위한 준비처럼 보이기도 합니다. 아래에서 다시 적겠지만, 제가 가격 인하에 별로 흔들리지 않는 이유와 정확히 같은 원리입니다.

제 입장에서 이게 남의 이야기가 아닌 이유가 있습니다. 이 블로그는 광고를 붙이려고 준비하고 있고, 글마다 히어로 이미지가 한 장씩 들어갑니다. 이 모델로 그 이미지를 만들면 연구나 평가 목적이라고 말하기 어렵습니다. 집에서 돌릴 수 있고 돈도 안 들지만, 제 용도에는 쓸 수 없는 모델입니다. 지금은 히어로 이미지를 다른 도구로 만들고 있어서 당장 달라지는 건 없습니다. 다만 나중에 비용을 줄이려고 집에서 돌릴 이미지 모델을 찾게 되면, 이 모델은 첫 후보에서 빠집니다. 오픈소스라는 단어만 보고 받았으면 모르고 지나갔을 겁니다.

"오픈"이라는 말이 요즘은 너무 여러 가지를 뜻합니다. 가중치를 받을 수 있다는 뜻일 때도 있고, 마음대로 써도 된다는 뜻일 때도 있고, 연구용으로만 보라는 뜻일 때도 있습니다. 가격표에 0이 적혀 있으면 라이선스 파일을 한 번 더 확인해야 하는 때가 된 것 같습니다.

메타는 값을 말하지 않았습니다

무료 모델 말고도 값을 아예 꺼내지 않은 곳이 하나 있습니다. 9월 23일 메타 Connect입니다.

메타는 이날 뮤즈를 여러 기기로 넓혔습니다. 안경에서는 이름을 부르면 켜지고, Mac 앱은 화면을 직접 조작하고, 뮤즈마다 자기 메일 주소가 생기고, 주머니에 넣고 다니는 Charm이라는 기기가 따로 나옵니다. 쇼핑 파트너에는 월마트와 베스트바이, 세포라, 익스피디아, 인스타카트 같은 이름이 새로 붙었습니다. 그 긴 목록 어디에도 뮤즈를 쓰는 값은 없었습니다.

값을 받는 곳이 다르기 때문으로 보입니다. TechCrunch 정리를 보면 토큰은 넉넉히 무료로 주고, 시간이 지나면 거래에서 작은 수수료를 받아 이익을 내겠다는 설명이 나옵니다. 쓰는 사람에게 돈을 받지 않고 쓰는 사람이 사는 물건에서 받겠다는 겁니다. 그러면 단가표 싸움에 들어갈 이유가 없습니다. 다른 회사들이 값을 내릴수록 "우리는 원래 공짜"라는 말이 오히려 덜 튀는 정도일 겁니다.

값을 말하지 않았다고 값이 없는 건 아닙니다. 거래 수수료는 파는 쪽이 내는 돈이지만, 파는 쪽은 그걸 어딘가에 얹습니다. 물건값일 수도 있고, 뮤즈가 고르는 상품 목록에 누가 먼저 올라가느냐일 수도 있습니다. API 단가는 적어도 숫자로 적혀 있어서 비교라도 할 수 있습니다. 뮤즈의 값은 영수증에 따로 찍히지 않습니다. 나흘 동안 나온 것 중에 제일 싸 보이는 쪽이 사실은 값을 제일 확인하기 어려운 쪽일 수도 있다는 생각이 듭니다. 이건 뮤즈가 실제로 돌아가는 모습을 몇 달 더 봐야 알 것 같습니다.

이 이야기는 이틀 전에 뮤즈가 앱스토어 1위에 오른 이유를 적은 글에 길게 적었고, 거기서 한 걱정도 그대로입니다. 여기서는 하나만 붙입니다. 단가를 내세운 세 회사와 조건을 건 알리바바, 값을 말하지 않은 메타를 나란히 놓으면, 값을 둘러싼 경쟁이 한 방향으로만 가는 게 아니라는 게 보입니다. 한쪽은 단가를 내리고, 한쪽은 무료 대신 조건을 걸고, 한쪽은 쓰는 사람 대신 거래에서 돈을 받습니다.

20% 싸졌다고 도구를 옮길 생각은 안 듭니다

여기까지 적고 나서 제 쪽을 돌아보면, 솔직히 이번 가격 인하가 저한테 바꾸는 건 거의 없습니다.

이 블로그는 Claude Code 위에 에이전트와 스킬, 훅을 얹어서 운영하고 있습니다. 문체 기준을 적은 파일이 있고, 글을 쓰는 에이전트와 검수하는 에이전트가 따로 있고, 발행 직전에 걸리는 검사가 있습니다. 이 규칙들은 어느 모델이 읽어도 같은 뜻이 되도록 쓴 게 아닙니다. 지금 쓰는 모델이 읽었을 때 원하는 대로 동작하도록 고쳐 가며 쓴 겁니다.

다른 모델로 옮기면 그 규칙들이 같은 뜻으로 읽히는지부터 다시 확인해야 합니다. 어떤 문장은 너무 세게 먹히고, 어떤 문장은 아예 무시될 겁니다. 그걸 하나씩 다시 맞추는 데 드는 시간이 옮기는 진짜 비용입니다. API 단가 20%나 50%는 그 비용과 비교하면 작습니다. 매달 나가는 돈에서 몇 퍼센트를 아끼려고 몇 주를 다시 맞추는 일은, 적어도 지금 제 규모에서는 계산이 안 나옵니다.

지난번 글에서 규칙과 자료를 파일로 두니까 어디에든 붙는다고 적었는데, 이번에 보니 그 말은 반만 맞습니다. 파일은 어디에든 붙습니다. 그 파일에 적힌 규칙이 어떻게 읽힐지는 모델마다 다릅니다. 옮길 수 있다는 것과 옮겨도 같은 결과가 나온다는 건 다른 이야기였습니다. 그 글에서 갈아탈 수 있는데 안 갈아타는 것과 못 갈아타는 것은 다른 상태라고 했는데, 저는 아마 그 중간 어디쯤에 있는 것 같습니다.

코드를 안 쓰는 분들 쪽도 크게 다르지 않다고 봅니다. 챗봇 하나를 몇 달 쓰면 그 안에 대화 기록이 쌓이고, 요즘은 메모리 기능 때문에 도구가 저에 대해 기억하는 것도 쌓입니다. 제가 어떤 말투를 좋아하는지, 무슨 일을 하는지, 지난번에 뭘 물었는지. 다른 서비스가 이번 달에 조금 더 싸다고 해서 그걸 두고 가기는 쉽지 않습니다. 다시 처음부터 저를 설명해야 하니까요. 구독료 몇 달러 차이는 그 설명 비용에 비하면 잘 안 보이는 숫자입니다.

그렇게 보면 값이 떨어질수록 고르는 기준이 가격표에서 멀어지는 것 같습니다. 모든 모델이 충분히 싸지면, 남는 차이는 얼마냐보다 내가 이미 쌓아둔 게 어디에 맞춰져 있느냐입니다.

회사들도 이걸 알고 있는 눈치입니다. 이번 발표에서 하나 더 눈여겨본 건, 새 모델이 첫날부터 어느 도구에 들어갔느냐입니다. Opus 5.5의 빠른 모드는 Claude Code와 앤트로픽 플랫폼에서 쓸 수 있게 나왔습니다. GPT-6 Sol과 Luna는 ChatGPT Work와 Codex에 같은 날 올라갔습니다. Grok 4.7은 첫날부터 Cursor와 xAI의 Grok Build에 들어갔습니다. 메타는 뮤즈를 안경에 넣었습니다.

한 손으로는 값을 내리고 다른 손으로는 자기 도구 안에 사람을 붙잡아 두는 모양입니다. 단가는 누구든 따라 내릴 수 있지만, 사람들이 몇 달 동안 쌓은 설정과 습관은 따라 할 수 없습니다. 값을 내리는 건 경쟁 때문에 하는 일이고, 도구에 붙잡아 두는 건 그 경쟁에서 빠져나오려고 하는 일처럼 보입니다.

하나 걸리는 게 있다면 가격표 자체를 기준으로 쓰기 어려워졌다는 겁니다. OpenAI는 이번에 VentureBeat에 새 가격이 프로모션이 아니라 정가라고 확인해줬습니다. 그걸 굳이 확인해줘야 했다는 건, 바로 전 가격이 프로모션이었다는 뜻입니다. 50% 인하의 기준이 된 숫자가 원래 한시적인 숫자였습니다. 6월에 출력 30달러로 나온 Sol이 석 달 만에 20달러가 됐고, 후속 모델로 10달러가 됐습니다.

지난번 글에서 갈아타기의 진짜 손해는 비교할 기준선을 잃는 거라고 적었습니다. 이제는 가격 쪽에서도 기준선이 잘 안 잡힙니다. 석 달 뒤에 얼마일지 모르는 가격을 보고 도구를 고르는 건 좀 불안합니다. 반대로 말하면, 지금 싸다는 이유로 옮긴 사람은 석 달 뒤에 또 옮길 이유를 받게 됩니다.

API 위에 자기 서비스를 얹어 파는 사람들은 이게 더 곤란할 것 같습니다. 원가가 석 달마다 반으로 줄면 좋은 일 같지만, 경쟁 서비스도 똑같이 원가가 줄어듭니다. 내 가격을 언제 얼마나 내려야 하는지, 아니면 안 내리고 버텨도 되는지를 매번 다시 계산해야 합니다. 원가가 떨어질 때마다 그 이득이 자기 주머니에 남지 않고 고객 쪽으로 빠져나가는 구조라면, 싸지는 게 반갑기만 하지는 않을 겁니다.

그렇다고 가격이 영영 상관없다고 말할 자신은 없습니다. 반값이 두세 번 더 이어지면 이야기가 달라질 수 있습니다. 옮기는 비용은 대체로 한 번 치르면 끝이고, 가격 차이는 매달 쌓입니다. 어느 시점에는 그 둘이 만날 겁니다. 제 경우엔 아직 멀어 보이지만, 사용량이 훨씬 큰 팀이라면 이미 만났을 수도 있습니다. 그런 팀에게는 이번 주 발표가 저와 전혀 다르게 읽혔을 겁니다.

DevDay가 이 그림을 바꿀지는 내일 새벽에 봅니다

이 글을 쓰는 지금은 OpenAI DevDay 키노트가 아직 열리지 않았습니다. 한국 시간으로 9월 30일 새벽 2시입니다.

미리 나온 소식은 Fortune의 9월 24일 보도 정도입니다. 익명 소식통을 인용해서, 보안에 특화된 GPT-6 Cyber의 프리뷰와 보안 제품 하나, 그 밖에 열 개가 넘는 제품이 나올 거라고 했습니다. GPT-6 Cyber는 신청해서 승인받은 일부 고객만 알파로 쓰고 있다고 합니다. 회사가 확인한 내용이 아니라서 여기서는 예고로만 둡니다.

예고대로라면 가격 이야기와는 방향이 다른 발표입니다. 지난번 글에서 가장 좋은 모델을 개인은 쓸 수 없는 경우가 늘고 있다고 적었는데, 그런 모델이 하나 더 생기는 셈입니다. 한쪽 끝에서는 값이 계속 내려가고, 다른 쪽 끝에서는 값을 매기기 전에 자격부터 따지는 모델이 생깁니다. 열 개 넘는 제품 중에 가격 이야기가 몇 개나 섞여 있을지는 궁금합니다.

댓글

이 블로그의 인기 게시물

구글은 서울에서 모델이 아니라 에이전트를 판다

AI 부업으로 3개월에 2달러 벌고 50달러를 썼다는 증언을 봤습니다. 그 위에 광고가 네 겹입니다

같은 봉제인형 프롬프트를 넣었는데 ChatGPT는 원본을, Gemini는 프롬프트를 따랐습니다