글

라벨이 로컬 LLM인 게시물 표시

같은 봉제인형 프롬프트를 넣었는데 ChatGPT는 원본을, Gemini는 프롬프트를 따랐습니다

이미지
오전에 당근 모임 대화방에 그림 두 장이 올라왔습니다. 저는 대화에 끼지 않고 읽기만 하고 있었습니다. 하나는 한옥 마당에서 버섯 바구니를 든 주황색 고양이였고, 다른 하나는 시장 골목에서 장바구니를 든 가지와 당근이었습니다. 둘 다 펠트로 만든 인형처럼 생겼고, 표면에 보풀이 일어난 게 폰 화면으로도 보일 정도였습니다. 바로 밑에 누가 물었습니다. 제미나이로 만든거에요? 올린 분 답은 이랬습니다. 아뇨 인스타에서 찾은거 걍 인형같던데... 대화는 "으흠 신기하네용"으로 끝났는데, 저는 "걍 인형같던데"에서 좀 오래 멈춰 있었습니다. 그 말이 딱 그 그림이 노린 반응이라서요. 진짜 인형을 찍은 사진이면 굳이 나올 말이 아닙니다. 보는 사람이 한 번은 헷갈려야 나오는 말이죠. 가지가 쓴 동그란 안경은 실로 수놓은 것처럼 보이는데, 손바닥만 한 인형에 안경테를 저렇게 고르게 수놓는 건 손으로 하기엔 꽤 성가신 일입니다. 배경이 전부 적당히 흐려져 있고 햇빛이 인형 털 끝에서만 반짝이는 것도 그렇고요. 제 눈에는 AI 쪽으로 보였습니다. 그래서 그 두 장을 뜯어보고 프롬프트로 옮겨 봤습니다. 인스타에 올린 사람이 어떤 프롬프트를 썼는지는 모릅니다. 그림에서 보이는 걸 거꾸로 적어 내려간 것이고, 그렇게 만든 프롬프트에 가지고 있던 사진 몇 장을 넣어 봤습니다. 그림 두 장을 문장으로 옮기면서 거꾸로 적어 내려간다는 게 말은 쉬운데, 해 보면 그림에서 뭘 볼지부터 정해야 합니다. 제가 먼저 본 건 얼굴이었습니다. 고양이 눈은 반쯤 감긴 선 두 줄이고, 가지 얼굴도 눈과 입이 가는 선 몇 개로 끝납니다. 펜으로 그린 선이 아니라 실로 박음질한 선처럼 보였고, 이게 눈, 눈썹, 코, 입은 프린트가 아니라 embroidery나 felt applique로 만든다는 문장이 됐습니다. 다음은 표면이었습니다. 크게 키워 보면 고양이 털 가장자리가 햇빛을 받아 하얗게 빛나는데, 매끈한 3D 렌더링과 제일 다른 부분이 여...

새 모델 발표를 언제부턴가 안 열어보고 있습니다

이미지
9월 1일에 Fable 5.1 이 나왔고, 다음 날 Gemini 3.8 Flash 가 나왔고, 그다음 날 GPT-6 Astra 가 나왔습니다. 사흘 연속이었습니다. 처음에는 정리해두려고 했습니다. 뭐가 나왔고 뭐가 달라졌고 어느 쪽으로 옮기는 게 나은지. 문서를 열고 목록을 만들다가 세 줄쯤에서 닫았습니다. 이걸 다 채워놔도 다음 주에 또 나올 텐데, 그때 이 문서는 뭐가 되나 싶었습니다. 그래서 이 글에는 9월 첫 주에 무엇이 나왔는지 정리한 표가 없습니다. 정리하고 싶어지는 마음 쪽을 보는 글입니다. 그리고 문서를 닫고 나서야 알았는데, 저는 이미 한참 전부터 안 따라가고 있었습니다. 그만두기로 정한 날이 없는데도 그렇게 돼 있었습니다. 따라가면 앞선다는 감각은 어디서 왔나 이 믿음에는 출처가 있습니다. 2023년에서 2024년 사이에는 실제로 그랬습니다. 그때는 새 모델이 나오면 못 하던 일이 됐습니다. 파일 하나를 통째로 못 넣던 것이 들어가게 되고, 대화가 열 번을 못 넘기던 것이 오십 번을 넘겨도 앞을 기억했습니다. 늦게 옮긴 사람은 그 몇 달 동안 실제로 못 하는 일이 있었습니다. 그러니 "새 게 나오면 바로 확인한다"는 습관은 그 시절에는 합리적인 투자였습니다. 문제는 그 시절 학습이 몸에 남아 있다는 겁니다. 새 모델 발표를 보면 "지금 안 옮기면 뒤처진다"는 감각이 먼저 옵니다. 감각이 틀린 게 아니라 그 감각이 만들어진 조건이 사라졌습니다. 지금은 새 모델이 나와도 못 하던 일이 갑자기 되지는 않습니다. 하던 일을 조금 더 잘합니다. 그 "조금 더"는 발표 자료를 읽어서는 확인이 안 됩니다. 벤치마크 점수는 남이 고른 문제로 잰 값이고, 제가 실제로 시키는 일과 겹치는 구간이 얼마인지는 아무도 안 알려줍니다. 그래서 확인하려면 제 작업으로 직접 돌려봐야 하는데, 제대로 하려면 반나절이 갑니다. 두 달 사이에 제가 알림으로 받은 발표만 여덟 번이었습니다. 여덟 번을 전부 ...

Qwen 3.8 설치 전 확인할 것 - 세 갈래 버전 차이와 24GB VRAM 실제 요건

이미지
Qwen 3.8 이야기가 몇 주째 도는데 저는 아직 안 깔았습니다. 받아서 돌려보고 쓰는 게 순서인 건 알지만, 27B 짜리 하나 받는 데 20분 가까이 걸리고 그거 돌리려고 다른 거 다 내려야 하니 손이 안 갔습니다. 그래서 깔기 전에 뭐가 어떻게 바뀐 건지부터 찾아봤습니다. 그러다 어제 Fable 5.1 이 나왔습니다. 원래는 Qwen 이야기만 하려고 했는데, 둘을 나란히 놓고 보니까 각각 볼 때는 안 보이던 게 하나 보였습니다. 두 회사가 같은 방향으로 갔습니다. 모델을 더 오래 생각하게 만들어놓고, 그 대신 같은 결과를 얻는 데 드는 값을 내렸습니다. 그래서 "싸졌다" 는 말과 "느려졌다" 는 말이 동시에 참이 되는 상황이 됐습니다. 정리하면서 든 생각까지 같이 적어둡니다. 설치나 도입을 앞두고 저처럼 먼저 알아보시는 분한테는 쓸 데가 있을 것 같습니다. Qwen 3.8 은 하나가 아니라 세 갈래로 나왔습니다 이게 첫 번째로 헷갈렸던 부분입니다. "Qwen 3.8 써봤다" 는 글을 읽으면서 저는 계속 같은 모델 이야기인 줄 알았는데, 읽다 보면 어떤 사람은 API 를 쓰고 있고 어떤 사람은 자기 그래픽카드에 올려놨습니다. 알고 보니 이름이 세 개입니다. Qwen 3.8-Max 가 맨 위에 있습니다. 8월 3일에 API 로 열렸습니다. 총 파라미터가 2.4T 인데 토큰마다 실제로 쓰는 건 95B 정도인 MoE 구조입니다. 컨텍스트는 1M 이고, 이미지도 받습니다. 이건 가중치를 안 주니까 그냥 API 로 쓰는 모델입니다. Qwen 3.8-27B 가 그 아래 있고, 제 관심은 사실 여기 하나였습니다. 8월 중순에 Hugging Face 에 올라왔고 라이선스가 Apache 2.0 입니다. 네이티브 컨텍스트가 262K 이고 비전이 들어 있습니다. 4비트로 줄이면 19GB 근처라서 24GB 카드 한 장에 들어갑니다. Qwen 3.8-2.4T-A95B 라는 게 하나 더 있습니다. Max ...

내 커밋 92%는 남의 데이터센터 위에 있다

이미지
빅테크가 데이터센터를 빚으로 짓는다는 얘기를 올해 초부터 계속 봤는데, 볼 때마다 제 일과 무슨 상관인지가 잘 안 붙었습니다. 주식 얘기로 읽히니까 넘겼습니다. 그런데 어제 숫자 하나를 보고 생각이 바뀌어서, 제가 쓰는 추론 비용과 그 부채가 어디서 만나는지 종이에 그려봤습니다. 만나는 데가 네 개 나왔고 넷 다 제 워크플로우 안이었습니다. 여기까진 예상한 결론이었습니다. 같이 나온 게 제 의존도였습니다. 회사 레포에서 제 커밋을 월별로 세보니 3월에 49%였던 게 5월부터 92%에서 안 내려오고 있었습니다. 그 숫자를 저는 모르고 있었습니다. 장부 밖에 얼마가 서 있나 숫자부터 봅니다. 니케이가 7월 23일에 알파벳과 마이크로소프트, 아마존, 메타, 오라클 다섯 곳의 장부 밖 부채를 1조 6,500억 달러로 집계했다 . 4년 만에 여덟 배입니다. 이 숫자가 의미를 갖는 건 비교 대상이 있을 때입니다. 같은 다섯 회사가 장부에 올려둔 부채는 약 1조 3,500억 달러입니다. 장부 밖이 장부 안보다 큽니다. 메타 한 곳이 4,200억 달러를 장부 밖에 두고 있습니다. 어떻게 장부 밖에 두나. 데이터센터를 직접 짓지 않고 특수목적법인을 세웁니다. 그 법인이 채권을 발행하거나 사모 대출을 받아 돈을 빌리고, 빅테크는 그 법인과 장기 임대 계약을 맺어 컴퓨팅 용량만 받습니다. 빌린 돈은 그 법인 장부에 잡히고 빅테크 장부에는 임대료만 남습니다. 자본적 지출이 아니라 임차료로 기록되니까 감가상각 흐름도 달라집니다. 메타가 텍사스에 짓는 1기가와트급 데이터센터가 이 방식입니다. 125억 달러가 들어가는데 그 시설을 소유한 회사를 따로 세우고 사모 신용 펀드가 지분 대부분을 가져갑니다. 위험이 사라진 게 아니라 이동합니다. 그 법인에 돈을 댄 채권 투자자와 보험사, 연기금이 위험을 듭니다. 빅테크는 계약상 일정 대가를 치르고 그 구조에서 빠져나올 선택권을 갖는 경우가 많습니다. 구조가 2008년 이전의 부채담보부증권과 겉모습이 닮았다는 지적이 여기서 나옵니다...

Google I/O 닷새 전, AI 전선이 세 갈래로 갈라졌다

이미지
어떻게 하면 토큰 사용량을 줄일 수 있을까 고민을 하다 Qwen3.5 122B를 제 M4에 깔아봤습니다. 그랬더니 토큰이 한 자릿수로 떨어졌습니다. 의도한 대로 API 호출은 정말 0이 됐습니다. 그런데 챗 답변이 깜빡이며 한 글자씩 떨어지는 걸 보다가, 초당 토큰 수가 다른 자릿수도 한 자릿수로 떨어졌다는 걸 깨달았습니다. 같은 단어가 두 의미로 동시에 들렸습니다. 비용은 한 자릿수, 속도도 한 자릿수. 한쪽은 제가 원한 결과이고 다른 한쪽은 원치 않은 결과입니다. 그 사이에 줄임표 같은 침묵이 한 박자 끼었습니다. 이 모순이 글의 출발점입니다. 제 노트북에서 일어난 한 자릿수 두 개의 어긋남은 회사 차원으로 가면 훨씬 커집니다. 그리고 이 어긋남이 바로 AI 업계의 다음 전쟁터입니다. 1년 전만 해도 우리는 "누가 더 똑똑한 모델을 만드나"를 보고 있었습니다. 텍스트 이해와 추론 능력이 다음을 결정한다고 생각했습니다. 그런데 2026년 5월 현재, 그 경쟁은 사실상 끝났습니다. 새 전쟁터는 한 갈래가 아닙니다. 정확히 세 갈래로 갈라지고 있습니다. 클라우드, 디바이스, 폼팩터. 그리고 그 세 갈래가 동시에 갈라지는 진짜 동력이 있습니다. OpenAI는 매출 1달러당 2달러를 인퍼런스 비용으로 쓰고 있습니다. 2026년 한 해 손실 추정치만 14조 원에 가깝고, 현금 소진 기준으로 보면 23조 원 가까이 됩니다. 이 숫자가 글의 결론에서 다시 나옵니다. 일단 그 숫자는 비워두자. 그중 디바이스 전선에서 가장 큰 모순이 자라고 있습니다. 제가 M4에서 본 한 자릿수 두 개의 어긋남이 바로 그 모순의 축소판입니다. 닷새 뒤 Google I/O가 열립니다. Google이 디바이스 전선에 어디까지 패를 깔지를 보면, 이 세 갈래 경쟁의 향방이 어느 정도 정해집니다. 이 글은 그 다섯 일 앞에서 쓰는 정리입니다. 텍스트 추론 경쟁이 끝났다는 신호 먼저 한 가지 사실부터 짚고 가자. 2026년 5월 기준, Anthropic Clau...