DHH는 날짜를 짚었고 저는 AI에 손코딩을 넘긴 날을 모릅니다

이미지
DHH가 올해 Rails World에서 한 발표를 요약한 영상을 몇 편 봤습니다. 원본 발표를 처음부터 끝까지 본 건 아니고, 한국어로 정리해 준 유튜브 영상 네 편을 이어서 봤습니다. 발표를 남이 정리해 준 걸로 보고 대충 알았다고 넘어가는 것도, 생각해 보면 요즘 제가 코드를 대하는 방식이랑 비슷합니다. 원본을 다 읽지 않고 정리된 결과를 보고, 이상한 데가 있으면 그때 찾아봅니다. 내용이 많았는데 제일 오래 남은 건 날짜 하나였습니다. 2025년 11월 24일. 영상에 따르면 DHH는 이날을 "우리 시대의 코닥 브라우니"라고 불렀다고 합니다. Claude Opus 4.5가 나온 날입니다. 1900년에 1달러짜리 카메라가 나오면서 초상화를 그리던 화가들이 일감을 잃고 방향을 틀었던 것처럼, 그날부터 프로그래머의 일이 바뀌었다는 얘기였습니다. 그리고 기술은 비탈길처럼 매끄럽게 오르는 게 아니라 한참 평평하다가 어느 날 한 칸 뛰는 계단처럼 온다고 했습니다. 영상을 보면서 저도 모르게 제 날짜를 찾고 있었습니다. 저는 언제였지. 생각이 안 났습니다. 마지막으로 직접 친 코드 어림잡을 수 있는 건 있습니다. 2025년 9월쯤부터는 제가 코드를 직접 쓴 기억이 없습니다. DHH가 짚은 날보다 두 달쯤 앞입니다. 이걸 날짜라고 하기는 좀 어렵습니다. 9월 몇 일에 무슨 일이 있어서 그날부터 안 쓴 게 아니라, 거꾸로 짚어 올라가다 보니 그쯤부터는 기억이 비어 있다는 정도입니다. 어느 날 키보드에서 손을 뗀 게 아니라 손으로 친 마지막 줄이 언제였는지 생각해 보니 안 떠오르는 겁니다. 두 달 앞이라고 해서 제가 남들보다 빨랐다는 뜻도 아닙니다. 그때 무슨 모델을 쓰고 있었는지도 정확히 기억이 안 납니다. DHH는 특정 모델이 나온 날을 짚었는데 저는 어떤 모델 때문에 넘어왔는지를 말할 수가 없습니다. 모델이 바뀐 날은 발표가 있으니 찾아보면 나오겠지만, 제가 바뀐 날은 아무 데도 적혀 있지 않습니다. 커밋 기록을 뒤져 보면 뭔가 나올...

하사비스가 AGI 예측을 2.5년 당겼다

밝은 작업실에서 캔버스와 붓이 놓인 이젤 옆에 태블릿이 함께 세워져 있는 장면

2025년 6월에 데미스 하사비스는 AGI가 2030년에서 2035년 사이에 올 거라고 했습니다.

2026년 5월, 구글 I/O 키노트가 끝나고 Axios 대담에서 같은 질문을 받았을 때는 2029년, 늦어도 2030년이라고 답했습니다. 키노트 무대에서는 "지금을 돌아보면 우리는 특이점의 산기슭에 서 있었다는 걸 알게 될 것 같다"는 말도 했습니다.

그사이 지난 시간은 11개월인데 예측은 2년 반쯤 당겨졌습니다. 흘러간 시간보다 당긴 폭이 두 배가 넘습니다.

기사들은 대개 여기서 AGI 3년 남았다는 제목을 뽑고 끝납니다. 저는 이 숫자를 보면서 그 숫자보다 예전 예측들이 어느 쪽으로 틀렸었는지가 더 궁금했습니다. 지난 몇 년 동안 AI 예측은 좀 특이한 방향으로 틀려왔던 것 같아서요. 날씨 예보도 매번 비를 하루 늦게 맞히는 예보관이 있으면, 그 사람이 내일 비 온다고 하면 오늘 우산을 챙기게 됩니다. 새 숫자를 그대로 믿을지보다 그 사람이, 그리고 그 사람 주변이 그동안 어느 쪽으로 틀렸는지를 먼저 보고 싶었습니다.

창작은 마지막이라고 적혀 있었습니다

AI가 예술까지 할 줄은 몰랐다는 말을 흔히 막연한 감상으로 듣는데, 저는 그게 그냥 감상만은 아니었다고 생각합니다. 실제로 그렇게 적힌 논문이 있었습니다.

2013년 옥스퍼드의 칼 베네딕트 프레이와 마이클 오스본이 낸 「고용의 미래」는 미국 일자리의 절반 가까이가 10~20년 안에 컴퓨터화될 위험이 높다고 봤습니다. 이 47%라는 숫자가 10년 넘게 인용되면서 논문의 나머지 절반은 오히려 잘 안 알려졌습니다.

저는 그 나머지 절반이 지금 더 재밌습니다. 두 사람은 컴퓨터가 사람 일을 못 따라 하게 막는 공학적 병목을 세 가지로 봤습니다. 불규칙한 물건을 알아보고 다루는 지각과 조작, 새 아이디어를 내는 창의 지능, 협상하고 설득하고 돌보는 사회 지능입니다. 그리고 이 병목들이 풀리는 속도가 21세기 컴퓨터화의 범위를 정할 거라고 했습니다.

그 뒤 10년 동안 이 틀은 거의 표준 지도처럼 쓰였습니다. 진로 상담도, 기업 교육도, AI 시대에 살아남는 직업 같은 목록도 다 이 지도에서 나왔습니다. 결론은 늘 비슷했습니다. 반복적이고 규칙적인 일부터 사라지고 창작과 돌봄은 뒤에 남는다. 규칙적인 사무 일에서 벗어나서 사람을 상대하는 일이나 창의적인 일로 가라.

2015년이나 2018년에 이 말을 듣고 진로를 정한 사람이 있다면 그 사람은 지금 먼저 넘어간 쪽에 서 있습니다. 누가 거짓말을 한 게 아니라 지도가 그렇게 그려져 있었습니다. 2013년 기준으로는 합리적인 지도였고 방법도 당시로선 꽤 정교했습니다. 제가 걸리는 건 순서가 다르게 나온 걸 다 본 지금도 그 지도를 그린 방식이 그대로라는 겁니다. 살아남는 직업 목록은 지금도 같은 식으로 만들어집니다. 어떤 일이 더 인간적으로 보이느냐로 줄을 세웁니다. 그 기준이 한 번 크게 빗나갔다는 건 목록 어디에도 안 들어가 있습니다. 인간적으로 보이는 일이 오래 남을 거라는 생각은 듣기에 좋습니다. 사람이 하는 일 중에 제일 사람다운 게 마지막까지 남는다는 얘기라서 위로도 됩니다. 저는 그래서 이 기준이 잘 안 바뀌는 것 같다고 생각합니다. 맞아서가 아니라 듣기 좋아서요.

실제로 넘어간 순서

시간 순으로 놓아보면 처음은 대화와 요약이었습니다. 2022년 말입니다. 이건 지도랑 별로 안 부딪혔습니다. 텍스트를 받아서 텍스트를 내놓는 일이었고, 요약이나 초안은 누구의 지도에서도 마지막 방어선이 아니었습니다.

그다음 코딩도 대체로 예상한 대로였던 것 같습니다. 코드는 결국 텍스트고, 문법이 엄격하고, 맞았는지 기계로 확인할 수 있습니다. 공개 저장소에 학습할 게 쌓여 있었다는 것까지 조건이 좋았습니다. 코딩 자동화를 놀라운 일로 기억하는 사람은 생각보다 적습니다. 온다고 했고 그 길로 왔습니다.

코딩에서도 예측이 어긋나긴 했는데, 방향보다는 정도가 어긋났습니다. 2022년쯤엔 똑똑해진 자동완성 정도를 떠올렸습니다. 함수 서명을 쓰면 본문을 채워주고 보일러플레이트를 대신 쳐주는 도구요. 실제로 온 건 이슈 하나를 받아서 저장소를 훑고 여러 파일을 고치고 검증까지 돌리는 물건이었습니다. 생각보다 훨씬 위였지만 같은 선 위에서 더 멀리 간 거였습니다. 그래서 코딩 쪽 사람들은 놀라긴 했어도 당황하진 않았던 것 같습니다. 올 줄 알았던 게 생각보다 크게 왔을 뿐이니까요. 이미지와 영상은 올 줄 몰랐던 게 온 거라서 받아들이는 쪽 반응도 많이 달랐습니다.

이미지는 좀 달랐습니다. 지도대로라면 창의 지능은 사회 지능이랑 같이 뒤에 있어야 했는데, 그림 생성은 대화 모델이랑 거의 같이 왔습니다. 그래도 그때는 반박할 거리가 있었습니다. 그럴듯한 그림을 뽑는 거랑 원하는 그림을 만드는 건 다르다는 거였고 실제로 맞는 말이었습니다. 손가락이 여섯 개였고, 같은 인물을 두 번 못 그렸고, 글자를 넣으면 뭉개졌습니다.

그 반박이 무너진 게 2025년 하반기 이미지 편집입니다. 8월에 구글이 낸 이미지 모델이 나노 바나나라는 별명으로 퍼졌고, 11월에 나노 바나나 프로가 나왔습니다. 이미지를 여러 장 섞어 넣고, 여러 인물의 얼굴을 유지한 채로 편집하고, 4K로 뽑는 데 분이 아니라 초가 걸렸습니다.

영상은 더 촘촘했습니다. 2024년 2월에 Sora 가 이런 게 된다는 데모를 보여줬고, 2026년 1월쯤엔 레퍼런스 이미지로 캐릭터를 고정한 4K 세로 영상이 그냥 제품 기능이 돼 있었습니다. 2년이 안 걸렸습니다.

그러니까 대화, 코딩, 이미지, 영상 순이었고 지도랑 어긋난 건 뒤의 둘입니다. 사회 지능은 아직 그대로 있습니다. 창의 지능만 줄에서 빠져나와 앞으로 갔습니다. 2026년 4월 Anthropic 이 디자인 도구를 낸 날 피그마 주가가 8.7% 빠진 일도 저한테는 그렇게 보였습니다. 시장이 창작 도구의 해자를 다시 따져본 날이었습니다. 주가가 맞는 판단을 했는지는 모르겠지만, 적어도 돈을 건 사람들은 창작이 마지막이라는 지도를 그날은 안 믿었던 것 같습니다.

생성보다 편집이 놀라웠습니다

이미지나 영상 얘기가 나오면 보통 생성을 말합니다. 없던 그림, 없던 장면을 만드는 것이요. 인상적이긴 한데 저는 생성이 오히려 쉬운 쪽이라고 봅니다. 그럴듯한 걸 하나 뽑는 일이고, 마음에 안 들면 다시 뽑으면 됩니다. 매번 다른 게 나와도 흠이 아닙니다.

편집은 거꾸로입니다. 주어진 걸 거의 다 그대로 두고 말한 부분만 바꾸고, 그 결과가 원래 그 대상으로 보여야 합니다. 이 사람 재킷만 갈아입히되 얼굴은 이 얼굴이어야 하고, 이 장면 조명만 저녁으로 바꾸되 공간은 그대로여야 합니다.

그대로 두는 게 훨씬 어렵습니다. 뭘 바꿀지는 프롬프트에 적혀 있는데 뭘 안 바꿀지는 안 적혀 있습니다. 모델이 알아서 알아야 합니다. 이건 그리는 능력이라기보다 같은 대상을 같은 대상으로 붙잡아두는 능력이고, 종류가 다른 문제라고 생각합니다. 그래서 여러 장을 받아 여러 인물의 얼굴을 유지한 채 편집한다는 사양이나, 레퍼런스 이미지로 캐릭터를 고정한다는 영상 기능이 저한테는 진짜 넘어간 순간으로 보였습니다. 새 그림을 잘 그리게 된 게 아니라 같은 대상의 다른 상태를 만들 수 있게 된 겁니다.

영상은 한 단계 더 어렵습니다. 이미지 편집은 두 장 사이에서만 같으면 되는데 영상은 1초에 24장 내내 같아야 합니다. 5초면 120장입니다. 120장 동안 같은 얼굴, 같은 옷의 같은 주름 방향이어야 하고, 조명이 바뀌어도 같은 재질로 보여야 합니다. 한 장만 어긋나도 사람 눈은 바로 잡아냅니다. 초기 영상 모델에서 화면이 깜빡이고 얼굴이 뭉개지던 게 정확히 이 실패였습니다.

여기에 물리가 붙습니다. 손을 떠난 물건은 떨어져야 하고, 가려졌다 다시 나온 건 같은 물건이어야 하고, 걸을 때 발이 땅에서 미끄러지면 안 됩니다. 이런 건 데이터에 라벨로 붙어 있지 않아서 영상을 엄청 많이 보고 알아서 배워야 합니다. 2024년 초 데모가 인상적인데 어딘가 꿈같다는 소리를 들은 게 이 두 가지 때문이었고, 2년 뒤엔 캐릭터를 고정하는 기능이 사양표에 들어가 있었습니다. 놀라야 한다면 저는 여기서 놀라야 한다고 봅니다.

속도도 큽니다. 4K 이미지 한 장에 몇 분이 아니라 몇십 초가 걸립니다. 편집은 한 번에 안 끝나서 이게 중요합니다. 열 번 고치는데 한 번에 5분이면 50분이고 그날 작업 하나입니다. 한 번에 20초면 3분 남짓이라 작업이라기보다 대화가 됩니다. 어느 선을 넘으면 도구의 성격이 바뀌는 것 같습니다. 50분짜리 일은 맡기는 일이고 3분짜리 일은 옆에 두고 같이 하는 일입니다. 같은 기능인데 속도만 바뀌어도 사람이 그걸 대하는 방식이 달라지고, 그러면 그 일을 하던 사람의 하루도 달라집니다. 그래서 데모에서는 품질보다 이 숫자가 더 중요해 보입니다.

병목이 아니라 일의 구성을 잘못 셌던 것 같습니다

그럼 프레이와 오스본은 왜 틀렸을까요. 창의 지능이 생각보다 쉬웠다고들 하는데 저는 그건 좀 아닌 것 같습니다.

논문이 말한 창의 지능은 새 아이디어를 내는 능력입니다. 그건 지금도 크게 넘어갔다고 보기 어렵습니다. 진짜로 새로운 미학적 방향을 여는 일을 모델이 한다고 말하기는 아직 이릅니다.

다른 데서 틀린 것 같습니다. 실제 창작 일의 시간 대부분은 새 아이디어를 내는 데 안 쓰입니다. 키 비주얼 한 장이 나오기까지 콘셉트를 정하는 시간과, 그걸 스무 번 바꿔보고 색을 맞추고 배경을 갈아 끼우고 로고 들어갈 칸을 비우고 가로세로 두 버전을 만드는 시간을 비교하면 뒤쪽이 훨씬 깁니다. 영상은 더 심해서 촬영보다 편집이 길고, 편집 안에서도 컷 하나를 다시 잡는 반복이 대부분입니다.

창작 일은 발상이 조금, 고치는 반복이 아주 많이로 돼 있습니다. 그런데 지도는 이 직군을 발상으로만 봤습니다. 발상이 병목이니 직업 전체가 안전하다고요. 자동화는 직업 단위가 아니라 작업 단위로 오는데, 하필 편집이 먼저 넘어갔고, 창작 일에서 시간을 제일 많이 먹던 게 바로 그거였습니다. 병목을 돌아간 게 아니라 병목이 지키고 있지 않던 쪽으로 들어온 거라고 봅니다. 성문을 아무리 튼튼하게 지어도 성벽 옆 개구멍으로 들어오면 소용이 없는 것과 비슷한 것 같습니다. 지도를 그린 사람은 성문만 봤고, 실제로 사람이 하루 종일 드나들던 건 그 옆 작은 문이었습니다.

이걸 다른 직군에 대보면 지도가 꽤 다르게 그려집니다. 이 일은 판단이 필요하니까 안전하다는 말이 많이 도는데, 판단에 쓰는 시간이 일주일 중 얼마인지, 나머지는 뭔지를 물어보는 사람은 별로 없습니다.

법률 일을 생각해보면 늘 안전한 쪽에 들어가는 직군이고 근거는 높은 판단과 책임입니다. 그런데 주니어 변호사의 한 주를 시간으로 쪼개보면 판례 찾기, 계약서 대조, 디스커버리 문서 분류, 초안 조항 고치기가 대부분일 것 같습니다. 마지막 판단과 서명은 분명히 남지만 시간으로 치면 얇습니다. 두꺼운 건 반복 대조와 반복 수정이고, 창작에서 먼저 넘어간 것과 똑같은 종류입니다.

그러면 이 직업이 없어지느냐보다는 이 직업의 시간이 어떻게 바뀌느냐가 문제인 것 같습니다. 얇은 판단만 남고 두꺼운 반복이 줄면 직군은 남아도 한 사람이 처리하는 양이 달라지고 들어오는 길이 달라집니다. 반복하는 일은 지금까지 신입이 실력을 쌓던 일이기도 해서요. 직업 단위로만 세면 이 변화는 아예 안 보입니다. 저는 이 부분이 제일 걱정됩니다. 위에 있는 사람들은 판단하는 일을 하고 있으니 자기 일이 안전하다고 느낄 텐데, 그 사람들도 처음엔 반복하는 일을 하면서 판단하는 법을 배웠을 겁니다. 그 단계가 얇아지면 다음 세대 판단하는 사람은 어디서 나오는지 저는 잘 모르겠습니다.

순서를 정한 세 가지

지도가 틀린 걸 봤으면 지도를 다시 그려봐야 할 것 같아서 넘어간 순서를 놓고 한참 봤습니다. 제 눈에는 세 가지로 설명이 되는데, 셋 다 일이 얼마나 어려우냐와는 상관이 없고 배울 수 있느냐, 틀려도 되느냐에 가깝습니다.

먼저 그 일의 과정이 데이터로 남아 있느냐입니다. 코드는 남습니다. 공개 저장소에 완성본만 있는 게 아니라 커밋 단위로 바뀐 과정, 왜 바꿨는지 적은 메시지, 리뷰 대화, 버그 리포트와 수정이 같이 쌓여 있습니다. 이미지는 더해서 웹 전체가 캡션 달린 이미지 모음 같은 거고, 영상은 유튜브가 있습니다. 반면 협상이 타결되는 과정이나 환자 상태를 보고 방향을 바꾸는 판단, 팀 안 갈등이 풀리는 대화는 기록으로 안 남습니다. 계약서는 남는데 계약서까지 간 판단은 안 남습니다. 사회 지능이 아직 그대로인 건 더 고차원이라서라기보다 배울 기록이 없어서인 것 같습니다. 이렇게 보면 좀 허탈합니다. 사람이 제일 사람다운 일을 하고 있어서 남은 게 아니라, 그 일을 아무도 적어두지 않아서 남은 거라면 남아 있는 이유가 꽤 약합니다. 회의록을 남기고 상담 기록을 남기는 문화가 늘수록 이쪽도 바뀔 것 같습니다.

그다음은 잘했는지 기계가 판정할 수 있느냐입니다. 코드는 테스트를 돌리면 되고 판정이 거의 공짜에 몇 번이든 할 수 있습니다. 그러면 시행착오로 훈련시킬 수 있습니다. 코딩이 빨랐던 건 데이터보다 이쪽 덕이 컸다고 봅니다. 이미지는 반대입니다. 좋은 그림인지 기계가 판정할 방법이 없습니다. 이것만 보면 이미지는 코딩보다 한참 늦게 와야 했고, 2020년대 초 예측도 대개 그렇게 봤습니다.

그 예측이 틀린 건 세 번째 때문인 것 같습니다. 틀렸을 때 얼마나 비싸냐입니다. 저는 이게 제일 덜 얘기된다고 생각합니다.

이미지 생성은 틀려도 너무 관대합니다. 마음에 안 들면 버리고 다시 뽑으면 되고 버리는 데 드는 건 몇 초와 약간의 연산입니다. 열 장 중 아홉 장이 못 쓸 거여도 한 장이 쓸 만하면 성공입니다. 사람이 마지막에 고르니까 모델은 평균적으로 좋을 필요가 없고 가끔 좋으면 됩니다. 그러면 기계로 판정할 수 없다는 약점이 거의 문제가 안 됩니다. 사람이 1초 보고 고르면 되니까요. 2020년대 초에 이미지는 늦을 거라고 본 사람들은 아마 모델이 혼자 좋은 그림을 판단해야 한다고 생각했던 것 같습니다. 실제로는 사람이 옆에 앉아서 골라주는 걸로 충분했습니다. 이 차이를 그때 봤으면 순서를 다르게 적었을 것 같습니다.

반대편에 협상이나 의료 판단이 있습니다. 아홉 번 잘하고 한 번 잘못하면 그 한 번이 앞의 아홉을 지웁니다. 되돌릴 수도 없고 열 개 뽑아놓고 고를 수도 없습니다. 하면 그게 끝입니다. 이런 일은 평균적으로 좋은 걸로는 안 되고 최악이 얼마나 나쁘냐가 쓸 수 있느냐를 정합니다. 성능이 조금 오른다고 넘을 수 있는 턱이 아닌 것 같습니다.

이렇게 놓고 보면 코딩은 기록이 있고 기계로 판정되고 틀려도 그럭저럭 괜찮아서 예상대로 빨랐습니다. 이미지는 기록이 엄청 많고 판정은 안 되는데 틀려도 아주 관대해서 예상 밖으로 빨랐습니다. 영상은 이미지 비슷한 조건이라 이미지보다는 늦었지만 예상보다는 훨씬 빨랐습니다. 사회 지능은 기록이 거의 없고 판정도 안 되고 틀리면 가혹해서 아직 그대로입니다. 지도는 인지적으로 얼마나 어려우냐로 줄을 세웠는데 실제 순서는 이 세 가지가 정한 것 같습니다. 창의 지능이 유별난 예외였던 게 아니라 애초에 다른 기준으로 줄을 세우고 있었던 거죠.

이게 쓸모 있다고 느끼는 건 셋이 바뀌는 속도가 달라서입니다. 기록은 만들 수 있습니다. 지금 안 남는 업무 과정도 남기기 시작하면 몇 년이면 쌓입니다. 판정도 자동으로 하는 방법을 누가 찾으면 그 순간 그쪽 속도가 달라집니다. 틀렸을 때의 비용은 다릅니다. 그건 기술이 아니라 그 일이 세상 어디에 놓여 있느냐가 정합니다. 잘못된 협상을 되돌릴 수 없다는 건 모델이 좋아져도 그대로입니다. 지금 어떤 일이 안전해 보인다면 그게 기록이 없어서인지, 틀리면 안 돼서인지를 구분해보는 게 꽤 중요하다고 생각합니다. 앞의 것은 유예고 뒤의 것은 성질이 다른 것 같습니다. 제 일을 놓고 생각해봐도 비슷합니다. 기록이 안 남아서 아직 안 넘어간 일은 누가 기록을 남기기 시작하면 금방 넘어갈 것 같고, 그 기록을 남기는 게 저 자신일 수도 있습니다. 틀리면 안 되는 일은 좀 더 오래 제 손에 있을 것 같은데, 그게 제 실력 때문은 아니라는 게 좀 묘합니다.

그렇다고 창작 직군이 무너진 건 아닙니다

능력이 넘어간 것과 일자리가 없어진 건 다른 얘기라서, 이걸 섞으면 양쪽 다 틀리게 되는 것 같습니다.

갤럽이 2017년부터 2024년까지를 본 분석은 통념이랑 좀 달랐습니다. AI 노출도가 높은 예술 직군의 소득은 노출도 낮은 직군과 대체로 비슷하게 갔고, 고용도 일부 직군이 2023년에 조금 약했을 뿐 일자리가 크게 사라졌다고 할 만한 건 없었습니다. 일하는 시간은 오히려 늘었습니다. 예술가 넷 중 하나 정도가 AI를 자주 쓴다고 했는데 주로 아이디어를 찾거나 잔일을 줄이는 데 썼습니다.

능력은 가파르게 올라갔는데 고용은 그만큼 안 따라왔습니다. 그 사이에 계약, 조직의 관성, 책임 소재, 브랜드 리스크, 법적 불확실성 같은 게 끼어 있고, 무엇보다 결과물을 승인할 사람이 여전히 필요합니다. 그림이 몇 초 만에 나와도 이걸 내보내도 되는지는 누군가 봐야 하고, 문제가 생기면 그 사람한테 책임이 갑니다. 그 사람 일이 줄어든 건 아니라서, 오히려 볼 게 늘어난 쪽도 있을 것 같습니다. 일하는 시간이 늘었다는 숫자가 저한테는 그렇게 읽혔습니다.

물론 2024년까지의 얘기고 편집이 넘어간 건 2025년 하반기입니다. 그러니 이걸 앞으로도 괜찮다는 얘기로 읽을 수는 없을 것 같습니다. 제가 읽은 건 모델이 할 수 있게 된 때와 시장이 반응하는 때 사이에 꽤 긴 틈이 있다는 것 정도입니다. 능력 발표를 보고 고용이 무너질 거라고 한 사람들은 지금까지 계속 너무 일찍 틀렸습니다. AI 영상이 쏟아지자 유튜브가 수익화 정책을 손본 일도 비슷하게 봤습니다. 만드는 능력이 먼저 오고, 그걸 다루는 규칙은 한참 뒤에 왔습니다.

다시 3~5년

이걸 들고 처음 숫자로 돌아가보면, 일단 이 숫자가 생각보다 단단하지 않습니다. 같은 사람의 같은 시기 발언인데 매체마다 옮긴 값이 3~4년, 3~5년, 5~8년, 5~10년으로 다 다릅니다. 제가 믿을 만하다고 보는 건 2025년 6월의 2030~2035년과 2026년 5월의 2029~2030년 두 개 정도입니다.

이렇게 벌어지는 건 AGI가 뭔지 합의가 안 돼 있어서인 것 같습니다. 흔히 쓰는 뜻만 셋을 놓아봐도 도착하는 때가 다 다릅니다.

하나는 대부분의 인지 과제에서 사람 전문가 수준이라는 뜻입니다. 벤치마크로 잴 수 있어서 제일 많이 인용됩니다. 그런데 벤치마크는 인지 과제를 고르게 뽑은 게 아니라 기계로 판정할 수 있는 과제만 모은 겁니다. 판정할 수 있는 일에서 사람을 넘는 거랑 판정할 수 없는 일에서 믿고 맡겨지는 건 다릅니다.

또 하나는 스스로 새로운 과학적 발견을 하는 시스템이라는 뜻입니다. 하사비스가 계속 말해온 것에 가깝습니다. 훨씬 엄격한데 확인은 오히려 쉽습니다. 발견이 나오거나 안 나오거나니까요. 이 뜻으로 보면 3년은 꽤 공격적인 숫자입니다.

마지막은 경제적으로 의미 있는 원격 근무 대부분을 해낸다는 뜻입니다. 노동시장 쪽에서는 제일 실용적인데, 갤럽 데이터를 보면 이건 모델 성능만으로 정해지지 않습니다. 책임 소재와 계약 관행이 절반쯤 정합니다. 이 뜻에서의 AGI 도착일은 연구소가 아니라 법무팀과 보험사가 정할 것 같습니다.

셋이 같은 날 올 수는 없는데 뉴스에서는 하나의 3년으로 합쳐집니다. 과학적 발견을 말한 사람의 3년과 원격 근무를 말한 사람의 3년이 같은 제목 아래 들어가면, 읽는 사람은 둘 중 더 무서운 쪽으로 읽게 되는 것 같습니다. 뜻이 없는 것에 날짜를 붙이면 날짜가 뜻을 대신하기 시작하고, 3년이라는 말이 오가는 동안 뭐가 3년 뒤에 온다는 건지는 흐려집니다. 이 숫자를 만나면 말한 사람이 셋 중 뭘 말하는지부터 봐야 할 것 같은데 대개 기사에 안 적혀 있습니다. 안 적혀 있다는 게 그 기사가 담고 있는 게 얼마인지를 알려주는 것 같기도 합니다. 그런데 그런 기사를 읽고 나면 저도 3년이라는 숫자는 기억하고 뭐가 3년이라는 건지는 잊어버립니다. 숫자는 남고 뜻은 빠집니다. 다음에 누가 AGI 얘기를 하면 저도 3년쯤이래, 하고 말할 것 같습니다.

그래도 숫자가 쓸모없지는 않은 것 같습니다. 값 말고 방향을 보면 남는 게 있습니다. 지난 몇 년 동안 AI 능력 예측은 거의 한쪽으로만 틀렸습니다. 늦게 잡았습니다. 창의 지능은 뒤에 있다고 했는데 두 번째로 넘어갔고, 이미지 편집의 일관성은 구조적 한계라고들 했는데 2년 만에 제품 사양이 됐고, 영상은 몇 초짜리 클립 넘어가려면 오래 걸린다고 했는데 2년 안에 4K 레퍼런스 고정까지 왔습니다. 하사비스 본인 예측도 같은 쪽으로 바뀌었습니다. 늘 당겨졌지 밀린 적은 없었습니다. 예측하는 사람들이 바보였다고는 생각하지 않습니다. 오히려 그 분야를 제일 잘 아는 사람들이 계속 늦게 잡았다는 게 더 이상합니다. 잘 알수록 지금 안 되는 이유를 더 많이 알고 있어서 그런 건 아닐까 하는 생각이 듭니다. 안 되는 이유를 열 개 아는 사람은 그중 아홉 개가 한꺼번에 풀릴 수 있다는 걸 잘 안 떠올리는 것 같습니다.

틀린 게 아무렇게나였으면 방향에서 읽을 게 없는데 계속 한쪽으로만 틀렸으면 그 쏠림이 다음 예측을 고쳐 읽는 데 쓸 수 있는 정보가 됩니다. 하사비스의 2029~2030에서 제가 믿는 건 연도가 아니라 연도가 줄고 있다는 사실 쪽입니다.

이 쏠림을 그대로 계속 늘이면 모든 예측을 끝없이 당겨야 해서 그것도 이상합니다. 먼저 넘어간 것들은 세 가지 조건이 유리한 쪽에 몰려 있었고 남은 것들은 그렇지 않습니다. 쉬운 순서대로 넘어간 거라면 그 쏠림이 계속될 이유도 없습니다.

능력 예측과 대체 예측은 따로 봐야 할 것 같습니다. 능력 예측은 계속 보수적으로 틀렸는데 고용이 대체된다는 예측은 반대로 계속 공격적으로 틀렸습니다. 같은 방식으로 고쳐 읽으면 안 됩니다. 그리고 AGI가 온다면 어느 날 AGI 출시라는 헤드라인으로 올 것 같지는 않습니다. 지금까지처럼 작업 단위로 올 것 같습니다. 창작에서처럼 어떤 일의 시간을 제일 많이 먹던 부분이 조용히 먼저 넘어가고, 그 일의 이름은 그대로 남아 있을 겁니다. 디자이너가 여전히 디자이너라고 불려도 하루에 하는 일은 꽤 달라질 수 있습니다. 이름이 그대로라 바뀐 걸 늦게 알아채게 되는 것 같습니다.

그래서 저는

AI가 이건 못 한다는 말을 들으면 그 근거가 뭔지가 제일 중요한 것 같습니다. 텍스트는 되는데 이미지는 안 된다, 이미지는 되는데 영상은 안 된다, 영상은 되는데 오디오 싱크는 안 된다. 이런 식으로 형식을 근거로 한 방어선은 지난 3년 동안 거의 다 1~2년 만에 무너졌습니다. 이런 데 기대고 있다면 그게 무너진 다음 계획도 같이 생각해두는 게 맞는 것 같습니다.

책임이나 맥락이나 검증이 근거면 더 오래 갈 것 같습니다. 성능 문제가 아니라 누가 서명하느냐의 문제라 성능이랑 다른 속도로 갑니다. 갤럽 데이터에서 보인 틈도 대부분 여기서 나온 것 같습니다. 이것도 영원하진 않고 검증 자체를 기계로 할 수 있느냐가 다음 문제일 텐데, 벤치마크 0.4%p 차이를 실제 태스크 개수로 바꿔본 글에서 걸렸던 게 거기 그대로 남아 있습니다. 검증 지표가 뭘 재는지 사람이 안 보면 자동화된 검증은 자동화된 착각이 됩니다.

그리고 직업 말고 작업으로 세어보는 게 맞는 것 같습니다. 프레이와 오스본이 틀린 게 그거였으니까요. 지금 하는 일을 한 주 단위로 쪼개서 시간을 적고, 각각이 발상인지 반복해서 고치는 건지 표시해보면 내가 얼마나 노출돼 있는지가 대충 나옵니다. 반복 수정이 많은 게 먼저 갑니다. 창작이 그랬습니다.

맡은 일을 열 줄 안쪽으로 적어놓고 줄마다 세 가지를 물어보면 대충 나뉠 것 같습니다. 이 일의 과정이 어딘가에 기록으로 남는지, 잘됐는지를 사람 말고 다른 게 판정할 수 있는지, 틀렸을 때 되돌릴 수 있는지. 셋 다 그렇다면 이미 진행 중이라고 보는 게 맞을 것 같고, 앞의 둘만 그렇다면 기록이 쌓이거나 판정 방법이 나오는 날 바로 바뀔 겁니다. 되돌릴 수 없는 일은 좀 다릅니다. 거기서는 모델이 얼마나 좋아지느냐보다 누가 결과에 서명하느냐가 계속 문제로 남을 것 같습니다.

이게 뭘 예언해주는 건 아닙니다. 제가 왜 안전하다고 느끼는지를 말로 꺼내보게 해줄 뿐입니다. 이건 AI가 못 한다는 말 대부분은 셋 중 뭐에 기대는지 물어보면 답이 잘 안 나옵니다. 답이 안 나오는 확신은 근거라기보다 습관에 가까운 것 같습니다. 저도 제 일에 대해서 그런 습관이 있을 거라고 생각합니다. 이건 사람이 해야지, 하는 일이 몇 개 있는데 왜냐고 물으면 셋 중 어디에 기대는지 바로 대답 못 할 것 같습니다.

예측을 채점해보는 것도 같은 얘기라고 생각합니다. 구글 I/O 전에 세운 예측 다섯 개를 행사 끝나고 한 줄씩 채점해본 적이 있는데, 해봐야 제 예측이 어느 쪽으로 치우치는지 압니다. I/O 직전에 세 갈래로 나눠 적어둔 글도 나중에 채점하려고 남긴 거였습니다.

채점해보면 맞힌 것보다 틀린 쪽이 더 쓸모가 있었습니다. 맞힌 건 그냥 맞았구나 하고 지나가는데, 틀린 건 왜 틀렸는지를 한 줄이라도 적어두게 됩니다. 그 한 줄이 다음 예측을 할 때 같은 쪽으로 또 틀리지 않게 해줍니다. 프레이와 오스본의 지도가 아쉬운 것도 그 부분입니다. 지도가 틀린 건 어쩔 수 없는 일인데, 그 지도를 가져다 쓰는 사람들이 이 칸은 순서가 다르게 나왔다는 한 줄을 안 붙인 채로 계속 쓰고 있습니다. 만약 살아남는 직업 목록 맨 아래에 지난번 목록은 이 부분이 틀렸다는 메모가 하나씩만 붙어 있었어도, 읽는 사람이 그 목록을 조금은 다르게 읽었을 것 같습니다. 틀린 걸 적어두지 않으면 다음 목록도 같은 기준으로 만들어지고, 같은 쪽으로 또 틀립니다. 제 예측도 마찬가지일 겁니다. 채점을 안 했으면 저는 지금도 제가 어느 쪽으로 치우치는지 모른 채로 다음 예측을 적고 있었을 것 같습니다. 적어두는 건 귀찮지만, 안 적으면 같은 데서 또 넘어집니다. 그건 사람이 그리든 지도가 그리든 똑같은 것 같습니다.

하사비스의 2029년이 맞을지는 모르겠습니다. 그 숫자가 11개월 만에 2년 반 당겨졌다는 건 나중에 채점할 수 있는 기록이고, 저는 채점할 수 있는 기록이 채점 못 하는 확신보다는 쓸모 있다고 봅니다.

그림이 영상이 된 것 자체보다, 안 될 거라고 적혀 있던 칸이 먼저 됐는데 그 칸을 적은 방식은 아직 아무도 안 고쳤다는 게 저는 더 놀랍습니다.

댓글

이 블로그의 인기 게시물

봉제인형 사진 한 장, ChatGPT와 Gemini의 다른 대답

구글은 서울에서 모델이 아니라 에이전트를 판다

AI 부업으로 3개월에 2달러 벌고 50달러를 썼다는 증언을 봤습니다. 그 위에 광고가 네 겹입니다