하사비스가 AGI 예측을 2.5년 당겼다
- 공유 링크 만들기
- X
- 이메일
- 기타 앱

2025년 6월에 데미스 하사비스는 AGI가 2030년에서 2035년 사이에 올 거라고 했습니다.
2026년 5월, 구글 I/O 키노트가 끝나고 Axios 대담에서 같은 질문을 받았을 때는 2029년, 늦어도 2030년이라고 답했습니다. 키노트 무대에서는 "지금을 돌아보면 우리는 특이점의 산기슭에 서 있었다는 걸 알게 될 것 같다"는 말도 했습니다.
그사이 지난 시간은 11개월인데 예측은 2년 반쯤 당겨졌습니다. 흘러간 시간보다 당긴 폭이 두 배가 넘습니다.
기사들은 대개 여기서 AGI 3년 남았다는 제목을 뽑고 끝납니다. 저는 이 숫자를 보면서 그 숫자보다 예전 예측들이 어느 쪽으로 틀렸었는지가 더 궁금했습니다. 지난 몇 년 동안 AI 예측은 좀 특이한 방향으로 틀려왔던 것 같아서요. 날씨 예보도 매번 비를 하루 늦게 맞히는 예보관이 있으면, 그 사람이 내일 비 온다고 하면 오늘 우산을 챙기게 됩니다. 새 숫자를 그대로 믿을지보다 그 사람이, 그리고 그 사람 주변이 그동안 어느 쪽으로 틀렸는지를 먼저 보고 싶었습니다.
창작은 마지막이라고 적혀 있었습니다
AI가 예술까지 할 줄은 몰랐다는 말을 흔히 막연한 감상으로 듣는데, 저는 그게 그냥 감상만은 아니었다고 생각합니다. 실제로 그렇게 적힌 논문이 있었습니다.
2013년 옥스퍼드의 칼 베네딕트 프레이와 마이클 오스본이 낸 「고용의 미래」는 미국 일자리의 절반 가까이가 10~20년 안에 컴퓨터화될 위험이 높다고 봤습니다. 이 47%라는 숫자가 10년 넘게 인용되면서 논문의 나머지 절반은 오히려 잘 안 알려졌습니다.
저는 그 나머지 절반이 지금 더 재밌습니다. 두 사람은 컴퓨터가 사람 일을 못 따라 하게 막는 공학적 병목을 세 가지로 봤습니다. 불규칙한 물건을 알아보고 다루는 지각과 조작, 새 아이디어를 내는 창의 지능, 협상하고 설득하고 돌보는 사회 지능입니다. 그리고 이 병목들이 풀리는 속도가 21세기 컴퓨터화의 범위를 정할 거라고 했습니다.
그 뒤 10년 동안 이 틀은 거의 표준 지도처럼 쓰였습니다. 진로 상담도, 기업 교육도, AI 시대에 살아남는 직업 같은 목록도 다 이 지도에서 나왔습니다. 결론은 늘 비슷했습니다. 반복적이고 규칙적인 일부터 사라지고 창작과 돌봄은 뒤에 남는다. 규칙적인 사무 일에서 벗어나서 사람을 상대하는 일이나 창의적인 일로 가라.
2015년이나 2018년에 이 말을 듣고 진로를 정한 사람이 있다면 그 사람은 지금 먼저 넘어간 쪽에 서 있습니다. 누가 거짓말을 한 게 아니라 지도가 그렇게 그려져 있었습니다. 2013년 기준으로는 합리적인 지도였고 방법도 당시로선 꽤 정교했습니다. 제가 걸리는 건 순서가 다르게 나온 걸 다 본 지금도 그 지도를 그린 방식이 그대로라는 겁니다. 살아남는 직업 목록은 지금도 같은 식으로 만들어집니다. 어떤 일이 더 인간적으로 보이느냐로 줄을 세웁니다. 그 기준이 한 번 크게 빗나갔다는 건 목록 어디에도 안 들어가 있습니다. 인간적으로 보이는 일이 오래 남을 거라는 생각은 듣기에 좋습니다. 사람이 하는 일 중에 제일 사람다운 게 마지막까지 남는다는 얘기라서 위로도 됩니다. 저는 그래서 이 기준이 잘 안 바뀌는 것 같다고 생각합니다. 맞아서가 아니라 듣기 좋아서요.
실제로 넘어간 순서
시간 순으로 놓아보면 처음은 대화와 요약이었습니다. 2022년 말입니다. 이건 지도랑 별로 안 부딪혔습니다. 텍스트를 받아서 텍스트를 내놓는 일이었고, 요약이나 초안은 누구의 지도에서도 마지막 방어선이 아니었습니다.
그다음 코딩도 대체로 예상한 대로였던 것 같습니다. 코드는 결국 텍스트고, 문법이 엄격하고, 맞았는지 기계로 확인할 수 있습니다. 공개 저장소에 학습할 게 쌓여 있었다는 것까지 조건이 좋았습니다. 코딩 자동화를 놀라운 일로 기억하는 사람은 생각보다 적습니다. 온다고 했고 그 길로 왔습니다.
코딩에서도 예측이 어긋나긴 했는데, 방향보다는 정도가 어긋났습니다. 2022년쯤엔 똑똑해진 자동완성 정도를 떠올렸습니다. 함수 서명을 쓰면 본문을 채워주고 보일러플레이트를 대신 쳐주는 도구요. 실제로 온 건 이슈 하나를 받아서 저장소를 훑고 여러 파일을 고치고 검증까지 돌리는 물건이었습니다. 생각보다 훨씬 위였지만 같은 선 위에서 더 멀리 간 거였습니다. 그래서 코딩 쪽 사람들은 놀라긴 했어도 당황하진 않았던 것 같습니다. 올 줄 알았던 게 생각보다 크게 왔을 뿐이니까요. 이미지와 영상은 올 줄 몰랐던 게 온 거라서 받아들이는 쪽 반응도 많이 달랐습니다.
이미지는 좀 달랐습니다. 지도대로라면 창의 지능은 사회 지능이랑 같이 뒤에 있어야 했는데, 그림 생성은 대화 모델이랑 거의 같이 왔습니다. 그래도 그때는 반박할 거리가 있었습니다. 그럴듯한 그림을 뽑는 거랑 원하는 그림을 만드는 건 다르다는 거였고 실제로 맞는 말이었습니다. 손가락이 여섯 개였고, 같은 인물을 두 번 못 그렸고, 글자를 넣으면 뭉개졌습니다.
그 반박이 무너진 게 2025년 하반기 이미지 편집입니다. 8월에 구글이 낸 이미지 모델이 나노 바나나라는 별명으로 퍼졌고, 11월에 나노 바나나 프로가 나왔습니다. 이미지를 여러 장 섞어 넣고, 여러 인물의 얼굴을 유지한 채로 편집하고, 4K로 뽑는 데 분이 아니라 초가 걸렸습니다.
영상은 더 촘촘했습니다. 2024년 2월에 Sora 가 이런 게 된다는 데모를 보여줬고, 2026년 1월쯤엔 레퍼런스 이미지로 캐릭터를 고정한 4K 세로 영상이 그냥 제품 기능이 돼 있었습니다. 2년이 안 걸렸습니다.
그러니까 대화, 코딩, 이미지, 영상 순이었고 지도랑 어긋난 건 뒤의 둘입니다. 사회 지능은 아직 그대로 있습니다. 창의 지능만 줄에서 빠져나와 앞으로 갔습니다. 2026년 4월 Anthropic 이 디자인 도구를 낸 날 피그마 주가가 8.7% 빠진 일도 저한테는 그렇게 보였습니다. 시장이 창작 도구의 해자를 다시 따져본 날이었습니다. 주가가 맞는 판단을 했는지는 모르겠지만, 적어도 돈을 건 사람들은 창작이 마지막이라는 지도를 그날은 안 믿었던 것 같습니다.
생성보다 편집이 놀라웠습니다
이미지나 영상 얘기가 나오면 보통 생성을 말합니다. 없던 그림, 없던 장면을 만드는 것이요. 인상적이긴 한데 저는 생성이 오히려 쉬운 쪽이라고 봅니다. 그럴듯한 걸 하나 뽑는 일이고, 마음에 안 들면 다시 뽑으면 됩니다. 매번 다른 게 나와도 흠이 아닙니다.
편집은 거꾸로입니다. 주어진 걸 거의 다 그대로 두고 말한 부분만 바꾸고, 그 결과가 원래 그 대상으로 보여야 합니다. 이 사람 재킷만 갈아입히되 얼굴은 이 얼굴이어야 하고, 이 장면 조명만 저녁으로 바꾸되 공간은 그대로여야 합니다.
그대로 두는 게 훨씬 어렵습니다. 뭘 바꿀지는 프롬프트에 적혀 있는데 뭘 안 바꿀지는 안 적혀 있습니다. 모델이 알아서 알아야 합니다. 이건 그리는 능력이라기보다 같은 대상을 같은 대상으로 붙잡아두는 능력이고, 종류가 다른 문제라고 생각합니다. 그래서 여러 장을 받아 여러 인물의 얼굴을 유지한 채 편집한다는 사양이나, 레퍼런스 이미지로 캐릭터를 고정한다는 영상 기능이 저한테는 진짜 넘어간 순간으로 보였습니다. 새 그림을 잘 그리게 된 게 아니라 같은 대상의 다른 상태를 만들 수 있게 된 겁니다.
영상은 한 단계 더 어렵습니다. 이미지 편집은 두 장 사이에서만 같으면 되는데 영상은 1초에 24장 내내 같아야 합니다. 5초면 120장입니다. 120장 동안 같은 얼굴, 같은 옷의 같은 주름 방향이어야 하고, 조명이 바뀌어도 같은 재질로 보여야 합니다. 한 장만 어긋나도 사람 눈은 바로 잡아냅니다. 초기 영상 모델에서 화면이 깜빡이고 얼굴이 뭉개지던 게 정확히 이 실패였습니다.
여기에 물리가 붙습니다. 손을 떠난 물건은 떨어져야 하고, 가려졌다 다시 나온 건 같은 물건이어야 하고, 걸을 때 발이 땅에서 미끄러지면 안 됩니다. 이런 건 데이터에 라벨로 붙어 있지 않아서 영상을 엄청 많이 보고 알아서 배워야 합니다. 2024년 초 데모가 인상적인데 어딘가 꿈같다는 소리를 들은 게 이 두 가지 때문이었고, 2년 뒤엔 캐릭터를 고정하는 기능이 사양표에 들어가 있었습니다. 놀라야 한다면 저는 여기서 놀라야 한다고 봅니다.
속도도 큽니다. 4K 이미지 한 장에 몇 분이 아니라 몇십 초가 걸립니다. 편집은 한 번에 안 끝나서 이게 중요합니다. 열 번 고치는데 한 번에 5분이면 50분이고 그날 작업 하나입니다. 한 번에 20초면 3분 남짓이라 작업이라기보다 대화가 됩니다. 어느 선을 넘으면 도구의 성격이 바뀌는 것 같습니다. 50분짜리 일은 맡기는 일이고 3분짜리 일은 옆에 두고 같이 하는 일입니다. 같은 기능인데 속도만 바뀌어도 사람이 그걸 대하는 방식이 달라지고, 그러면 그 일을 하던 사람의 하루도 달라집니다. 그래서 데모에서는 품질보다 이 숫자가 더 중요해 보입니다.
병목이 아니라 일의 구성을 잘못 셌던 것 같습니다
그럼 프레이와 오스본은 왜 틀렸을까요. 창의 지능이 생각보다 쉬웠다고들 하는데 저는 그건 좀 아닌 것 같습니다.
논문이 말한 창의 지능은 새 아이디어를 내는 능력입니다. 그건 지금도 크게 넘어갔다고 보기 어렵습니다. 진짜로 새로운 미학적 방향을 여는 일을 모델이 한다고 말하기는 아직 이릅니다.
다른 데서 틀린 것 같습니다. 실제 창작 일의 시간 대부분은 새 아이디어를 내는 데 안 쓰입니다. 키 비주얼 한 장이 나오기까지 콘셉트를 정하는 시간과, 그걸 스무 번 바꿔보고 색을 맞추고 배경을 갈아 끼우고 로고 들어갈 칸을 비우고 가로세로 두 버전을 만드는 시간을 비교하면 뒤쪽이 훨씬 깁니다. 영상은 더 심해서 촬영보다 편집이 길고, 편집 안에서도 컷 하나를 다시 잡는 반복이 대부분입니다.
창작 일은 발상이 조금, 고치는 반복이 아주 많이로 돼 있습니다. 그런데 지도는 이 직군을 발상으로만 봤습니다. 발상이 병목이니 직업 전체가 안전하다고요. 자동화는 직업 단위가 아니라 작업 단위로 오는데, 하필 편집이 먼저 넘어갔고, 창작 일에서 시간을 제일 많이 먹던 게 바로 그거였습니다. 병목을 돌아간 게 아니라 병목이 지키고 있지 않던 쪽으로 들어온 거라고 봅니다. 성문을 아무리 튼튼하게 지어도 성벽 옆 개구멍으로 들어오면 소용이 없는 것과 비슷한 것 같습니다. 지도를 그린 사람은 성문만 봤고, 실제로 사람이 하루 종일 드나들던 건 그 옆 작은 문이었습니다.
이걸 다른 직군에 대보면 지도가 꽤 다르게 그려집니다. 이 일은 판단이 필요하니까 안전하다는 말이 많이 도는데, 판단에 쓰는 시간이 일주일 중 얼마인지, 나머지는 뭔지를 물어보는 사람은 별로 없습니다.
법률 일을 생각해보면 늘 안전한 쪽에 들어가는 직군이고 근거는 높은 판단과 책임입니다. 그런데 주니어 변호사의 한 주를 시간으로 쪼개보면 판례 찾기, 계약서 대조, 디스커버리 문서 분류, 초안 조항 고치기가 대부분일 것 같습니다. 마지막 판단과 서명은 분명히 남지만 시간으로 치면 얇습니다. 두꺼운 건 반복 대조와 반복 수정이고, 창작에서 먼저 넘어간 것과 똑같은 종류입니다.
그러면 이 직업이 없어지느냐보다는 이 직업의 시간이 어떻게 바뀌느냐가 문제인 것 같습니다. 얇은 판단만 남고 두꺼운 반복이 줄면 직군은 남아도 한 사람이 처리하는 양이 달라지고 들어오는 길이 달라집니다. 반복하는 일은 지금까지 신입이 실력을 쌓던 일이기도 해서요. 직업 단위로만 세면 이 변화는 아예 안 보입니다. 저는 이 부분이 제일 걱정됩니다. 위에 있는 사람들은 판단하는 일을 하고 있으니 자기 일이 안전하다고 느낄 텐데, 그 사람들도 처음엔 반복하는 일을 하면서 판단하는 법을 배웠을 겁니다. 그 단계가 얇아지면 다음 세대 판단하는 사람은 어디서 나오는지 저는 잘 모르겠습니다.
순서를 정한 세 가지
지도가 틀린 걸 봤으면 지도를 다시 그려봐야 할 것 같아서 넘어간 순서를 놓고 한참 봤습니다. 제 눈에는 세 가지로 설명이 되는데, 셋 다 일이 얼마나 어려우냐와는 상관이 없고 배울 수 있느냐, 틀려도 되느냐에 가깝습니다.
먼저 그 일의 과정이 데이터로 남아 있느냐입니다. 코드는 남습니다. 공개 저장소에 완성본만 있는 게 아니라 커밋 단위로 바뀐 과정, 왜 바꿨는지 적은 메시지, 리뷰 대화, 버그 리포트와 수정이 같이 쌓여 있습니다. 이미지는 더해서 웹 전체가 캡션 달린 이미지 모음 같은 거고, 영상은 유튜브가 있습니다. 반면 협상이 타결되는 과정이나 환자 상태를 보고 방향을 바꾸는 판단, 팀 안 갈등이 풀리는 대화는 기록으로 안 남습니다. 계약서는 남는데 계약서까지 간 판단은 안 남습니다. 사회 지능이 아직 그대로인 건 더 고차원이라서라기보다 배울 기록이 없어서인 것 같습니다. 이렇게 보면 좀 허탈합니다. 사람이 제일 사람다운 일을 하고 있어서 남은 게 아니라, 그 일을 아무도 적어두지 않아서 남은 거라면 남아 있는 이유가 꽤 약합니다. 회의록을 남기고 상담 기록을 남기는 문화가 늘수록 이쪽도 바뀔 것 같습니다.
그다음은 잘했는지 기계가 판정할 수 있느냐입니다. 코드는 테스트를 돌리면 되고 판정이 거의 공짜에 몇 번이든 할 수 있습니다. 그러면 시행착오로 훈련시킬 수 있습니다. 코딩이 빨랐던 건 데이터보다 이쪽 덕이 컸다고 봅니다. 이미지는 반대입니다. 좋은 그림인지 기계가 판정할 방법이 없습니다. 이것만 보면 이미지는 코딩보다 한참 늦게 와야 했고, 2020년대 초 예측도 대개 그렇게 봤습니다.
그 예측이 틀린 건 세 번째 때문인 것 같습니다. 틀렸을 때 얼마나 비싸냐입니다. 저는 이게 제일 덜 얘기된다고 생각합니다.
이미지 생성은 틀려도 너무 관대합니다. 마음에 안 들면 버리고 다시 뽑으면 되고 버리는 데 드는 건 몇 초와 약간의 연산입니다. 열 장 중 아홉 장이 못 쓸 거여도 한 장이 쓸 만하면 성공입니다. 사람이 마지막에 고르니까 모델은 평균적으로 좋을 필요가 없고 가끔 좋으면 됩니다. 그러면 기계로 판정할 수 없다는 약점이 거의 문제가 안 됩니다. 사람이 1초 보고 고르면 되니까요. 2020년대 초에 이미지는 늦을 거라고 본 사람들은 아마 모델이 혼자 좋은 그림을 판단해야 한다고 생각했던 것 같습니다. 실제로는 사람이 옆에 앉아서 골라주는 걸로 충분했습니다. 이 차이를 그때 봤으면 순서를 다르게 적었을 것 같습니다.
반대편에 협상이나 의료 판단이 있습니다. 아홉 번 잘하고 한 번 잘못하면 그 한 번이 앞의 아홉을 지웁니다. 되돌릴 수도 없고 열 개 뽑아놓고 고를 수도 없습니다. 하면 그게 끝입니다. 이런 일은 평균적으로 좋은 걸로는 안 되고 최악이 얼마나 나쁘냐가 쓸 수 있느냐를 정합니다. 성능이 조금 오른다고 넘을 수 있는 턱이 아닌 것 같습니다.
이렇게 놓고 보면 코딩은 기록이 있고 기계로 판정되고 틀려도 그럭저럭 괜찮아서 예상대로 빨랐습니다. 이미지는 기록이 엄청 많고 판정은 안 되는데 틀려도 아주 관대해서 예상 밖으로 빨랐습니다. 영상은 이미지 비슷한 조건이라 이미지보다는 늦었지만 예상보다는 훨씬 빨랐습니다. 사회 지능은 기록이 거의 없고 판정도 안 되고 틀리면 가혹해서 아직 그대로입니다. 지도는 인지적으로 얼마나 어려우냐로 줄을 세웠는데 실제 순서는 이 세 가지가 정한 것 같습니다. 창의 지능이 유별난 예외였던 게 아니라 애초에 다른 기준으로 줄을 세우고 있었던 거죠.
이게 쓸모 있다고 느끼는 건 셋이 바뀌는 속도가 달라서입니다. 기록은 만들 수 있습니다. 지금 안 남는 업무 과정도 남기기 시작하면 몇 년이면 쌓입니다. 판정도 자동으로 하는 방법을 누가 찾으면 그 순간 그쪽 속도가 달라집니다. 틀렸을 때의 비용은 다릅니다. 그건 기술이 아니라 그 일이 세상 어디에 놓여 있느냐가 정합니다. 잘못된 협상을 되돌릴 수 없다는 건 모델이 좋아져도 그대로입니다. 지금 어떤 일이 안전해 보인다면 그게 기록이 없어서인지, 틀리면 안 돼서인지를 구분해보는 게 꽤 중요하다고 생각합니다. 앞의 것은 유예고 뒤의 것은 성질이 다른 것 같습니다. 제 일을 놓고 생각해봐도 비슷합니다. 기록이 안 남아서 아직 안 넘어간 일은 누가 기록을 남기기 시작하면 금방 넘어갈 것 같고, 그 기록을 남기는 게 저 자신일 수도 있습니다. 틀리면 안 되는 일은 좀 더 오래 제 손에 있을 것 같은데, 그게 제 실력 때문은 아니라는 게 좀 묘합니다.
그렇다고 창작 직군이 무너진 건 아닙니다
능력이 넘어간 것과 일자리가 없어진 건 다른 얘기라서, 이걸 섞으면 양쪽 다 틀리게 되는 것 같습니다.
갤럽이 2017년부터 2024년까지를 본 분석은 통념이랑 좀 달랐습니다. AI 노출도가 높은 예술 직군의 소득은 노출도 낮은 직군과 대체로 비슷하게 갔고, 고용도 일부 직군이 2023년에 조금 약했을 뿐 일자리가 크게 사라졌다고 할 만한 건 없었습니다. 일하는 시간은 오히려 늘었습니다. 예술가 넷 중 하나 정도가 AI를 자주 쓴다고 했는데 주로 아이디어를 찾거나 잔일을 줄이는 데 썼습니다.
능력은 가파르게 올라갔는데 고용은 그만큼 안 따라왔습니다. 그 사이에 계약, 조직의 관성, 책임 소재, 브랜드 리스크, 법적 불확실성 같은 게 끼어 있고, 무엇보다 결과물을 승인할 사람이 여전히 필요합니다. 그림이 몇 초 만에 나와도 이걸 내보내도 되는지는 누군가 봐야 하고, 문제가 생기면 그 사람한테 책임이 갑니다. 그 사람 일이 줄어든 건 아니라서, 오히려 볼 게 늘어난 쪽도 있을 것 같습니다. 일하는 시간이 늘었다는 숫자가 저한테는 그렇게 읽혔습니다.
물론 2024년까지의 얘기고 편집이 넘어간 건 2025년 하반기입니다. 그러니 이걸 앞으로도 괜찮다는 얘기로 읽을 수는 없을 것 같습니다. 제가 읽은 건 모델이 할 수 있게 된 때와 시장이 반응하는 때 사이에 꽤 긴 틈이 있다는 것 정도입니다. 능력 발표를 보고 고용이 무너질 거라고 한 사람들은 지금까지 계속 너무 일찍 틀렸습니다. AI 영상이 쏟아지자 유튜브가 수익화 정책을 손본 일도 비슷하게 봤습니다. 만드는 능력이 먼저 오고, 그걸 다루는 규칙은 한참 뒤에 왔습니다.
다시 3~5년
이걸 들고 처음 숫자로 돌아가보면, 일단 이 숫자가 생각보다 단단하지 않습니다. 같은 사람의 같은 시기 발언인데 매체마다 옮긴 값이 3~4년, 3~5년, 5~8년, 5~10년으로 다 다릅니다. 제가 믿을 만하다고 보는 건 2025년 6월의 2030~2035년과 2026년 5월의 2029~2030년 두 개 정도입니다.
이렇게 벌어지는 건 AGI가 뭔지 합의가 안 돼 있어서인 것 같습니다. 흔히 쓰는 뜻만 셋을 놓아봐도 도착하는 때가 다 다릅니다.
하나는 대부분의 인지 과제에서 사람 전문가 수준이라는 뜻입니다. 벤치마크로 잴 수 있어서 제일 많이 인용됩니다. 그런데 벤치마크는 인지 과제를 고르게 뽑은 게 아니라 기계로 판정할 수 있는 과제만 모은 겁니다. 판정할 수 있는 일에서 사람을 넘는 거랑 판정할 수 없는 일에서 믿고 맡겨지는 건 다릅니다.
또 하나는 스스로 새로운 과학적 발견을 하는 시스템이라는 뜻입니다. 하사비스가 계속 말해온 것에 가깝습니다. 훨씬 엄격한데 확인은 오히려 쉽습니다. 발견이 나오거나 안 나오거나니까요. 이 뜻으로 보면 3년은 꽤 공격적인 숫자입니다.
마지막은 경제적으로 의미 있는 원격 근무 대부분을 해낸다는 뜻입니다. 노동시장 쪽에서는 제일 실용적인데, 갤럽 데이터를 보면 이건 모델 성능만으로 정해지지 않습니다. 책임 소재와 계약 관행이 절반쯤 정합니다. 이 뜻에서의 AGI 도착일은 연구소가 아니라 법무팀과 보험사가 정할 것 같습니다.
셋이 같은 날 올 수는 없는데 뉴스에서는 하나의 3년으로 합쳐집니다. 과학적 발견을 말한 사람의 3년과 원격 근무를 말한 사람의 3년이 같은 제목 아래 들어가면, 읽는 사람은 둘 중 더 무서운 쪽으로 읽게 되는 것 같습니다. 뜻이 없는 것에 날짜를 붙이면 날짜가 뜻을 대신하기 시작하고, 3년이라는 말이 오가는 동안 뭐가 3년 뒤에 온다는 건지는 흐려집니다. 이 숫자를 만나면 말한 사람이 셋 중 뭘 말하는지부터 봐야 할 것 같은데 대개 기사에 안 적혀 있습니다. 안 적혀 있다는 게 그 기사가 담고 있는 게 얼마인지를 알려주는 것 같기도 합니다. 그런데 그런 기사를 읽고 나면 저도 3년이라는 숫자는 기억하고 뭐가 3년이라는 건지는 잊어버립니다. 숫자는 남고 뜻은 빠집니다. 다음에 누가 AGI 얘기를 하면 저도 3년쯤이래, 하고 말할 것 같습니다.
그래도 숫자가 쓸모없지는 않은 것 같습니다. 값 말고 방향을 보면 남는 게 있습니다. 지난 몇 년 동안 AI 능력 예측은 거의 한쪽으로만 틀렸습니다. 늦게 잡았습니다. 창의 지능은 뒤에 있다고 했는데 두 번째로 넘어갔고, 이미지 편집의 일관성은 구조적 한계라고들 했는데 2년 만에 제품 사양이 됐고, 영상은 몇 초짜리 클립 넘어가려면 오래 걸린다고 했는데 2년 안에 4K 레퍼런스 고정까지 왔습니다. 하사비스 본인 예측도 같은 쪽으로 바뀌었습니다. 늘 당겨졌지 밀린 적은 없었습니다. 예측하는 사람들이 바보였다고는 생각하지 않습니다. 오히려 그 분야를 제일 잘 아는 사람들이 계속 늦게 잡았다는 게 더 이상합니다. 잘 알수록 지금 안 되는 이유를 더 많이 알고 있어서 그런 건 아닐까 하는 생각이 듭니다. 안 되는 이유를 열 개 아는 사람은 그중 아홉 개가 한꺼번에 풀릴 수 있다는 걸 잘 안 떠올리는 것 같습니다.
틀린 게 아무렇게나였으면 방향에서 읽을 게 없는데 계속 한쪽으로만 틀렸으면 그 쏠림이 다음 예측을 고쳐 읽는 데 쓸 수 있는 정보가 됩니다. 하사비스의 2029~2030에서 제가 믿는 건 연도가 아니라 연도가 줄고 있다는 사실 쪽입니다.
이 쏠림을 그대로 계속 늘이면 모든 예측을 끝없이 당겨야 해서 그것도 이상합니다. 먼저 넘어간 것들은 세 가지 조건이 유리한 쪽에 몰려 있었고 남은 것들은 그렇지 않습니다. 쉬운 순서대로 넘어간 거라면 그 쏠림이 계속될 이유도 없습니다.
능력 예측과 대체 예측은 따로 봐야 할 것 같습니다. 능력 예측은 계속 보수적으로 틀렸는데 고용이 대체된다는 예측은 반대로 계속 공격적으로 틀렸습니다. 같은 방식으로 고쳐 읽으면 안 됩니다. 그리고 AGI가 온다면 어느 날 AGI 출시라는 헤드라인으로 올 것 같지는 않습니다. 지금까지처럼 작업 단위로 올 것 같습니다. 창작에서처럼 어떤 일의 시간을 제일 많이 먹던 부분이 조용히 먼저 넘어가고, 그 일의 이름은 그대로 남아 있을 겁니다. 디자이너가 여전히 디자이너라고 불려도 하루에 하는 일은 꽤 달라질 수 있습니다. 이름이 그대로라 바뀐 걸 늦게 알아채게 되는 것 같습니다.
그래서 저는
AI가 이건 못 한다는 말을 들으면 그 근거가 뭔지가 제일 중요한 것 같습니다. 텍스트는 되는데 이미지는 안 된다, 이미지는 되는데 영상은 안 된다, 영상은 되는데 오디오 싱크는 안 된다. 이런 식으로 형식을 근거로 한 방어선은 지난 3년 동안 거의 다 1~2년 만에 무너졌습니다. 이런 데 기대고 있다면 그게 무너진 다음 계획도 같이 생각해두는 게 맞는 것 같습니다.
책임이나 맥락이나 검증이 근거면 더 오래 갈 것 같습니다. 성능 문제가 아니라 누가 서명하느냐의 문제라 성능이랑 다른 속도로 갑니다. 갤럽 데이터에서 보인 틈도 대부분 여기서 나온 것 같습니다. 이것도 영원하진 않고 검증 자체를 기계로 할 수 있느냐가 다음 문제일 텐데, 벤치마크 0.4%p 차이를 실제 태스크 개수로 바꿔본 글에서 걸렸던 게 거기 그대로 남아 있습니다. 검증 지표가 뭘 재는지 사람이 안 보면 자동화된 검증은 자동화된 착각이 됩니다.
그리고 직업 말고 작업으로 세어보는 게 맞는 것 같습니다. 프레이와 오스본이 틀린 게 그거였으니까요. 지금 하는 일을 한 주 단위로 쪼개서 시간을 적고, 각각이 발상인지 반복해서 고치는 건지 표시해보면 내가 얼마나 노출돼 있는지가 대충 나옵니다. 반복 수정이 많은 게 먼저 갑니다. 창작이 그랬습니다.
맡은 일을 열 줄 안쪽으로 적어놓고 줄마다 세 가지를 물어보면 대충 나뉠 것 같습니다. 이 일의 과정이 어딘가에 기록으로 남는지, 잘됐는지를 사람 말고 다른 게 판정할 수 있는지, 틀렸을 때 되돌릴 수 있는지. 셋 다 그렇다면 이미 진행 중이라고 보는 게 맞을 것 같고, 앞의 둘만 그렇다면 기록이 쌓이거나 판정 방법이 나오는 날 바로 바뀔 겁니다. 되돌릴 수 없는 일은 좀 다릅니다. 거기서는 모델이 얼마나 좋아지느냐보다 누가 결과에 서명하느냐가 계속 문제로 남을 것 같습니다.
이게 뭘 예언해주는 건 아닙니다. 제가 왜 안전하다고 느끼는지를 말로 꺼내보게 해줄 뿐입니다. 이건 AI가 못 한다는 말 대부분은 셋 중 뭐에 기대는지 물어보면 답이 잘 안 나옵니다. 답이 안 나오는 확신은 근거라기보다 습관에 가까운 것 같습니다. 저도 제 일에 대해서 그런 습관이 있을 거라고 생각합니다. 이건 사람이 해야지, 하는 일이 몇 개 있는데 왜냐고 물으면 셋 중 어디에 기대는지 바로 대답 못 할 것 같습니다.
예측을 채점해보는 것도 같은 얘기라고 생각합니다. 구글 I/O 전에 세운 예측 다섯 개를 행사 끝나고 한 줄씩 채점해본 적이 있는데, 해봐야 제 예측이 어느 쪽으로 치우치는지 압니다. I/O 직전에 세 갈래로 나눠 적어둔 글도 나중에 채점하려고 남긴 거였습니다.
채점해보면 맞힌 것보다 틀린 쪽이 더 쓸모가 있었습니다. 맞힌 건 그냥 맞았구나 하고 지나가는데, 틀린 건 왜 틀렸는지를 한 줄이라도 적어두게 됩니다. 그 한 줄이 다음 예측을 할 때 같은 쪽으로 또 틀리지 않게 해줍니다. 프레이와 오스본의 지도가 아쉬운 것도 그 부분입니다. 지도가 틀린 건 어쩔 수 없는 일인데, 그 지도를 가져다 쓰는 사람들이 이 칸은 순서가 다르게 나왔다는 한 줄을 안 붙인 채로 계속 쓰고 있습니다. 만약 살아남는 직업 목록 맨 아래에 지난번 목록은 이 부분이 틀렸다는 메모가 하나씩만 붙어 있었어도, 읽는 사람이 그 목록을 조금은 다르게 읽었을 것 같습니다. 틀린 걸 적어두지 않으면 다음 목록도 같은 기준으로 만들어지고, 같은 쪽으로 또 틀립니다. 제 예측도 마찬가지일 겁니다. 채점을 안 했으면 저는 지금도 제가 어느 쪽으로 치우치는지 모른 채로 다음 예측을 적고 있었을 것 같습니다. 적어두는 건 귀찮지만, 안 적으면 같은 데서 또 넘어집니다. 그건 사람이 그리든 지도가 그리든 똑같은 것 같습니다.
하사비스의 2029년이 맞을지는 모르겠습니다. 그 숫자가 11개월 만에 2년 반 당겨졌다는 건 나중에 채점할 수 있는 기록이고, 저는 채점할 수 있는 기록이 채점 못 하는 확신보다는 쓸모 있다고 봅니다.
그림이 영상이 된 것 자체보다, 안 될 거라고 적혀 있던 칸이 먼저 됐는데 그 칸을 적은 방식은 아직 아무도 안 고쳤다는 게 저는 더 놀랍습니다.
- 공유 링크 만들기
- X
- 이메일
- 기타 앱
댓글
댓글 쓰기