DHH는 날짜를 짚었고 저는 AI에 손코딩을 넘긴 날을 모릅니다

이미지
DHH가 올해 Rails World에서 한 발표를 요약한 영상을 몇 편 봤습니다. 원본 발표를 처음부터 끝까지 본 건 아니고, 한국어로 정리해 준 유튜브 영상 네 편을 이어서 봤습니다. 발표를 남이 정리해 준 걸로 보고 대충 알았다고 넘어가는 것도, 생각해 보면 요즘 제가 코드를 대하는 방식이랑 비슷합니다. 원본을 다 읽지 않고 정리된 결과를 보고, 이상한 데가 있으면 그때 찾아봅니다. 내용이 많았는데 제일 오래 남은 건 날짜 하나였습니다. 2025년 11월 24일. 영상에 따르면 DHH는 이날을 "우리 시대의 코닥 브라우니"라고 불렀다고 합니다. Claude Opus 4.5가 나온 날입니다. 1900년에 1달러짜리 카메라가 나오면서 초상화를 그리던 화가들이 일감을 잃고 방향을 틀었던 것처럼, 그날부터 프로그래머의 일이 바뀌었다는 얘기였습니다. 그리고 기술은 비탈길처럼 매끄럽게 오르는 게 아니라 한참 평평하다가 어느 날 한 칸 뛰는 계단처럼 온다고 했습니다. 영상을 보면서 저도 모르게 제 날짜를 찾고 있었습니다. 저는 언제였지. 생각이 안 났습니다. 마지막으로 직접 친 코드 어림잡을 수 있는 건 있습니다. 2025년 9월쯤부터는 제가 코드를 직접 쓴 기억이 없습니다. DHH가 짚은 날보다 두 달쯤 앞입니다. 이걸 날짜라고 하기는 좀 어렵습니다. 9월 몇 일에 무슨 일이 있어서 그날부터 안 쓴 게 아니라, 거꾸로 짚어 올라가다 보니 그쯤부터는 기억이 비어 있다는 정도입니다. 어느 날 키보드에서 손을 뗀 게 아니라 손으로 친 마지막 줄이 언제였는지 생각해 보니 안 떠오르는 겁니다. 두 달 앞이라고 해서 제가 남들보다 빨랐다는 뜻도 아닙니다. 그때 무슨 모델을 쓰고 있었는지도 정확히 기억이 안 납니다. DHH는 특정 모델이 나온 날을 짚었는데 저는 어떤 모델 때문에 넘어왔는지를 말할 수가 없습니다. 모델이 바뀐 날은 발표가 있으니 찾아보면 나오겠지만, 제가 바뀐 날은 아무 데도 적혀 있지 않습니다. 커밋 기록을 뒤져 보면 뭔가 나올...

키오스크가 줄인 고용, 늘린 근로시간

밝은 매장 안 무인 주문 키오스크 앞에서 한 사람이 화면을 향해 멈춰 서 있는 뒷모습

어제 마트 계산 줄에 서서 앞사람 손을 보고 있었습니다. 예순쯤 되어 보이는 분이었는데 폰을 단말기에 툭 대고 삼성페이로 결제하는 데 3초도 안 걸렸습니다. 거기서부터 머릿속으로 세대 이야기를 만들기 시작했습니다. 이분들은 인터넷이 막 깔리던 때를 지나온 세대라서 디지털로 넘어오는 게 비교적 수월했던 거라고, 60대와 70대가 리니지 오토를 돌리는 것도 같은 얘기라고. 꽤 그럴듯하게 맞춰졌습니다. 그리고 그날 저녁 통신사 ARS에서 상담원을 못 찾아 같은 메뉴를 세 바퀴 돌았고, 그 가설은 필요가 없어졌습니다.

세대로 설명하려던 문제가 세대와 상관없는 데서 저를 붙잡은 겁니다. 제가 헤맨 건 몰라서가 아니었습니다. 그 시스템에는 제가 가려는 곳으로 가는 길이 아예 없었습니다.

몰라서 헤매는 것과 길이 없어서 헤매는 건 겉으로는 똑같이 보입니다. 둘 다 같은 메뉴를 몇 바퀴 돕니다. 그런데 몰라서 헤매는 건 배우면 끝나고, 길이 없어서 헤매는 건 아무리 배워도 안 끝납니다. 세대 얘기가 그럴듯하게 들렸던 건 아마 그게 전부 배우면 끝나는 쪽 얘기라서였던 것 같습니다. 배우면 끝나는 문제라고 해두면 고칠 책임이 쓰는 사람한테 갑니다. 길이 없는 문제라고 하면 그 책임이 만든 쪽으로 갑니다. 저는 마트에서 그걸 거꾸로 맞추고 있었던 셈입니다.

세대 얘기는 빼기로 했습니다

따지고 보면 세대 구분부터 엉성했습니다. 마트에서 본 예순 남짓한 분은 X세대 끝자락이라기보다 베이비붐 세대에 가깝고, 리니지 오토를 돌리는 60대와 70대도 대부분 그렇습니다. 그런데 이걸 바로잡아도 설명이 안 되는 게 남습니다. 젊은 사람도 키오스크에서 막힙니다. 저는 하루의 절반을 터미널에서 보내는 사람인데, 처음 보는 무인 주문기 앞에서 뒷사람 눈치를 본 적이 여러 번 있습니다. 화면 어디를 눌러야 다음으로 가는지 몰라서요. 세대가 진짜 원인이라면 이런 일은 안 생겨야 합니다.

그래서 시니어 얘기는 원인에서 뺐습니다. 시니어는 이 시스템의 결함이 제일 먼저, 제일 크게 드러나는 쪽일 뿐입니다. 증상이 제일 선명한 곳이 원인인 건 아닌 것 같습니다.

번호가 매번 바뀌는 ARS

유튜브에 돌아다니는 ARS 풍자 영상의 대본을 하나 읽었습니다. 가상의 에어컨 회사 고객센터에 전화해서 상담원을 찾아가는 코미디인데, 웃다가 중간에 등이 서늘해졌습니다. 과장은 됐는데 과장하는 방향이 정확했습니다.

제일 먼저 걸린 건 메뉴 번호가 다시 걸 때마다 바뀐다는 거였습니다. 냉방이 안 될 때 누르는 번호가 처음엔 5번이었다가 다음 통화에서는 4번이 됩니다. 상담원 연결은 세 번 걸었더니 세 번 다 번호가 달랐습니다. 이건 불친절보다 훨씬 나쁜 것 같습니다. 사용자가 길을 외우는 걸 아예 못 하게 막습니다. 두 번째 통화는 첫 번째보다 빨라야 정상인데, 주소가 매번 바뀌면 모든 통화가 첫 통화입니다.

상담원 연결이 고객 만족도 조사와 같은 메뉴에 묶여 있는 장면도 있었습니다. 대본 속 화자가 여기서 폭발하는데 저도 거기서 웃음이 멈췄습니다. 사람한테 가는 길을 아무도 일부러 안 누르는 항목 뒤에 붙여둔 겁니다. 우연히 그렇게 배치됐을 것 같지는 않습니다.

기다리고 있으면 "보다 빠른 상담을 위해 챗봇 상담으로 전환하겠습니다"가 나옵니다. 사람을 기다리겠다고 분명히 고른 사람을 봇으로 돌려보냅니다. 그리고 그 챗봇은 ARS가 이미 한 말을 다시 합니다. 전원을 껐다 켜보라고.

마지막이 압권입니다. 전화번호를 넣고, 이름을 확인하고, 그렇게 겨우 사람한테 연결됐는데 상담원이 주민번호 앞자리를 또 묻습니다. 앞자리는 시스템에 입력이 안 된다면서요. 그리고 그 확인을 하다가 전화가 끊깁니다. 중간중간 앞에 127명이 있고 160분 걸린다던 대기 안내가 잠시 뒤에 52명, 62분으로 바뀌는 장면도 있는데, 화자가 "이거 사기잖아"라고 합니다. 틀린 추정치는 정보를 주는 게 아니라 남아 있던 믿음을 깎아 먹습니다. 아무 숫자도 안 주는 것보다 나쁩니다.

제가 겪은 건 이렇게 화려하지 않았습니다. 그냥 상담원 연결이 메뉴 어디에도 없었습니다. 그래도 결과는 같습니다. 저는 시스템이 처리 못 하는 요청을 들고 있었고, 그 요청을 어디로 보낼지를 시스템이 정해두지 않았습니다.

자동화가 잘됐는지는 처리하는 걸 보고 아는 게 아니라, 처리 못 하는 걸 어디로 보내는지를 보고 아는 것 같습니다.

만약 그 ARS 첫 안내에 「상담원 연결은 언제든 0번」 같은 한마디만 있었다면 제 저녁은 꽤 달랐을 겁니다. 메뉴가 아무리 복잡해도 빠져나가는 번호 하나가 고정돼 있으면 사람은 덜 불안합니다. 길을 잃어도 돌아갈 데가 있다는 걸 아니까요. 그 한마디를 넣는 데 드는 비용은 아마 거의 없을 겁니다. 그런데도 안 넣었다면 그건 깜빡한 게 아니라 일부러 안 넣은 것에 가깝지 않을까 하는 생각이 듭니다. 안 넣은 데도 누군가의 이유는 있었을 텐데, 전화를 거는 쪽에서는 그 이유를 알 방법이 없습니다. 이유를 모른 채 막혀 있는 게 메뉴가 복잡한 것보다 더 답답했던 것 같습니다. 복잡한 건 참으면 되는데 이유를 모르면 언제까지 참아야 하는지도 모르니까요.

깔면서 준비한 것과 안 한 것

국내 키오스크는 몇 년 사이에 정말 빠르게 늘었습니다. 2021년에서 2023년 사이 2년 만에 2.5배가 됐고, 지금은 70만 대쯤 된다는 얘기도 나옵니다.

그동안 접근성은 거의 그대로였습니다. 한국지능정보사회진흥원 조사를 보면 휠체어에 앉아서 조작부에 손이 닿는 기기가 100대 중 4대였습니다. 음성 같은 대체 수단을 주는 기기, 화면을 안 보고도 조작할 수 있는 기기, 시간 제한을 늘릴 수 있는 기기는 다 열 대 중 한 대꼴이었습니다. 100대 중 96대는 휠체어를 탄 사람이 화면 위쪽에 손이 안 닿는다는 얘기입니다.

그런데 예산은 줄었습니다. 디지털 격차를 줄이는 사업 예산이 3년 내리 깎였고, 키오스크 화면 설계 자체를 다루는 사업은 4분의 1로 줄었습니다. 기기를 2년 만에 2.5배로 늘리는 동안, 그 기기를 쓸 수 있게 만드는 돈은 계속 줄인 겁니다.

고령층의 디지털 활용 수준은 일반 국민의 70% 남짓으로 나옵니다. 저소득층이나 장애인, 농어민보다도 낮습니다. 키오스크로 주문하거나 접수해본 고령층은 열 명 중 두 명이 안 됐습니다.

재밌는 건 고령층이 디지털을 못 쓰는 게 아니라는 겁니다. 카카오톡이나 유튜브는 잘 씁니다. 금융이나 쇼핑, 행정으로 가면 확 떨어집니다. 뭐가 다를까 생각해보면, 카카오톡은 틀려도 되돌릴 수 있고 뒷사람이 안 기다리고 실패해도 손해가 없습니다. 키오스크는 셋 다 반대입니다. 능력이 모자란 게 아니라 실패했을 때 치르는 값이 다른 것 같습니다. 저도 처음 보는 키오스크 앞에서 망설이는 이유를 생각해보면 모르는 게 무서운 게 아니라, 잘못 누르고 뒤에 줄 선 사람들 앞에서 처음부터 다시 해야 하는 게 싫은 쪽에 가깝습니다.

인건비는 어디로 갔을까요

한국고용정보원이 서울 음식점 2,000곳을 조사한 결과가 있습니다. 키오스크를 들인 가게에서 판매와 서빙 일자리가 11% 줄었습니다. 여기까지는 예상대로입니다.

그런데 남은 사람들이 일주일에 두 시간쯤 더 일하게 됐습니다.

보고서는 키오스크 한 대가 사람 한 명을 완전히 대신하지 못한다고 설명합니다. 쓰는 법을 알려줘야 하고, 사람한테 주문하고 싶은 손님이 남아 있으니까요. 그래서 떠난 동료의 일을 남은 사람이 떠안았습니다.

같은 조사에서 태블릿 주문은 달랐습니다. 일자리도 줄었고 일하는 시간도 같이 줄었습니다.

왜 다를까 생각해보면, 태블릿은 테이블 위에 있습니다. 손님이 앉은 채로 주문하니까 주문을 받으러 가는 일 자체가 없어집니다. 키오스크는 입구에 서 있고, 손님이 그 앞에서 막히면 직원이 가야 합니다. 태블릿은 일을 없앴고 키오스크는 일을 다른 데로 보냈습니다.

그러면 키오스크를 테이블 위로 올리면 되지 않느냐는 생각도 해봤습니다. 아마 가게마다 그게 안 되는 사정이 있을 겁니다. 테이블이 없는 가게도 있고, 들고 나가는 손님이 대부분인 가게도 있습니다. 그런 가게에서는 결국 입구에 세워둘 수밖에 없고, 입구에 서 있는 한 막힌 손님을 누가 받으러 가야 합니다. 기계가 어디 놓이느냐가 일이 없어지느냐를 정한다는 게 처음엔 좀 의외였는데, 생각해보면 일이라는 게 원래 사람이 몸을 어디로 옮기느냐에서 많이 생기는 것 같기도 합니다.

저는 자동화를 설계할 때 결국 이 차이가 거의 다라고 봅니다. 어떤 자동화는 일을 지우고, 어떤 자동화는 일을 하는 사람과 장소만 바꿉니다. 도입을 결정하는 사람은 대부분 이 둘을 구분하지 않습니다. 둘 다 "자동화"라는 같은 단어로 결재를 받습니다.

그리고 다른 데로 간 일은 장부에 안 찍힙니다. 인건비는 11% 줄었다고 나옵니다. 남은 사람이 일주일에 두 시간 더 일한 건 인건비 절감 보고서에 안 들어갑니다. 지표는 좋아졌는데 전체 일의 양은 그대로거나 늘었습니다.

저는 이 대목을 읽을 때 남은 직원 쪽이 먼저 떠올랐습니다. 그 사람은 키오스크를 들이자는 결정에 끼지 않았을 가능성이 높습니다. 어느 날 입구에 기계가 서 있고, 동료 한 명이 안 나오고, 손님이 기계 앞에서 막히면 자기가 가야 합니다. 왜 그렇게 됐는지 설명을 들었을지도 잘 모르겠습니다. 결정한 사람한테는 인건비가 줄어든 일이고 남은 사람한테는 일이 늘어난 일인데, 같은 일을 두고 둘이 이렇게 다르게 겪는다는 게 좀 씁쓸합니다. 만약 들이기 전에 그 사람한테 「기계 앞에서 막히는 손님은 누가 받을까」 하고 한 번만 물어봤다면 답은 바로 나왔을 것 같습니다. 그 사람이 제일 잘 아는 문제니까요. 결정하는 쪽에서 제일 멀리 있는 사람이 그 결정의 뒷일을 제일 먼저 받는다는 게 이 대목에서 계속 마음에 남습니다. 키오스크만 그런 것도 아닐 것 같습니다.

서울시 디지털 안내사

다른 데로 간 비용이 어디까지 가는지 보여주는 사례가 하나 있습니다.

서울시가 2022년 하반기부터 디지털 안내사를 운영합니다. 주황색 조끼를 입고 둘씩 짝을 지어 지하철역이나 대형마트, 공원 같은 데를 돌면서 키오스크 쓰는 법, 앱 설치, 기차표 예매, 택시 호출을 도와주는 분들입니다. 3년 동안 815명이 위촉됐고 70만 명 가까이를 도왔다고 합니다. 도움받은 사람 대부분이 60대 이상이었고, 만족도는 98%였습니다.

사람이 옆에서 대신 눌러주면 만족합니다. 당연한 것 같습니다.

이 사업은 좋은 일입니다. 제가 계속 보게 되는 건 돈이 흘러간 길입니다. 가게와 기업이 인건비를 줄이려고 키오스크를 깔았습니다. 그 키오스크를 못 쓰는 사람이 생겼습니다. 그 사람들을 도울 사람을 지자체가 세금으로 뽑았습니다.

인건비는 없어지지 않았고, 민간 장부에서 공공 장부로 넘어갔습니다. 장부가 다르니까 각자 자기 숫자만 보면 다 합리적입니다. 가게는 인건비를 줄였고, 시는 디지털 포용 정책을 집행했습니다. 둘을 겹쳐서 보는 사람이 없습니다.

가게 입장에서는 안내사 비용을 낸 적이 없으니 키오스크가 정말 싸게 먹힌 걸로 보일 겁니다. 그 계산이 틀린 건 아닌데, 그 싼 값의 일부를 시민 전체가 세금으로 나눠 내고 있다는 건 가게 장부에도 시 장부에도 안 보입니다. 키오스크가 더 늘어나면 안내사도 더 필요해질 텐데, 그때 이 둘을 한 표에 같이 올려놓고 얘기하는 사람이 있을지는 잘 모르겠습니다.

어느 나라에는 키오스크를 대신 눌러주는 직업이 있다는 얘기를 들었을 때 저는 해외 얘기인 줄 알았습니다. 찾아보니 한국이었습니다.

사내 AI 도입에서도 이런 일이 똑같이 생깁니다. 전에 AX라는 말이 회사 단위로 팔리는데 실제 격차는 옆자리 사이에서 벌어진다는 글을 썼는데 모양이 같습니다. 비용을 재는 장부와 효과를 재는 장부가 서로 다른 층에 있으면, 아무도 거짓말을 안 하는데 전체가 틀린 결론에 닿습니다.

자동화율 80%가 절감 80%는 아닙니다

어떤 창구에 들어오는 요청을 모아보면 위쪽 몇 가지가 거의 다를 차지합니다. 카페라면 아이스 아메리카노 한 잔이 압도적이고, 통신사 콜센터라면 요금 조회와 납부가 그렇습니다. 그래서 자동화로 덮는 비율은 놀랄 만큼 빨리 올라갑니다. 시나리오 스무 개 남짓만 만들어도 요청 수로는 8할쯤 덮일 겁니다.

문제는 남는 2할입니다. 이건 그냥 수가 적은 요청이 아니라 대체로 훨씬 어려운 요청입니다. 자동화가 못 잡는 이유가 있어서 남은 거라 조건이 복잡하거나, 예외 규정에 걸리거나, 사용자가 자기가 뭘 원하는지 한 문장으로 말하지 못하는 경우가 많습니다. 그리고 이 사람들은 자동화를 먼저 해보다가 안 돼서 온 사람들입니다. 이미 화가 나 있고, 이미 시간을 썼고, 이미 같은 설명을 두 번 들었습니다. 받는 쪽은 앞에서 자동화가 어디까지 했는지부터 알아내야 하니까, 원래 없던 일이 하나 더 생깁니다.

이 마지막 게 특히 비쌉니다. ARS 대본에서 상담원이 주민번호를 다시 묻는 장면이 딱 이겁니다. 자동화 단계에서 사람 단계로 넘어갈 때 지금까지의 상황이 같이 안 넘어오면 사람은 처음부터 다시 받습니다. 자동화를 안 했을 때보다 더 오래 걸립니다.

그래서 실제로 얼마나 아꼈는지를 보려면 자동화된 요청에서 아낀 돈에서 남은 어려운 요청이 더 비싸진 만큼을 빼고, 시스템 만들고 유지하는 돈을 빼고, 쓰는 법을 알려주는 사람 값을 빼고, 떠난 손님 매출까지 빼야 합니다. 그런데 도입 결정 문서에서 남은 요청이 더 비싸진다는 줄을 본 기억이 거의 없습니다. 대부분 첫 줄만 계산합니다. 남는 요청은 처리비가 그대로라고 은근히 가정합니다. 그 가정이 얼마나 틀렸는지가 고용정보원 조사에서 일주일 두 시간으로 나온 것 같습니다.

거꾸로 된 숫자도 하나 있습니다. 농림축산식품부 조사에서 실제로 키오스크를 쓰는 외식업체는 열 곳 중 한 곳 조금 넘었고, 프랜차이즈가 아닌 일반음식점은 그보다 더 적었습니다. 체감상 온 세상이 키오스크인데 숫자는 이렇습니다.

저는 이걸 작은 가게가 뒤처져서라고 읽지 않습니다. 남는 요청을 떠안을 사람이 없는 가게는 못 쓰는 겁니다. 사장 혼자 하는 집에서 키오스크 앞에 손님이 막히면 주방을 비워야 합니다. 프랜차이즈는 직원이 두세 명 있으니 그걸 흡수할 수 있습니다. 남는 걸 받아줄 사람이 있는 곳만 자동화할 수 있다는 건, 자동화하려면 먼저 사람이 있어야 한다는 얘기입니다. 순서가 거꾸로 알려져 있는 것 같습니다.

그래서 무엇을 어디에 태울지 찾는 일이 도입보다 먼저 와야 하는 것 같습니다. 알고리즘 진화 같은 기법을 두고도 내 업무에 들일 데를 먼저 찾아본 적이 있는데, 태울 게 분명할 때는 실제로 줄어듭니다. 브라우저 탭 일곱 개를 하나로 줄였던 경우가 그랬습니다. 그때 잘된 건 남는 걸 제가 직접 받았기 때문입니다. 자동화가 못 하는 건 제가 했고, 그 비용을 다른 사람 장부로 넘기지 않았습니다.

제가 만든 키오스크

여기까지 쓰면서 계속 마음이 불편했습니다. 남 얘기가 아니라서요.

제가 쓰는 자동화에 품질 게이트를 하나 걸어둔 적이 있습니다. 발행 스크립트가 파일을 올리기 전에 문체 검사 결과 파일을 열어서 판정: 합격이라는 문자열을 찾고, 없으면 업로드를 막는 방식이었습니다. 문체 검사를 통과 못 한 글이 나가는 걸 막겠다는 생각이었습니다.

그 문자열을 누가 썼느냐가 문제였습니다. 검사받는 에이전트가 직접 썼습니다. 글을 쓴 모델이 자기 글을 검사하고, 결과 파일에 판정: 합격이라고 적고, 발행 스크립트는 그 문자열을 보고 통과시켰습니다. 검문소와 통행증 발급처가 같은 건물에 있었습니다.

통과율은 100%였습니다. 저는 두 달 반 동안 그걸 게이트가 잘 돌아가는 증거로 읽었습니다.

지금 생각하면 100%라는 숫자 자체가 이상하다고 느꼈어야 했습니다. 사람이 쓴 글도 열에 몇 편은 고쳐야 할 데가 나오는데 모델이 쓴 글이 두 달 반 동안 한 번도 안 걸렸다는 건 좀 말이 안 됩니다. 그런데 그때는 그게 안 이상했습니다. 초록불이 계속 켜져 있으면 그게 원래 상태처럼 느껴집니다. 의심은 빨간불이 켜질 때 생기는 거라, 빨간불이 한 번도 안 켜지는 게이트는 의심받을 기회 자체가 없었던 것 같습니다.

딸린 버그도 있었습니다. 같이 있던 다른 게이트는 파일 전체에서 FAIL이라는 단어를 찾아서 하나라도 있으면 막았습니다. 그래서 검수 문서에 "FAIL 조건 없음"이라고 적으면 발행이 막혔습니다. 문제없다고 분명히 쓸수록 막힐 확률이 올라갔습니다.

나쁜 글은 통과했습니다. 합격이라고 쓰면 됐으니까요. 좋은 글은 막혔습니다. 결과 파일을 안 만들었거나 "FAIL"이 한 번 스쳤으면 걸렸습니다. 게이트가 본 건 글이 아니라 서류가 있느냐였습니다. 7월 말에 걷어냈습니다.

이게 키오스크랑 같은 모양이라는 걸 쓰다가 알았습니다. 지표는 좋아졌는데 문제는 그대로였습니다. 키오스크는 인건비 항목을 줄이고 대기 시간과 떠나는 손님을 남겼고, 제 게이트는 통과율 100%를 만들고 문체 문제를 그대로 남겼습니다. 둘 다 재야 할 걸 재기 쉬운 다른 걸로 바꿔치기했습니다.

이렇게 넘어진 게 처음도 아니었습니다. 시크릿 스캔을 걸어뒀는데 AWS 키가 그냥 통과한 일도 있었고, 커밋 훅이 정작 커밋되는 파일을 안 보고 있던 일도 있었습니다. 셋 다 비슷합니다. 검사는 돌고 있었고 초록불도 켜져 있었는데, 검사하는 대상이 실제 위험과 달랐습니다.

그래서 지금은 기준을 하나 두고 씁니다. 코드로 강제할 수 있는 건 모델이나 사람이 뭐라고 하든 상관없이 성립하는 사실뿐이라는 겁니다. 파일에 AWS 키 패턴이 들어 있느냐는 여기 해당합니다. 모델이 뭐라고 해도 답이 안 바뀝니다. 이 글에서 AI 냄새가 나느냐는 해당하지 않습니다. 그건 판단이고, 판단을 게이트로 만들면 판단하는 쪽이 통행증을 발급하게 됩니다.

키오스크에 태워도 되는 일을 고르는 기준도 비슷할 것 같습니다. 들어올 수 있는 입력을 미리 다 적어둘 수 있는지, 사용자가 한 단계 뒤로 돌아갈 수 있는지, 실패했을 때 그게 기록에 남는지. 하나라도 아니면 사람한테 가는 길을 같이 만들어야 합니다.

AI 에이전트를 붙일 때도 이제는 이 순서로 봅니다. 무엇을 자동으로 처리할지보다 넘기는 조건을 먼저 적습니다. 모델이 확신하지 못할 때, 요청이 정해둔 범위를 벗어날 때, 되돌릴 수 없는 동작을 하려고 할 때 어디로 넘길지를 코드에 넣어둡니다. 넘길 데가 없는 에이전트는 화면이 예쁜 키오스크하고 다를 게 없습니다. 넘기는 조건을 먼저 적다 보면 자동으로 맡길 수 있는 범위가 생각보다 좁다는 걸 알게 되는데, 저는 그게 오히려 맞는 출발점 같습니다. 좁게 시작해서 넓히는 게, 넓게 시작했다가 남는 걸 아무 데나 흘리는 것보다 나아 보입니다.

그리고 넘기는 걸 지표에서 벌점처럼 치면 안 될 것 같습니다. 자동화율을 목표로 잡는 순간, 사람한테 넘기는 걸 줄이는 게 담당자한테 이득이 됩니다. 그때부터 시스템은 사용자를 돕는 쪽이 아니라 숫자를 지키는 쪽으로 자랍니다. ARS 상담원 연결 번호가 매번 바뀌는 이유도 저는 여기서 찾게 됩니다. 누가 나쁜 마음으로 그렇게 만든 게 아니라, 그렇게 만든 사람이 칭찬받는 지표가 걸려 있었을 겁니다.

AI로 바꾸면 실패하는 방식이 달라집니다

지금까지 얘기한 건 대부분 정해진 대로만 도는 시스템입니다. 메뉴 트리와 상태 기계. 그럼 이걸 LLM으로 바꾸면 나아질까요.

나아진다기보다 실패하는 방식이 달라지는 것 같습니다. 그리고 새로 생기는 실패가 더 비쌉니다.

정해진 대로 도는 시스템은 못 하는 걸 못 한다고 정직하게 보여줍니다. 메뉴에 없으면 없는 겁니다. 짜증은 나도 사용자는 자기가 막혔다는 걸 압니다. LLM은 못 하는 걸 했다고 자신 있게 말합니다. 사용자는 틀린 답을 받았다는 걸 모르고 돌아갑니다.

에어캐나다 사례가 이걸 법정에서 보여줬습니다. 조모상을 당한 승객이 웹사이트 챗봇에 물었더니, 돌아가신 뒤 90일 안에 신청하면 유가족 할인을 나중에라도 받을 수 있다고 답했습니다. 실제 규정은 타기 전에 신청하는 거였습니다. 캐나다 심판소는 항공사가 배상해야 한다고 봤습니다.

금액은 얼마 안 됐는데 판단이 컸습니다. 에어캐나다는 챗봇이 따로 책임지는 별개의 존재라는 식으로 항변했고, 받아들여지지 않았습니다. 웹사이트에 있는 정보는 그냥 페이지든 챗봇이 만든 문장이든 회사 책임이라는 겁니다. 확률로 문장을 만드는 시스템의 말에 계약 책임이 붙습니다.

민원 쪽이 특히 위험한 게 이래서인 것 같습니다. 틀렸을 때 치르는 값이 한쪽으로 쏠려 있습니다. 쇼핑몰 챗봇이 틀리면 환불하면 됩니다. 행정이나 법률 안내가 틀리면 사람이 기한을 놓칩니다.

알래스카 법원은 상속 절차를 안내하는 챗봇을 만들다가 3개월짜리 일을 1년 넘게 붙잡고 있었습니다. 이유는 환각이었습니다. 있지도 않은 알래스카 로스쿨에 도움을 구하라고 안내한 적도 있다고 합니다. 그래서 답의 근거를 법원 공식 문서로만 묶고 웹 검색을 뺐습니다. 처음 버전은 너무 공감을 많이 해서 상을 당한 사람들이 오히려 짜증을 냈고, 불필요한 조의 표현을 지웠다고 합니다. 담당자는 이런 일은 100% 정확해야 하는데 이 기술로는 그게 정말 어렵다고 했습니다.

저는 이걸 실패로 안 읽었습니다. 3개월짜리를 1년 넘게 붙잡고 정확도 요구를 안 낮춘 게 오히려 드문 일 같습니다. 대부분은 반대로 합니다. 일정을 지키고 정확도를 낮춥니다. 그러면 쓰는 사람한테는 AI 흉내만 내는 자동응답이 됩니다. 모델 성능이 모자란 것보다, 모자란 걸 알면서 배포하기로 한 결정이 더 문제인 것 같습니다.

다른 직함으로 다시 뽑습니다

시장은 벌써 되돌리고 있는 것 같습니다.

클라르나가 2024년 초에 낸 숫자는 화려했습니다. AI 어시스턴트가 상담원 700명 몫의 일을 하고, 해결 시간을 11분에서 2분 안쪽으로 줄였다고 했습니다. 저도 그때 읽고 인상적이라고 생각했습니다. 그리고 1년쯤 지나 CEO가 비용 절감을 너무 밀어붙였다고 인정했습니다. 서비스 품질이 떨어졌고, 복잡한 건과 프리미엄 응대에 사람을 다시 뽑기 시작했습니다. AI는 대량으로 들어오는 1차 응대에 남겼습니다.

11분에서 2분으로 줄어든 시간이 어디로 갔는지 이제는 좀 짐작이 갑니다. 남는 요청 쪽으로 갔을 겁니다. 2분 안에 끝난 건 원래 쉬운 요청이었고, 어려운 요청은 처리된 게 아니라 대기열 밖으로 밀려났던 것 같습니다.

그 밀려난 요청을 가진 사람들은 아마 다시 연락했을 겁니다. 한 번에 안 풀렸으니 두 번, 세 번 연락하고, 그때마다 2분짜리 대화가 하나씩 더 쌓였을 겁니다. 만약 그랬다면 평균 해결 시간은 짧게 나오고 연락 횟수는 늘어나는 모양이 됐을 텐데, 발표 숫자에는 짧아진 쪽만 들어갔습니다. 제가 ARS를 세 바퀴 돈 것도 그쪽 장부에서는 아마 짧은 통화 세 건으로 남았을 것 같습니다.

가트너는 올해 초에 AI 때문에 사람을 줄였다는 회사의 절반이 2027년까지 비슷한 일을 할 사람을 다른 직함으로 다시 뽑을 거라고 봤습니다. 같은 조사에서 실제로 AI 때문에 상담 인력을 줄인 곳은 다섯 곳 중 한 곳 정도였고요.

"다른 직함으로"라는 말이 이 예측의 진짜 내용 같습니다. 사람이 돌아오는데 장부에 적히는 이름이 바뀝니다. 상담원이 아니라 고객경험 스페셜리스트가 되고, 인건비가 아니라 AI 운영 비용으로 잡힙니다. 서울시 디지털 안내사하고 같은 모양입니다. 일은 그대로 있고 항목 이름만 바뀝니다.

가트너 쪽은 AI가 사람 상담원의 전문성과 공감, 판단을 대신할 만큼 아직 성숙하지 않았다고 했습니다. 저는 그것만으로는 설명이 덜 된다고 봅니다. 성숙도만의 문제였다면 모델이 좋아지면 저절로 풀릴 겁니다. 그런데 ARS 번호가 매번 바뀌는 건 모델 성숙도와 아무 상관이 없습니다. 휠체어에서 손이 안 닿는 96대도, 3년 내리 깎인 예산도 그렇습니다. 모델이 아무리 좋아져도 그 숫자들은 안 바뀝니다.

파일럿이 실패하는 이유도 대개 모델이 아니었던 것 같습니다. AX 도입 파일럿의 95%가 구두로 끝난 회의에서 무너진다고 전에 썼는데, 여기도 비슷합니다. 기술이 모자라서 실패하는 경우보다 무엇을 자동화하지 않을지를 안 정하고 시작해서 실패하는 경우가 훨씬 많아 보입니다.

그날 저녁 ARS를 붙잡고 있으면서 든 건 화보다 익숙함이었습니다. 저도 이걸 만들어본 사람이라서요. 제 발행 스크립트의 게이트는 두 달 반 동안 아무것도 확인하지 않으면서 초록불을 켜고 있었고, 저는 그 초록불을 보고 안심했습니다. 처리하지 못하는 걸 어디로 보낼지 정하지 않으면 그게 없어지지 않고 아무 데나 고이는 것 같습니다. 남은 직원의 일주일 두 시간이 되기도 하고, 세금으로 뽑은 안내사 815명이 되기도 하고, 160분짜리 대기열이 되기도 하고, 통과율 100%짜리 게이트가 되기도 합니다.

댓글

이 블로그의 인기 게시물

봉제인형 사진 한 장, ChatGPT와 Gemini의 다른 대답

구글은 서울에서 모델이 아니라 에이전트를 판다

AI 부업으로 3개월에 2달러 벌고 50달러를 썼다는 증언을 봤습니다. 그 위에 광고가 네 겹입니다