우버는 AI 개발 비용을 어떻게 최적화했을까?
사용자는 7배, 요청은 9.4배 증가했습니다. 우버는 AI 운영 과정의 낭비를 줄여 비용 증가를 관리했습니다.
우버 엔지니어링 블로그가 공개한 방법을 정리했습니다.
01. 숫자로 보는 성과
| 지표 | 변화 |
|---|---|
| 주간 활성 사용자 | 7배 증가 |
| 주간 에이전트 요청 | 9.4배 증가 |
| 전체 AI 지출 | 4월 이후 비교적 안정화 |
사용량은 2026년 2~8월 기준입니다. 동일 모델을 유지한 별도 분석에서는 요청 1,000건당 비용이 최고점 대비 약 34%, 세션당 비용이 6월 최고점 대비 52% 감소했습니다.
02. 비용을 나누면 개선점이 보인다
우버는 총비용을 여섯 요소로 분해합니다.
총비용
= 사용자 수
× 사용자당 세션 수
× 세션당 턴 수
× 턴당 요청 수
× 요청당 토큰 수
× 토큰 단가
사용 확대를 장려하면서 불필요한 탐색, 반복 요청, 과도한 입력을 줄이는 데 집중했습니다.
03. 비용을 낮춘 다섯 가지 방법
① 실제 업무로 모델을 선택한다
정확도·완료 비용·신뢰성을 비교합니다. 주 모델은 작업 분해와 평가를 맡고, 명확한 하위 작업에는 경제적인 모델을 배정합니다.
② 기본 설정을 최적화한다
40만 토큰에서 문맥을 압축하고, 추론 강도를 Medium으로 설정합니다. 대화형 세션에는 작업 간격을 고려한 캐시 유지시간을 적용합니다.
③ 필요한 도구만 불러온다
도구를 검색하거나 명령줄로 호출해, 사용하지 않는 도구 설명이 반복 입력되는 부담을 줄입니다.
④ 반복 절차를 코드로 묶는다
상태 확인과 결과 수집을 스크립트로 실행합니다. 소규모 SQL 조회 실험에서도 토큰 사용량이 절반 이상 줄었습니다.
⑤ 탐색에 필요한 맥락을 제공한다
사내 정보의 관계를 연결한 ‘컨텍스트 그래프’를 활용합니다. 한 사례에서는 20분간 탐색하고 오답을 내던 작업을 38초 만에 정확히 처리했습니다.
04. 우리 조직에 적용할 질문
- 업무 하나를 완료하는 데 얼마가 드는가?
- 에이전트가 같은 정보를 반복해서 찾는가?
- 단순 작업에도 고비용 모델을 사용하는가?
- 비용 절감 후에도 품질이 유지되는가?
핵심 시사점은 업무 완료 비용과 품질을 함께 측정하는 것입니다.
수치는 우버 내부 측정 결과입니다. 원문: Running a Software Factory Efficiently at Uber Scale
여기서부터는 회원만 볼 수 있어요. 로그인하면 이어서 볼 수 있습니다.