AidenAI
오픈채팅
← 가이드 목록

아스트라는 AGI일까? — 점수를 읽는 법, 모델을 고르는 법

▶ 원본 영상 보러가기
목차

GPT-6 Astra를 두고 “AGI가 도래했다”는 말이 나왔습니다. 정말 그럴까요? AGI가 무엇을 뜻하는지, ARC-AGI-3의 99.9%를 어떻게 읽어야 하는지, 그리고 우리가 ’좋은 모델’을 판단할 때 무엇을 봐야 하는지를 정리한 가이드입니다.

📺 영상 채널: Aiden의 친절한 AI (https://www.youtube.com/@Aiden_channel)


이 가이드로 아는 것

  1. AGI의 ‘G(General)’ 가 실제로 무엇을 요구하는지
  2. ARC-AGI-3가 무엇을 어떻게 평가하는 벤치마크인지
  3. 아스트라의 99.9%에 붙은 조건과, 벤치마크 점수를 비교할 때의 주의점
  4. AGI 판단에 필요한 또 하나의 축 — 새로운 지식을 만들어내는 능력
  5. 사용자 입장에서 모델을 고를 때 볼 실무 능력 3가지 + 시간·비용

왜 지금 이 이야기인가

유튜브와 SNS에는 아스트라로 만들었다는 게임, 영상, 웹사이트, 3D 모델링 작업물이 쏟아지고 있습니다. 그런데 이번에는 결과물만 화제가 된 게 아닙니다.

  • 젠슨 황(엔비디아) — 아스트라 발표를 축하하는 글에서 “AGI가 도래했다”
  • 그렉 브록먼(OpenAI 공동창업자) — 새 모델 공개 자리에서 “AGI 시대에 오신 것을 환영합니다”, 그리고 나중에 AGI가 언제 등장했는지 돌아본다면 바로 지금과 이 모델을 가리키게 될 것이라는 취지의 발언

그렇다면 이제 정말 AGI가 나온 걸까요? AGI(인공일반지능) 는 많이 들어본 말이지만, 어떤 기준을 충족해야 AGI라고 부를 수 있는지는 아직 의견이 갈립니다. 멋진 결과물을 만들어내면 AGI일까요? 특정 벤치마크에서 만점을 받으면 되는 걸까요?


① AGI란 무엇인가 — 핵심은 ‘G’

우리는 보통 AI가 어려운 일을 해내면 ’똑똑하다’고 말합니다. 그런데 —

💡 계산기는 우리보다 훨씬 빠르고 정확하게 계산합니다. 그렇다고 계산기를 사람보다 똑똑하다고 생각하지는 않죠. 계산을 잘한다는 것과, 다양한 문제를 이해하고 해결한다는 것은 다른 이야기니까요.

그럼 글도 쓰고 코딩도 하고 수학 문제도 푸는 AI는 어떨까요? 할 수 있는 일이 많아지는 것만으로 AGI라고 부를 수 있을까요? 여기서 중요한 단어가 AGI의 G, ‘General’ 입니다 — 특정 분야에 한정되지 않고 여러 상황에 폭넓게 적용할 수 있는 지능.

⭐ 새로운 업무를 맡았다고 생각해보세요. 처음 보는 프로그램을 익히고, 이전에 배운 지식을 활용하고, 일이 예상과 다르게 흘러가면 방법을 바꿔야 합니다. AI도 이렇게 낯선 상황에 적응하면서 다양한 일을 해결할 수 있느냐 — 이게 AGI를 이야기할 때의 중요한 질문입니다.

다만 어디까지 해내야 AGI인지는 의견이 갈립니다. 판단이 달라지는 지점은 세 가지:

쟁점 질문
비교 대상 어느 수준의 사람과 비교할 것인가
범위 얼마나 다양한 일을 해야 하는가
자율성 사람의 도움 없이 어디까지 수행해야 하는가

ℹ️ 여기서 말하는 AGI가 영화처럼 자아나 감정을 가진 AI를 뜻하는 것은 아닙니다. 지금 살펴보는 것은 AI가 어떤 일을 배울 수 있고, 배운 것을 활용해 얼마나 다양한 문제를 해결할 수 있느냐입니다.


② ARC-AGI-3 — 낯선 환경에서 스스로 규칙을 찾기

AGI적 능력을 확인하는 방법 중 하나는 AI에게 낯선 환경을 주고 직접 문제를 해결하게 하는 것입니다. 여기서 등장하는 것이 ARC-AGI-3 — 게임 형태의 환경에서 AI의 문제 해결 능력을 평가하는 벤치마크입니다.

AI가 이 환경에서 거치는 과정:

  1. 규칙이 설명되지 않는다 — 게임의 규칙이나 구체적인 목표를 미리 알려주지 않음
  2. 탐색 — 주어진 행동 중 하나를 선택하고, 환경이 어떻게 변하는지 관찰하며 각 행동의 효과와 성공 조건을 알아냄
  3. 계획과 수정 — 파악한 규칙으로 계획을 세워 실행하고, 예상과 다른 결과가 나오면 접근 방식을 수정
  4. 전이 — 더 어려운 단계에서는 앞서 배운 내용을 활용해 문제를 해결

⭐ 즉 ARC-AGI-3는 AI가 낯선 환경을 탐색하고, 새로운 규칙을 배우고, 이를 문제 해결에 얼마나 효율적으로 적용하는지를 평가합니다.


③ 99.9%라는 점수, 어떻게 읽어야 하나 ⭐

아스트라는 이 평가에서 99.9% 를 기록했습니다. 다만 이 점수에는 특정 실행 환경을 사용했다는 조건이 붙습니다. 점수의 의미부터 하나씩 보겠습니다.

이 숫자는 정답률이 아니다

ARC-AGI-3는 얼마나 많은 단계를 해결했는지와 함께, 해결하기까지 몇 번의 행동이 필요했는지를 봅니다. 그리고 그 행동 횟수를 사람의 기준과 비교합니다.

💡 사람이 열 번의 행동으로 해결하는 단계를 AI가 스무 번 만에 해결했다면 — 성공은 했어도 효율에서 점수가 깎입니다. 무작정 많이 시도해서 결국 성공하는 것만으로는 높은 점수를 받기 어렵다는 뜻이죠.

ℹ️ 단, 여기서의 효율은 환경과 상호작용한 횟수(이동, 버튼 누르기 등) 기준입니다. AI가 그 사이 얼마나 오래 생각했는지, 얼마의 비용을 썼는지는 이 점수에 직접 반영되지 않습니다.

점수 옆에 붙은 조건 — 두 가지 실행 방식

공식 결과에는 아스트라의 점수가 두 가지 실행 방식으로 나뉘어 있습니다.

실행 방식 최고 점수 무엇이 다른가
표준 방식 62.7% AI가 중요한 내용을 메모로 남기고, 다음 행동을 할 때 그 메모를 참고
OpenAI 문맥 관리 기능 활용 99.9% 모델의 내부 추론 상태도 다음 행동을 결정할 때 이어서 활용. 작업이 길어지면 쌓인 문맥을 압축해 관리하는 기능도 사용

💡 사람에 비유하면 — 적어둔 메모를 바탕으로 다음 판단을 하는 것과, 생각하던 흐름까지 이어가며 작업하는 것의 차이에 가깝습니다.

⚠️ 다만 두 기록은 추론 설정도 서로 달라, 점수 차이를 전부 실행 방식 때문이라고 볼 수는 없습니다.

여기서 얻는 교훈 ⭐

⭐ 같은 모델도 어떤 기능과 설정을 사용하느냐에 따라 성능이 달라질 수 있습니다.

  • 다른 모델과 비교할 때 — 다른 모델도 비슷한 조건에서 평가받았는지 확인해야 합니다. 조건이 다르면, 점수가 더 높다는 이유만으로 모델 자체의 능력이 더 뛰어나다고 보기 어렵습니다.
  • 실제로 쓸 모델을 고를 때 — 반대로 이때는 내가 쓸 수 있는 기능을 모두 활용한 상태에서 일을 얼마나 잘해내는지가 중요합니다.

결국 점수만 보고 판단하기보다, 어떤 조건에서 나온 점수이고, 내가 사용할 환경에서도 기대할 수 있는 결과인지를 함께 봐야 합니다.

평가를 만든 쪽의 입장

이 평가를 만든 ARC Prize도 아스트라의 성과를 중요한 진전으로 인정하면서도, 이 평가에서 거의 만점을 받았다고 AGI가 증명되는 것은 아니라고 설명합니다. 게임의 규칙과 목표가 정해져 있는 환경만으로는, 현실의 복잡하고 열린 문제까지 모두 평가할 수 없기 때문입니다.

📌 정리하면 — 99.9%는 해당 실행 조건에서 아스트라가 낯선 게임의 규칙을 파악하고 효율적으로 문제를 해결하는 능력을 보여준 중요한 결과입니다. 하지만 우리가 AGI에 기대하는 모든 능력을 확인한 결과는 아닙니다.


④ 또 하나의 축 — 새로운 지식을 만들어내는 능력

낯선 게임을 잘 푸는 능력 외에, AGI라고 판단하려면 어떤 능력을 더 확인해야 할까요? 이와 관련해 흥미로운 대화가 하나 있습니다.

2025년 9월, 물리학자 데이비드 도이치(양자 컴퓨팅의 선구자)와 샘 알트먼의 대화 (아스트라 발표 이전):

  • 도이치는 과거에 AGI가 아니면 다양한 주제로 자유롭게 대화를 이어가는 것이 불가능할 거라고 생각했고, 챗GPT의 등장으로 그 예상이 틀렸음을 인정했습니다.
  • 그럼에도 당시의 챗GPT를 AGI로 보지는 않았습니다. 그가 중요하게 본 것은 새로운 지식을 만들어내는 능력 — 인간이 탐구하듯 문제를 발견하고, 해결할 아이디어를 제시한 뒤, 그것을 비판하고 검증하며 발전시키는 능력이었기 때문입니다.
  • 알트먼은 미래의 AI가 양자중력 문제를 실제로 해결하고, 왜 그 문제에 도전했으며 어떻게 해결했는지까지 설명한다면 설득이 되겠느냐고 물었고, 도이치는 그런 경우라면 설득될 것 같다고 답했습니다.

ℹ️ 이 대화에서 두 사람이 공식적인 AGI 판정 기준을 정한 것은 아닙니다. 두 사람이 이야기한 것은 — 사람이 낸 문제를 푸는 데서 더 나아가, 무엇을 탐구할지 스스로 정하고 인간이 아직 모르는 것을 밝혀낼 수 있느냐는 문제입니다.

그럼 AI가 새로운 지식을 발견하는 순간 AGI가 되는 걸까요?

그 발견은 중요한 증거가 될 수 있습니다. 다만 AGI의 범용성까지 판단하려면 그 능력이 얼마나 넓게 적용되는지도 확인해야 합니다. 특정 분야에서 한 번의 발견에 성공한 것과, 여러 분야에서 새로운 문제를 찾고 해결하는 능력을 보여주는 것은 의미가 다르기 때문입니다 — 앞서의 ‘범용성’ 문제가 다시 등장하는 거죠.

⭐ AGI를 판단하려면 하나의 놀라운 결과뿐 아니라, 그 능력이 어디까지 적용되고 어떤 상황에서 한계를 보이는지를 함께 살펴봐야 합니다.


⑤ 사용자의 질문 — “내 일을 얼마나 잘해줄까?”

AGI라고 부를지에 대한 판단과 별개로, 실제로 일을 맡겼을 때 얼마나 정확하고 안정적으로 끝내는지는 평가할 수 있습니다.

실제 업무에서는 결과물의 정확성뿐 아니라 과정이 중요합니다. 자료를 조사해 보고서를 만드는 작업이라면 — 정보를 찾고, 출처를 확인하고, 서로 다른 내용을 비교한 뒤 목적에 맞게 정리해야 하고, 중간에 자료가 부족하거나 내용이 충돌하면 그 문제도 처리해야 하죠. OpenAI가 아스트라에서 강조하는 것도 이런 능력입니다 — 코드와 브라우저, 업무용 프로그램을 활용하면서 여러 단계로 이루어진 작업을 수행하는 강점.

결과물만 보면 놓치는 것

💡 같은 보고서를 만들었더라도 — 한 모델은 사람이 오류를 짚어주고 자료를 다시 찾아줘야 완성할 수 있고, 다른 모델은 스스로 누락된 내용을 확인하고 수정해서 가져올 수 있습니다. 겉으로 보이는 결과는 비슷해도, 실제로 사람이 아낀 시간은 크게 다릅니다.

실무 능력을 보는 3가지 ⭐

기준 질문
완수 맡긴 일을 제대로 끝내는가
안정성 반복해서 맡겨도 안정적으로 수행하는가
개입 정도 그 과정에서 사람의 개입이 얼마나 필요한가

ℹ️ 단, 필요한 정보를 묻거나 중요한 결정에 승인을 구하는 것과, 실수를 수습하느라 사람의 손이 계속 필요한 것은 구분해야 합니다.

함께 따져야 할 것 — 시간과 비용

아무리 어려운 일을 해내도, 결과를 기다리고 수정하는 데 드는 부담이 너무 크면 실제로 쓰기 어렵습니다.

아스트라에서 눈여겨볼 변화 중 하나가 토큰 효율입니다. OpenAI는 여러 평가에서 아스트라가 이전 모델보다 적은 출력 토큰으로 더 좋은 결과를 냈고, 일부에서는 작업당 추정 API 비용도 낮아졌다고 설명합니다.

⚠️ 다만 토큰 효율과 비용 효율은 구분해야 합니다.

  • 사용한 토큰이 절반으로 줄어도 토큰 하나의 가격이 세 배가 되면 그 부분의 비용은 오히려 늘어납니다. 실제 총비용에는 입력 토큰과 도구 사용료 등도 영향을 줍니다.
  • 토큰 수만으로 작업 시간을 단정할 수도 없습니다. 모델이 처리하는 속도와 외부 도구를 기다리는 시간까지 봐야 하기 때문입니다.

결국 사용자에게 중요한 것은 — 원하는 품질의 결과를 얻기까지 얼마의 돈과 시간이 들었느냐. 결과가 완성될 때까지 걸린 시간은 물론, 내가 직접 검토하고 고치는 데 쓴 시간도 함께 봐야 합니다.

그래서 ’좋은 모델’의 기준은 넓어진다

축 보는 것
벤치마크 각종 평가에서 얼마나 높은 점수를 받았는지 (+ 어떤 조건에서)
토큰 효율 같은 결과를 내는 데 토큰을 얼마나 효율적으로 쓰는지
시간·비용 실제 작업에 드는 돈과 시간 (검토·수정 시간 포함)
실무 수행 내가 맡긴 일을 완수·안정성·개입 정도 면에서 얼마나 잘해내는지

다시, 아스트라는 AGI일까?

📌 지금까지 살펴본 내용만으로는, 아스트라가 AGI라고 결론 내리기는 어렵습니다.

ARC-AGI-3에서 높은 점수를 기록한 것은 분명 중요한 성과입니다 — 낯선 환경에서 규칙을 알아내고, 배운 내용을 활용해 문제를 해결하는 능력이 상당히 발전했음을 보여주니까요. 하지만 이런 능력이 현실의 다양한 상황에서도 얼마나 폭넓고 안정적으로 발휘되는지는 더 확인해야 합니다.

그렇다고 이번 발전의 의미까지 작아지는 것은 아닙니다. 실제로 이전보다 복잡한 일을 처리하고, 사람이 개입해야 하는 순간을 줄이고, 같은 품질의 결과를 더 적은 자원으로 만들어낸다면 그 자체로 중요한 변화입니다. 반대로 AGI라는 이름이 붙는다고 해서 우리가 맡기는 모든 일을 잘한다는 보장이 생기는 것도 아니죠.

그래서 젠슨 황이나 그렉 브록먼의 발언은 눈여겨볼 만하지만, 그 발언을 성능 검증의 결론으로 받아들일 필요는 없습니다. 어떤 의미에서 AGI라고 말하는지, 그 주장을 뒷받침하는 근거가 무엇인지까지 살펴봐야 합니다.


정리 — 새 모델이 나올 때마다 확인할 3가지

앞으로도 새로운 모델이 나올 때마다 놀라운 점수와 함께 비슷한 질문이 반복될 겁니다. 그때는 숫자와 함께 이 세 가지를 확인해보세요.

질문
1 무엇을 평가한 점수인가
2 어떤 조건에서 얻은 결과인가
3 내가 맡길 일에서도 그 능력이 도움이 되는가

여러분은 아스트라가 보여준 능력이 AGI라고 부르기에 충분하다고 생각하시나요? 아직 부족하다면, 어떤 능력을 더 보여줘야 한다고 생각하시나요?


참고 링크


Aiden의 친절한 AI

다른 가이드