AGI 시대가 정말 시작됐다는 말이 다시 나오고 있습니다. 계기는 OpenAI가 2026년 9월 3일 공개한 GPT-6 Astra입니다. OpenAI는 Astra를 컴퓨터 사용·브라우징·코딩·연구·문서 제작을 결합해 어려운 end-to-end 업무를 수행하는 모델로 소개했고, 조선일보도 이를 AGI 시대로 가는 이정표라는 맥락으로 다뤘습니다.
하지만 Astra가 나왔으니 AGI가 완성됐다라고 단정하면 핵심을 놓칩니다. 지금 봐야 할 것은 이름이 아니라 AI가 실제로 어디까지 범용적이고 자율적으로 일할 수 있게 됐는지, Claude와 Gemini도 같은 방향에서 어디까지 와 있는지, 그리고 그 변화가 비용·채용·외주·회사 운영에 어떤 영향을 줄 수 있는지입니다.
AGI란 무엇인가
AGI(Artificial General Intelligence·범용 인공지능)는 특정 작업 하나만 잘하는 AI가 아니라 여러 종류의 문제를 폭넓게 해결하고 새로운 상황에 적응할 수 있는 범용 지능을 뜻합니다. 다만 세계적으로 통일된 한 줄 정의나 이 점수를 넘으면 AGI라는 공식 통과선은 없습니다.
OpenAI는 자사 헌장에서 AGI를 대부분의 경제적으로 가치 있는 업무에서 인간보다 뛰어난 고도로 자율적인 시스템으로 정의합니다. Google DeepMind는 조금 다른 방식으로 AGI의 성능 깊이, 능력의 범용성, 그리고 실제 배치에서는 자율성까지 함께 보는 단계적 프레임워크를 제안했습니다.
따라서 AGI 시대라는 표현은 현재 모든 인간 업무를 대체하는 완성형 AGI가 등장했다는 의미로 쓰기보다, AI가 한 번의 답변을 넘어 다양한 도구와 업무를 연결해 수행하는 방향으로 빠르게 이동하는 시기로 이해하는 편이 정확합니다.
생성형 AI·AI 에이전트·AGI는 무엇이 다른가
| 구분 | 주된 역할 | 사람이 주로 하는 일 |
|---|---|---|
| 생성형 AI | 질문에 답하고 글·이미지·코드 초안을 생성 | 다음 작업을 직접 지시하고 실행 |
| AI 에이전트 | 목표를 받고 검색·도구 사용·파일 작성 등 여러 단계를 수행 | 목표 설정, 중간 확인, 승인 |
| AGI | 여러 분야에서 높은 수준의 범용 문제 해결과 자율 수행 | 정의와 도달 여부 자체가 아직 논쟁 중 |
이 구분에서 중요한 것은 제품 이름이 아니라 업무 범위입니다. 한 모델이 글을 잘 쓴다고 AGI가 되는 것도 아니고, 브라우저를 조작한다고 바로 AGI가 되는 것도 아닙니다.
서로 다른 문제를 얼마나 폭넓게 해결하는지, 긴 업무를 얼마나 안정적으로 이어가는지, 낯선 상황에서 얼마나 적은 지시로 적응하는지를 함께 봐야 합니다.
AGI를 벤치마크 점수만으로 판단하기 어려운 이유
AI 발표 때마다 수학·코딩·추론 벤치마크 점수가 올라가지만 사업자가 체감하는 성능은 다를 수 있습니다.
실제 회사 업무에서는 정답 하나를 맞히는 능력보다 다음 과정 전체가 중요하기 때문입니다.
자료 찾기 → 판단 → 프로그램 사용 → 파일 작성 → 예외 처리 → 수정 → 완료
OpenAI 역시 Astra의 강점을 단순 벤치마크뿐 아니라 컴퓨터 사용과 복잡한 실제 업무 수행으로 설명하고 있고, Google도 Gemini 3.8 Flash를 복잡한 에이전트 업무와 장기 소프트웨어 작업을 위한 모델로 소개합니다.
TermPick AGI 실무 판단 기준 5가지
TermPick은 AGI 시대의 실무 능력을 다음 다섯 항목으로 봅니다.
- 범용성 — 서로 다른 종류의 업무를 오갈 수 있는가
- 도구 사용 — 브라우저·터미널·문서·업무 프로그램을 실제로 사용할 수 있는가
- 업무 연결 — 검색→분석→작성→수정처럼 여러 단계를 이어갈 수 있는가
- 자율 지속시간 — 사람이 매 단계 지시하지 않아도 얼마나 오래 작업하는가
- 완결성과 복구 — 최종 결과까지 끝내고 막혔을 때 경로를 수정할 수 있는가
이 기준은 공식 AGI 인증 기준이 아닙니다. 복잡한 AGI 논쟁을 사업자의 실제 업무 관점에서 보기 위한 TermPick 자체 판단 기준입니다.
GPT-6 Astra는 어디까지 왔나
Astra의 핵심은 단순한 대화 성능보다 컴퓨터 사용과 end-to-end 업무 수행입니다.
OpenAI는 Astra가 온라인 양식 작성, CRM 고객 기록 업데이트, 일정 정리, 온라인 조사, 이메일·문서 초안 작성, 과학 데이터 분석, 웹사이트 제작과 프론트엔드 QA 같은 실제 디지털 업무를 수행할 수 있다고 설명합니다.
또 문서·스프레드시트·프레젠테이션을 사용자의 템플릿과 지시에 맞춰 만들고, 작업 중 요구사항이 추가되거나 방향이 바뀌어도 적응할 수 있다고 밝혔습니다.
즉 기존의:
질문 → 답변
구조보다
목표 → 조사 → 프로그램 사용 → 제작 → 수정 → 결과
에 가까워지고 있습니다.
다만 자율성이 높아졌다고 해서 사람의 개입이 사라진 것은 아닙니다. OpenAI는 Astra가 사용자의 의도를 잘못 해석했을 가능성이 감지되면 작업을 일시 중단하거나 멈춰 사람이 확인하게 하는 추가 안전 모니터링도 적용했습니다.
더 중요한 변화는 안전 측면입니다.
OpenAI는 Astra를 자사 Preparedness Framework에서 Critical 사이버보안 역량에 도달한 첫 모델로 지정했습니다. 적절한 도구와 접근 권한이 있으면 사람이 단계마다 안내하지 않아도 보호된 시스템에서 알려지지 않은 취약점을 찾고 새로운 악용 방법을 개발할 수 있는 수준이라고 설명합니다.
이는 AI의 능력이 높아질수록 얼마나 잘하느냐와 함께 무엇까지 할 수 있게 허용할 것인가가 더 중요해진다는 의미입니다.
Claude는 어디까지 왔나
Anthropic도 이미 답변형 AI보다 장시간 에이전트 업무에 무게를 두고 있습니다.
Claude Sonnet 5는 계획을 세우고 브라우저와 터미널 같은 도구를 사용하며 자율적으로 작업하도록 설계됐습니다. Anthropic은 이를 자사 Sonnet 계열 가운데 가장 에이전트 성격이 강한 모델로 설명합니다.
현재 더 높은 성능 영역에는 Claude Fable 5.1이 있습니다. Anthropic은 Fable 5.1을 일반 제공 모델 가운데 가장 강력한 모델로 소개하며, 복잡한 코딩·지식 업무와 긴 비동기 작업을 주요 용도로 제시하고 있습니다.
반면 사이버보안·생물학처럼 위험도가 높은 능력에는 Claude Mythos 5.1을 별도로 두고, 검증된 소수 조직에만 제한적으로 제공하고 있습니다.
실제 에이전트 사용 데이터도 눈여겨볼 만합니다.
Anthropic이 수백만 건의 인간-에이전트 상호작용을 분석한 결과, 가장 긴 Claude Code 세션에서 사람이 다시 개입하기 전까지 AI가 자율적으로 작업하는 시간이 3개월 사이 25분 미만에서 45분 이상으로 거의 두 배 증가했습니다.
AGI 시대의 경쟁이 한 번 더 좋은 답변에서
사람이 손을 떼고 있어도 얼마나 오래 안정적으로 일하는가
로 옮겨가고 있다는 실제 사례로 볼 수 있습니다.
Gemini는 어디까지 왔나
Google도 같은 방향으로 움직이고 있습니다.
Gemini 3.5 Flash부터 Computer Use 기능이 주 모델에 내장돼 브라우저·모바일·데스크톱 환경을 보고 판단하고 행동하는 에이전트를 개발할 수 있게 됐습니다.
이어 2026년 9월 2일 공개된 Gemini 3.8 Flash는 소프트웨어 엔지니어링, 에이전트 업무, 복잡한 지식 워크플로를 위한 주력 모델로 소개됐습니다.
Google DeepMind는 3.8 Flash를:
- 장시간 소프트웨어 작업
- 에이전트 코딩
- 복잡한 지식 업무
- Search 활용
- Function Calling
- Computer Use
에 적합한 모델로 설명하고 있습니다.
특히 Google은 Flash 계열에서 속도와 비용을 낮게 유지하면서 에이전트를 대규모로 운영하는 방향을 강하게 밀고 있다는 점이 특징입니다.
따라서 Gemini 역시 검색 결과를 설명하는 AI에 머무는 것이 아니라 실제 프로그램과 서비스를 사용해 업무를 이어가는 AI로 이동하고 있습니다.
GPT-6 Astra·Claude·Gemini를 AGI 관점에서 비교하면
세 회사를 단순히 1·2·3위로 나누는 것은 적절하지 않습니다.
현재 공개 자료에서 드러나는 방향이 서로 다르기 때문입니다.
| 비교 기준 | GPT-6 Astra | Claude 계열 | Gemini 계열 |
|---|---|---|---|
| 현재 강조점 | 어려운 end-to-end 업무 | 장시간 코딩·지식 업무 | 대규모 agentic workflow |
| 컴퓨터 사용 | 매우 강하게 강조 | 브라우저·터미널·도구 활용 | Computer Use 내장 |
| 긴 작업 | 복잡한 다단계 업무 | 장시간·비동기 업무 강점 | Long-horizon 에이전트 강화 |
| 고위험 능력 관리 | Critical 사이버 역량 보호조치 | Fable/Mythos 분리 | Flash Cyber 별도 모델 |
| 사업 활용 방향 | 전문 업무 전체 완결 | 복잡한 지식·코딩 업무 | 속도·비용·확장성 |
| AGI 공식 판정 | 확정하기 어려움 | 확정하기 어려움 | 확정하기 어려움 |
이 표에서 AGI 공식 판정은 제품사의 홍보 문구가 아니라 현재 공개된 근거를 기준으로 한 TermPick 해석입니다. OpenAI의 헌장조차 AGI까지의 시간표가 불확실하다고 명시하고 있고, DeepMind도 단일 통과선보다 단계적 접근을 제안합니다.
그래서 지금이 정말 AGI 시대인가
결론은 두 부분으로 나누는 것이 적절합니다.
첫째, 완성된 AGI가 공식적으로 등장했다고 단정하기에는 이릅니다
현재 모델들도 다음 문제를 가지고 있습니다.
- 잘못된 정보를 만들 수 있습니다.
- 긴 업무에서 목표를 잘못 해석할 수 있습니다.
- 낯선 환경에서 실패할 수 있습니다.
- 높은 권한을 주면 잘못된 행동의 피해도 커집니다.
- 중요한 업무에는 여전히 인간 감독이 필요합니다.
Gemini 3.8 Flash 모델 카드도 환각, 탈옥 방어, 일부 지연·타임아웃 같은 일반적인 기반 모델의 한계를 명시하고 있습니다.
둘째, 단순한 마케팅 표현으로만 치부하기도 어려워졌습니다
OpenAI·Anthropic·Google 모두 경쟁의 중심을
답변 품질
에서
도구 사용 → 다단계 실행 → 장시간 업무 → 실제 결과 완성
으로 옮기고 있기 때문입니다.
이 의미에서는 AGI 시대의 초입 또는 전환기라는 표현은 충분히 검토할 가치가 있습니다.

사람 한 명이 처리할 수 있는 업무량이 달라질 수 있습니다
사업자에게 가장 직접적인 변화는 직원이 모두 없어지는가가 아닙니다.
사람 한 명이 관리할 수 있는 업무 범위가 넓어지는가입니다.
예전에는 다음 일을 사람이 직접 이어서 했습니다.
시장 조사 → 자료 정리 → 표 작성 → 이메일 → 보고서 → 수정
AI 에이전트가 이 중 여러 단계를 묶어 처리하면 사람은 초기 목표와 최종 판단에 더 많은 시간을 쓸 수 있습니다.
이 변화가 실제로 쌓이면:
- 직원 한 명이 처리하는 프로젝트 수 증가
- 대표자가 직접 처리하던 반복 실무 감소
- 신규 채용이 필요한 시점 지연
- 외주로 넘기던 초기 작업 일부 내재화
같은 변화가 생길 가능성이 있습니다.
하지만 자동으로 인건비가 줄어드는 것은 아닙니다.
결과 검수에 오래 걸리거나 오류 수정이 많다면 AI를 사용하고도 총비용이 오히려 늘 수 있습니다.
직원 채용과 외주에 네 번째 선택지가 생깁니다
업무량이 늘었을 때 기존 선택은 대체로 세 가지였습니다.
직원 채용 / 프리랜서 / 외주회사
에이전트형 AI가 발전하면 다음 방식이 추가됩니다.
AI가 초기 작업 → 직원이 검수·판단 → 필요한 부분만 전문가 사용
예를 들어 시장조사를 외부에 모두 맡기는 대신 AI가 1차 자료를 정리하고 직원이나 전문가가 중요한 부분만 검증하는 구조입니다.
중요한 것은 구독료만 비교하지 않는 것입니다.
TermPick AI 실제 비용 계산식
**AI 실제 비용
= AI 사용료
- 연동 도구 비용
- 사람 검수 시간의 가치
- 실패·재작업 비용**
이 계산 결과가 기존 방식보다 반복적으로 낮을 때 비로소 채용이나 외주를 보완하거나 일부 대체할 경제적 의미가 있습니다.
관련 도구를 실제로 구매하려는 단계에서는 기존 TermPick의 사업용 AI 선택 콘텐츠와 연결하는 편이 좋습니다.
1인·소규모 사업자가 얻는 기회와 한계
고도화된 AI가 소규모 사업자에게 의미 있는 이유는 과거 인력이 부족해서 포기했던 초기 작업을 더 적은 인원으로 시도할 가능성이 커지기 때문입니다.
예를 들어:
- 시장 조사
- 해외 자료 확인
- 콘텐츠 초안
- 번역
- 데이터 정리
- 간단한 분석
- 프로그래밍 보조
- 문서 제작
같은 업무는 AI의 도움을 먼저 받을 수 있습니다.
그렇다고 1인 기업이 대기업을 AI 하나로 이긴다고 보는 것은 과장입니다.
대기업에는 여전히:
- 더 많은 내부 데이터
- 전문 인력
- 자본
- 자체 시스템
- 계약·보안 조직
- AI 인프라
가 있습니다.
소규모 사업자의 기회는 대기업과 동일해지는 것이 아니라, 이전에는 조직 규모 때문에 시도하지 못했던 일을 더 적은 인원으로 실행할 수 있다는 데 있습니다.
AI가 강해져도 사람이 맡아야 할 역할
AI가 실제 실행을 더 많이 맡을수록 사람의 역할은 사라지기보다 이동할 가능성이 큽니다.
목표 설정
무엇을 해결해야 하는지 결정합니다.
판단
AI가 만든 여러 결과 가운데 무엇을 선택할지 정합니다.
관계
직원·고객·거래처·협력사와의 협상과 신뢰를 관리합니다.
책임
계약·결제·법적 의사표시·중요한 외부 발표에 최종 책임을 집니다.
예외 처리
기존 매뉴얼로 처리할 수 없는 상황을 판단합니다.
따라서 얼마나 많은 일을 AI가 하는가보다 사람이 반드시 맡을 역할이 명확한가가 더 중요할 수 있습니다.
AI가 좋아질수록 회사 데이터가 더 중요해지는 이유
GPT·Claude·Gemini 같은 범용 모델은 경쟁사도 사용할 수 있습니다.
모델 자체가 널리 보급되면 차이는 점점 AI에 어떤 회사 맥락을 제공할 수 있는가에서 생길 가능성이 큽니다.
예를 들면:
- 고객 이력
- 실제 판매 데이터
- 업무 매뉴얼
- 성공·실패 사례
- 거래처 정보
- 회사 내부 문서
- 회사만의 판단 기준
입니다.
이 자료가 잘 정리된 회사는 같은 AI를 써도 더 구체적인 업무를 맡길 수 있습니다.
반대로 중요한 정보가 직원 개인 이메일과 메신저, 로컬 PC에 흩어져 있으면 좋은 모델을 구매해도 활용 범위가 제한됩니다.
그래서 AGI 시대의 중요한 회사 자산은 AI 구독권 자체보다 AI가 안전하게 읽고 사용할 수 있도록 정리된 데이터와 업무 프로세스일 수 있습니다.
민감한 회사 자료를 연결하기 전에는 별도의 보안 판단이 필요합니다.
회사 자료를 AI에 넣어도 될까? 업무용 AI 보안 비교
특정 AI 업체에 의존하는 새로운 위험
AI가 회사의 핵심 업무 깊숙이 들어오면 AI 벤더락인도 사업 위험이 됩니다.
다음 상황을 고려해야 합니다.
- 모델 가격 인상
- API 조건 변경
- 모델 종료
- 기능 폐지
- 서비스 장애
- 계정 제한
- 데이터 이전 문제
- 에이전트 동작 방식 변경
예를 들어 회사의 영업 자료 작성부터 CRM 업데이트, 이메일 발송까지 한 AI 업체의 에이전트에만 연결해 놓았다면 해당 서비스가 멈췄을 때 업무 전체가 영향을 받을 수 있습니다.
따라서 앞으로는:
어떤 AI가 제일 좋은가?
뿐 아니라
이 AI가 하루 멈춰도 우리 회사의 핵심 업무가 돌아가는가?
를 함께 확인해야 합니다.
TermPick AGI 체감 5단계
다음 단계는 공식 기술 표준이나 OpenAI·Google·Anthropic의 평가 등급이 아닙니다.
복잡한 AGI 논의를 실제 사업 업무에 대입하기 위한 TermPick 자체 분류입니다.
| 단계 | AI가 하는 일 | 사람의 역할 |
|---|---|---|
| 1. 답변 | 질문·요약·초안 | 업무 실행 대부분 |
| 2. 도구 사용 | 검색·코드·파일·프로그램 사용 | 다음 단계 지시 |
| 3. 업무 연결 | 여러 도구와 단계를 하나의 목표로 연결 | 중간 확인 |
| 4. 장기 자율 수행 | 상당 시간 스스로 진행하고 경로 수정 | 승인·예외·중단 |
| 5. 범용 고자율 | 여러 직무에서 인간 수준 이상의 안정적 수행 | 감독·책임 중심 |

2026년 9월 현재 공개 자료만 놓고 보면 GPT-6 Astra·Claude·Gemini 진영은 3단계를 확실히 넘어 일부 업무에서 4단계 특성을 빠르게 넓히고 있다고 보는 것이 합리적입니다.
다만 이것은 TermPick의 해석이며, 여러 직무와 새로운 환경에서 인간 수준 이상의 범용 성능을 안정적으로 보여주는 5단계를 달성했다고 판정할 공개 근거는 충분하지 않습니다.
지금 사업자가 준비할 것은 무엇인가
첫째, 단순 반복 업무만 찾지 말고 여러 프로그램을 오가며 사람이 중간 연결을 하고 있는 업무를 찾아야 합니다.
둘째, 고객·판매·업무 데이터를 회사가 통제할 수 있는 위치에 정리해야 합니다.
셋째, AI에 주는 권한을 다음처럼 분리해야 합니다.
읽기 → 작성 → 외부 발송 → 수정 → 삭제 → 결제
모든 권한을 한 번에 열 필요는 없습니다.
넷째, AI 월 구독료 대신 검수와 재작업까지 포함한 실제 업무비용을 기록해야 합니다.
다섯째, 특정 AI가 없어져도 핵심 업무가 돌아가는 대체 경로를 남기는 편이 좋습니다.
여러 모델 가운데 실제 업무에 어떤 수준이 필요한지 판단하려면 기존 TermPick의 모델 선택 기준과 함께 볼 수 있습니다.
아직 하지 않는 편이 좋은 것
AGI 시대라는 표현만 보고 직원 감축부터 결정하는 것은 적절하지 않습니다.
현재 모델은 특정 분야에서는 매우 강하지만 업무·환경에 따른 편차가 있고 장시간 실행에서는 오판과 권한 위험도 함께 커질 수 있습니다.
또 다음과 같은 방식은 미루는 편이 좋습니다.
- 핵심 업무 전체를 한 모델에 즉시 연결
- 고객 개인정보에 광범위한 접근 허용
- 결제·송금 자동 승인
- 계약 체결 자동화
- 대량 삭제 권한 부여
- AI 결과 검수 책임자 없이 운영
- 실제 절감 효과 측정 없이 여러 AI 구독 추가
AI 에이전트와 업무 자동화 자체를 적용하려는 단계라면 별도 가이드를 이용하는 것이 검색 의도상 더 맞습니다.
TermPick 최종 판단
지금의 핵심 변화는 AGI가 왔느냐 아니냐라는 이름 싸움이 아닙니다.
GPT-6 Astra·Claude·Gemini 모두 AI를 답변 도구에서 실제 업무 수행자로 옮기는 경쟁을 하고 있다는 점이 중요합니다.
AGI 시대를 완성형 AGI의 공식 도착으로 보기는 아직 이릅니다. 하지만 컴퓨터 사용, 여러 단계의 업무 연결, 장시간 자율 실행이 빠르게 현실화되면서 사업자가 AI를 평가하는 기준은 이미 달라지고 있습니다.
사업자가 먼저 해야 할 일은 가장 강한 모델을 사는 것이 아닙니다.
사람이 직접 연결하고 있는 업무를 찾고 → 회사 데이터와 권한을 정리하고 → AI가 맡은 업무의 실제 비용과 실패율을 측정하는 것이 먼저입니다.
AI가 강해질수록 경쟁력은 모델 이름보다 AI가 안전하게 일할 수 있는 회사 구조에서 더 크게 갈릴 수 있습니다.
자주 묻는 질문
GPT-6 Astra가 AGI인가요?
현재 공개 자료만으로 공식적인 AGI 도달이라고 단정하기는 어렵습니다. OpenAI의 AGI 정의와 DeepMind의 단계별 AGI 프레임워크를 함께 보면 단일 벤치마크나 특정 기능만으로 판정하기 어렵습니다.
Claude가 GPT-6 Astra보다 AGI에 더 가까운가요?
현재 근거만으로 한쪽을 단순히 더 가깝다고 순위화하기 어렵습니다. Astra는 컴퓨터 사용과 end-to-end 업무를 강하게 강조하고 있고, Claude는 장시간 코딩·지식 에이전트와 자율 작업에서 강한 방향성을 보이고 있습니다.
Gemini도 AGI 경쟁에 포함되나요?
그렇습니다. Gemini 3.8 Flash는 Google이 에이전트 업무, 장시간 소프트웨어 작업, Search·Function Calling·Computer Use를 중심으로 확장하고 있는 최신 주력 모델입니다. 다만 이것이 곧 AGI 달성을 의미하지는 않습니다.
AGI가 오면 직원을 바로 줄일 수 있나요?
그렇게 판단하기는 어렵습니다. 현재 모델이 먼저 영향을 줄 가능성이 큰 것은 직무 전체보다 조사·정리·초안·분석·프로그램 조작처럼 직무 안의 일부 업무입니다. 실제 검수·재작업 비용과 책임 구조를 측정한 뒤 판단해야 합니다.
참고 자료 및 정보 확인 범위
- 정보 확인일: 2026년 9월 7일
- 조선일보의 GPT-6 Astra 관련 기사에서 국내에서
AGI 시대로 가는 이정표라는 논의가 본격화된 맥락을 확인했습니다.
조선일보 — 오픈AI 차세대 AI 모델 아스트라 공개 기사 - OpenAI 공식 GPT-6 Astra 발표와 릴리스 노트에서 컴퓨터 사용, 복잡한 다단계 업무, 문서 제작과 end-to-end 업무 범위를 확인했습니다.
- OpenAI Charter에서 AGI 정의와 AGI까지의 시간표가 불확실하다는 공식 입장을 확인했습니다.
- OpenAI Astra Safety Overview에서 Critical 사이버보안 역량과 강화된 보호조치를 확인했습니다.
- Google DeepMind
Levels of AGI에서 성능·범용성·자율성에 따른 단계적 AGI 접근을 확인했습니다. - Anthropic Claude Sonnet 5, Fable 5.1, Mythos 5.1 공식 자료에서 에이전트 업무·장시간 작업·고위험 모델 배포 전략을 확인했습니다.
- Anthropic의 실제 에이전트 연구에서 긴 Claude Code 세션의 자율 작업 시간 변화를 확인했습니다.
- Google Gemini 3.8 Flash 공식 발표·모델 카드에서 에이전트 워크플로, Computer Use, 장시간 소프트웨어 작업과 알려진 한계를 확인했습니다.
- 직접 확인하지 않은 범위: 세 모델을 동일한 비공개 업무로 장기간 직접 비교한 결과, 각 회사의 내부 AGI 판정 기준, 개별 사업자의 실제 ROI
- 변경 가능성: 최신 모델·가격·배포 범위·에이전트 기능은 빠르게 변경될 수 있습니다.
- 제휴 관계: 특정 AI 업체 또는 기사 매체의 협찬을 전제로 작성하지 않았습니다.


