라이프스타일

Anthropic, 프런티어 AI 지표 3종 공개: 26%는 '주도'이지 '자율'이 아니다

Anthropic는 2026년 9월 17일, 프런티어 AI 연구소 내부의 진행 상황을 외부에서 추적할 수 있게 하는 세 가지 지표—연구개발 자동화 정도, AI 에이전트 감독 체계, 안전 작업에 배분되는 컴퓨팅 비중—를 공개했습니다. 이 글은 Anthropic 공식 페이지를 바탕으로 2026년 9월 18일에 확인했으며, 26%의 '주도'가 왜 완전 자동을 뜻하지 않는지, 0.002%라는 차단율에 왜 또 다른 단서가 따라붙는지, 그리고 이 수치들이 현재로서는 Anthropic 자체 측정이고 범위가 제한적이며 외부 평가자 체계는 아직 구축 중이라는 점을 설명합니다.

읽는 데 약 17분

오리지널 일러스트: 나란히 놓인 세 개의 계기판, 각 바늘이 서로 다른 눈금에 멈춰 있고, 계기판 위에는 기하학적인 물음표 윤곽이 떠 있어 이 눈금들이 아직 외부 검증을 기다리고 있음을 나타낸다
사진: Mokaair (© Mokaair)

2026년 9월 17일, Anthropic는 공식 웹사이트에 세 가지 지표를 공개해 프런티어 AI 연구소 내부의 연구개발 진행 상황—AI 연구개발 업무 중 얼마나 많은 부분을 AI 스스로 수행하는지, AI 에이전트의 행동이 어떻게 관리되는지, 컴퓨팅 자원이 어떻게 배분되는지—을 외부에서도 볼 수 있게 하려고 시도했습니다. Anthropic는 이를 CEO Dario Amodei가 얼마 앞서 발표한, 프런티어 AI의 속도를 늦추자는 글과 연결지으며, 각 연구소가 실제로 속도 조절에 협력한다면 이 수치들도 그에 따라 바뀔 것으로 예상한다고 썼습니다.

이 글은 2026년 9월 18일에 확인했으며, Anthropic 공식 웹사이트의 세 페이지—이 세 지표를 공개한 게시물 본문, 뉴스 목록 페이지, 정책 맥락을 설명하는 정책 페이지—를 근거로 합니다. 본 사이트는 직접 시험해 보지 않았고, 이 세 지표는 현재 모두 Anthropic가 스스로 측정하고 스스로 공개한 수치입니다. 이 글은 Anthropic 스스로 밝힌 한계와 아직 검증되지 않은 부분을 하나씩 짚습니다.

Anthropic는 무엇을, 왜 공개했나

Anthropic 공식 뉴스 목록 페이지가 이 게시물에 붙인 요약은, 지금 세상은 AI 연구소 내부에서 무슨 일이 벌어지는지 볼 수 없으며 Anthropic는 프런티어 AI 개발을 대중이 볼 수 있게 하는 새로운 지표를 제안한다는 것입니다. 게시물 본문은 이를 Amodei의 호소와 연결짓지만, 그의 글로 연결되는 링크만 걸었을 뿐 주장 내용을 다시 서술하지는 않습니다. Anthropic가 쓴 것은, 이렇게 제안한 측정과 정책을 합치면 연구소 바깥에서 AI 개발 속도를 모니터링하는 하나의 출발점이 된다는 것입니다.

이 게시물 본문에는 발행일이 인쇄되어 있지 않습니다. 2026년 9월 18일까지 확인한 바로는 페이지에 서명 날짜, '게시됨'이라는 표기, 그에 해당하는 메타데이터 항목이 보이지 않습니다. 9월 17일은 Anthropic 공식 뉴스 목록 페이지의 주요 기사 영역이 이 게시물에 표시한 날짜이며, 이 글은 이를 사건 발생일로 삼습니다. 원문은 어떤 시각도 인쇄하지 않았으므로 이 글도 발행의 정확한 시각은 적지 않습니다. Anthropic는 이 지표들을 프로토타입이라고 부르며, 이를 통해 투명성을 보여주고 싶고 앞으로도 계속하겠다고 썼지만, 정해진 공개 주기를 약속하지는 않았습니다.

세 가지 지표: 연구개발 자동화, 에이전트 감독, 안전 컴퓨팅 비중

첫 번째는 'Anthropic 연구개발 자동화 지수(Anthropic R&D Automation Index)'로, Epoch AI가 개발한 자동화 수준(Automation Level, AL) 척도로 점수를 매기며 AL0부터 AL5(완전 자율, 인간 개입 없음)까지 있습니다. AL3 '협업(Collaborative)'은 AI가 인간의 밀접한 지시 아래 많은 양의 작업을 해낼 수 있다는 뜻이고, AL4 '주도(Leading)'는 AI가 상위 수준의 지시만으로 작업 대부분을 처음부터 끝까지 완료할 수 있으며 인간은 여전히 감독하는 입장에 있다는 뜻입니다. 2026년 8월 기준으로 Anthropic는 측정 대상이 된 어떤 AI 연구개발 작업 범주에서도 Claude가 완전 자율로 작동하고 있지 않다고 밝혔으며, '주도'는 26%, '협업' 이상 비중은 합쳐서 90%를 넘습니다.

두 번째는 에이전트 감독으로, Anthropic는 커버리지(coverage), 리뷰 지연시간(review latency), 에스컬레이션 비율(escalation rate) 세 가지 관점을 선택했습니다. 각각 행동 중 얼마나 많은 부분이 모니터링을 거치는지, 행동과 리뷰 사이에 시간이 얼마나 걸리는지, 행동 중 얼마나 많은 부분이 차단되거나 검토 대상으로 표시되는지를 뜻합니다. 2026년 8월 기준으로 사내에서 가장 많이 쓰이는 플랫폼 하나에서 동시에 약 3만 개의 에이전트가 연구·엔지니어링 업무를 수행했으며, 이 수치들은 이 플랫폼 하나만을 대상으로 합니다. 이 행동들의 100%는 실행 전에 온라인 모니터링(online monitoring)을 먼저 거치며 보통 몇 초 안에 끝나고, 사후에도 100%가 오프라인 모니터링(offline monitoring)으로 들어갑니다. 오프라인 모니터링은 매주 약 10만 건의 대화 기록에 표시를 하고, 대부분은 분류기(classifier)가 처리하며, 우선순위가 가장 높은 약 50건이 사람의 검토로 넘어갑니다.

Anthropic는 2026년 8월 한 달간 10억 건이 넘는 판단을 분석한 결과, 0.002%(약 47,000건 중 1건)가 온라인 모니터링에 의해 차단되었다고 밝혔습니다. Anthropic는 이 절 서두에서 먼저, 지금까지의 모니터링 데이터를 보면 개별 에이전트가 문제를 일으키는 일은 드물지만, 경제 전체에서 수백만, 수십억 개의 에이전트가 작동할 때는 드문 사건도 자주 일어날 수 있다고 짚었습니다. 세 번째는 컴퓨팅 스냅숏입니다. Anthropic는 2026년 7월 13일부터 20일까지 한 주 동안 자사가 사용한 모든 컴퓨팅 자원의 용도를 살펴보았고, AI 연구개발용 컴퓨팅의 약 6%, 'AI가 주도하는 AI 연구개발'용 컴퓨팅의 약 12%가 안전 작업에 배분되었다고 밝혔습니다. 두 수치는 분모가 다르므로 이 글에서는 둘을 더하거나 비교하지 않습니다.

Anthropic가 2026년 9월 17일 공개한 세 가지 지표를 정리했습니다. 확인일 2026년 9월 18일. 표의 모든 수치는 Anthropic 자체 측정입니다.
지표기간공식 수치Anthropic이 밝힌 한계
연구개발 자동화 지수2026년 8월'주도' 26%, '협업' 이상 90% 초과Claude가 Claude를 채점, 외부 감사 아님
에이전트 감독: 커버리지2026년 8월행동의 100%가 사전 온라인 모니터링, 사후 오프라인 모니터링을 거침사내에서 가장 많이 쓰이는 플랫폼 하나만 대상
에이전트 감독: 차단율2026년 8월10억 건 넘는 판단 중 0.002% 차단(약 47,000건 중 1건)경제 규모가 커지면 드문 사건도 자주 일어날 수 있다고 Anthropic는 설명
안전 컴퓨팅 비중2026년 7월 13일~20일AI 연구개발 컴퓨팅의 약 6%, AI 주도 연구개발 컴퓨팅의 약 12%를 안전 작업에 배분의도적으로 보수적인 한 주짜리 스냅숏이라고 Anthropic는 설명

이 수치들이 아직 검증된 수치가 아닌 이유

Anthropic는 연구소 간 비교를 가로막는 두 가지 장애물을 스스로 꼽습니다. 첫째, 공통된 측정 방법론이 없다는 점입니다. 둘째, Anthropic가 자사 시스템을 평가하는 데 자사의 Claude를 쓴다는 점입니다. 연구용 Claude 에이전트가 먼저 증거를 모으고, 이어서 별도의 Claude가 평가자 역할을 맡습니다. 특정 달의 자동화 정도를 평가할 때, 채점을 담당하는 에이전트는 그 달이나 그 이전의 증거만 볼 수 있습니다. 다시 말해 Anthropic 스스로, 평가자 역할을 하는 모델이 자신이 점검하는 모델과 같은 종류의 오류를 저지를 수 있다는 뜻일 수 있다고 쓰고 있습니다.

감독 관련 수치에도 한계가 있습니다. Anthropic가 쓴 내용은, 여러 조직에서 독립적인 제3자 평가자를 상주시켜 내부 위험평가 팀에 준하는 접근 권한을 줄 계획이라는 것이며, 감독을 다룬 절에서는 현재 외부 평가자 체계를 구축하는 중이라고도 썼습니다. 두 문장 모두 이미 누군가 검증을 마쳤다는 뜻은 아닙니다. 본문에는 METR이 과거 Anthropic의 오프라인 모니터링 플랫폼을 독립적으로 레드팀 방식으로 테스트한 적이 있다고 나오지만, 이는 과거의 일이며 테스트 대상은 모니터링 플랫폼이지 이 글이 공개하는 백분율 수치 자체가 아닙니다. 확인 당일 읽을 수 있었던 내용을 기준으로, 이 글은 위 수치들을 외부 기관이 검증한 흔적을 확인하지 못했습니다.

컴퓨팅 비중의 산출 방식도 Anthropic는 보수적으로 짰다고 설명합니다. 예로 든 것은, 어떤 토큰이 능력 향상에 기여한 정도가 안전에 기여한 정도와 같을 경우 그 토큰은 안전 쪽으로 집계하지 않는다는 규칙입니다. 두 수치에는 안전 보호용 분류기에 쓰이는 또 다른 컴퓨팅 자원도 포함되어 있지 않으며, Anthropic는 그것도 비슷한 규모라고 설명합니다. Anthropic는 안전 연구가 프런티어 훈련에 비해 컴퓨팅 자체보다 연구자의 시간에 더 의존하는 경향이 있다고 밝혔으며, 그래서 컴퓨팅 비중은 불완전한 대리 지표일 뿐이고 그 의미는 개발자 간, 시간에 따라 같은 것끼리 비교할 수 있다는 데 있지, 이 두 백분율 자체의 절대적 크기에 있는 것이 아니라고 설명합니다.

네 칸짜리 도해: 누가 연구개발을 하는지, 에이전트는 어떻게 관리되는지, 컴퓨팅은 누구에게 배분되는지, 누가 검증하는지
Anthropic가 2026년 9월 17일 공개한 세 가지 지표 정리: 연구개발 자동화, 에이전트 감독, 안전 컴퓨팅 비중. 확인일 2026년 9월 18일. · 사진: Mokaair (© Mokaair)

가장 오해하기 쉬운 두 수치

첫 번째로 오해하기 쉬운 부분은 '주도'입니다. 26%는 흔히 '업무의 4분의 1을 AI가 사람 관리 없이 스스로 끝낸다'는 뜻으로 바로 받아들여지지만, Anthropic가 정의하는 AL4 '주도'는 AI가 상위 수준의 지시만으로 작업 대부분을 처음부터 끝까지 완료할 수 있되 인간은 여전히 감독하고 있다는 뜻입니다. '완전 자율, 인간 개입 없음'을 뜻하는 AL5는 각주에서 '우리가 아직 도달하지 못한 단계'라고 설명되어 있습니다. 더 가까운 표현은 '작업을 넘겨받은 AI가 대부분의 단계를 스스로 처리하지만, 옆에서 누군가 지켜보며 언제든 개입할 수 있다'이지, 'AI가 문을 닫아걸고 끝내버려서 무슨 일이 있었는지 아무도 모른다'가 아닙니다.

두 번째로 오해하기 쉬운 부분은 0.002%라는 차단율입니다. 숫자만 보면 '에이전트는 거의 문제를 일으키지 않으니 시스템이 안전하다'로 읽기 쉽지만, Anthropic는 같은 절에서 경제 전체에 수백만, 수십억 개의 에이전트가 작동할 때는 개별 사건의 확률이 낮더라도 드문 사건이 자주 일어날 수 있다고 씁니다. 게다가 0.002%는 어디까지나 한 달 동안 사내 플랫폼 하나에서 온라인 모니터링이 차단한 비율일 뿐이며, 오프라인 모니터링은 별도로 대화 기록의 약 1,000건 중 1~2건에 추가 검토가 필요하다고 표시합니다. 원문은 이 둘을 표의 서로 다른 칸에 나눠 적었을 뿐 합산하지 않았습니다.

이 글에 쓰이지 않은 부분, 그리고 프런티어 속도 조절과의 관계

2026년 9월 18일까지 확인한 내용을 기준으로, 이 게시물 본문은 어떤 국가나 시장도 특정해 언급하지 않았고, 제품 변화나 사용자가 체감할 기능 조정도 다루지 않았습니다. 이는 Anthropic가 자사 내부 연구개발 과정을 어떻게 측정하는지 설명하는 글이지 제품 발표가 아니며, 대만 사용자가 지금 Claude를 쓰는 방식은 이로 인해 바뀌지 않습니다. 이 글은 Anthropic 자체 수치만 공개하며, 다른 회사의 자동화 비중, 감독 커버리지, 안전 컴퓨팅 비중은 적혀 있지 않습니다. Anthropic 원문이 쓴 것은 '어떤 프런티어 개발사든' 비슷한 지표를 공개할 수 있다는 것이지, 이미 다른 회사가 그렇게 하고 있다는 뜻이 아닙니다.

이 게시물 본문은 부록에서 자체적으로 '안전 작업'의 정의를 밝힙니다. AI 시스템을 더 안전하게, 더 이해하기 쉽게, 또는 보안을 더 튼튼하게 만드는 것을 주된 목적으로 하는 작업이라는 것입니다. Anthropic는 동시에 이것이 여러 합리적인 선택지 중 하나일 뿐이며, 다른 개발사나 규제 기관이라면 선을 다른 곳에 그을 수도 있다고 밝히면서, 각 주체가 미리 공통된 정의를 두고 논의해 두면 도움이 될 것이라는 견해를 밝힙니다. Anthropic의 또 다른 정책 페이지는 자사의 Advanced AI Framework를 언급하며, 투명성과 독립 평가부터 필요할 때 위험한 배포를 막거나 억제하는 정부의 권한까지 다룬다고 설명합니다. 이 페이지는 이 프레임워크가 주로 미국 연방정부를 염두에 두고 작성된 제안이며, 이미 시행 중인 규정이 아니라고 명시하고 있습니다.

이 게시물 본문과 Amodei가 얼마 앞서 발표한 〈We Must Pace the Frontier〉는 같은 흐름을 이루는 두 편의 글입니다. 이 게시물 본문은 이 수치들이 프런티어 속도 조절에 대한 Amodei의 협력 호소에 부응한다고 쓰고 그의 글로 링크를 걸 뿐, 그 내용을 다시 서술하지는 않습니다. 3단계 계획과 '1단계는 외부 평가자 상주'라는 내용은 본 사이트의 다른 정리 글에서 나온 것으로, 이 글이 인용하는 페이지에는 들어 있지 않습니다. 여기서 공개된 세 가지 지표는 '실제로 속도 조절이 일어나고 있는지'를 펼쳐볼 수 있는 수치로 바꾸려는 Anthropic의 시도입니다. 그 3단계에 대해 알고 싶다면 본문 끝의 두 번째 링크를 참고하십시오.

자주 묻는 질문

26%는 연구개발 업무의 4분의 1이 이미 완전히 AI에게 넘어갔다는 뜻인가요?

아닙니다. Anthropic의 정의에서 26%는 자동화 수준 AL4 '주도'에 해당하며, AI가 상위 수준의 지시만으로 작업 대부분을 처음부터 끝까지 완료할 수 있지만 인간은 여전히 감독하고 있다는 뜻입니다. 인간 개입 없이 완전 자율로 작동하는 AL5는 각주에서 '우리가 아직 도달하지 못한 단계'라고 설명되어 있으며, 본문에도 2026년 8월 기준으로 측정 대상이 된 어떤 AI 연구개발 작업도 아직 완전 자율로 작동하지 않는다고 적혀 있습니다.

0.002%라는 차단율은 이 감독 시스템이 안전하다는 뜻인가요?

Anthropic는 그렇게 주장하지 않습니다. 이 수치는 2026년 8월 온라인 모니터링이 10억 건이 넘는 판단 중에서 차단한 비율이며, Anthropic는 같은 절 서두에서 지금까지의 모니터링 데이터를 보면 개별 에이전트가 문제를 일으키는 일은 드물지만, 경제 전체에서 수백만, 수십억 개의 에이전트가 작동할 때는 개별 사건의 확률이 낮더라도 드문 사건이 자주 일어날 수 있다고 먼저 밝힙니다. 오프라인 모니터링은 별도로 대화 기록의 약 1,000건 중 1~2건에 표시를 하는데, 이는 다른 수치이며 원문은 이를 차단율과 합산하지 않았습니다.

이 세 지표는 외부 기관의 검증을 거쳤나요?

이 글이 2026년 9월 18일까지 확인한 내용을 기준으로, 이 수치들 자체를 외부 기관이 검증한 흔적은 보이지 않습니다. Anthropic가 쓴 내용은 독립적인 제3자 평가자를 상주시켜 내부 위험평가 팀에 준하는 접근 권한을 줄 계획이라는 것이며, 다른 곳에서는 현재 외부 평가자 체계를 구축하는 중이라고도 썼습니다. 본문에는 METR이 과거 Anthropic의 오프라인 모니터링 플랫폼을 독립적으로 레드팀 방식으로 테스트한 적이 있다고 나오지만, 이는 과거의 일이며 테스트 대상은 모니터링 플랫폼이지 이 백분율 수치들이 아닙니다.

이것이 대만의 Claude 사용자와 관계가 있나요?

이 글이 확인한 내용을 기준으로, 이 게시물 본문은 어떤 국가나 시장도 특정해 언급하지 않았고, 제품 변화나 사용자가 체감할 기능 조정도 다루지 않았습니다. 이는 Anthropic가 자사 내부 연구개발 과정을 어떻게 측정하는지 설명하는 글이지 제품 발표가 아니며, 대만 사용자가 지금 Claude를 쓰는 방식은 이로 인해 바뀌지 않습니다.

이 지표들은 앞으로 정해진 주기로 공개되나요?

Anthropic는 정해진 공개 주기를 약속하지 않았습니다. 이 글은 이를 통해 투명성을 보여주고 싶고 앞으로도 계속하겠다고 밝혔으며, 어떤 프런티어 개발사든 공개된 방법을 써서 이런 지표를 정기적으로 공개할 수 있다고도 썼습니다. 이 글이 확인한 페이지를 기준으로 다음 공개 날짜는 적혀 있지 않고, 앞으로도 같은 방법을 계속 쓰겠다는 약속도 없습니다. Anthropic는 부록에서 그 과업 목록을 주기적으로 다시 구성하고, 필요에 따라 이미 공개한 자동화 수치의 버전을 다시 매길 계획이라고도 밝혔습니다.

이 글은 Amodei가 얼마 앞서 발표한, 프런티어 AI의 속도를 늦추자는 글과 어떤 관계가 있나요?

Anthropic의 이 게시물 본문은 이 수치들이 프런티어 속도 조절에 대한 Amodei의 협력 호소에 부응한다고 쓰고 그의 글로 링크를 걸고 있지만, 그 내용을 다시 서술하지는 않습니다. 3단계 계획과 '1단계는 외부 평가자 상주'라는 내용은 본 사이트의 다른 정리 글에서 나온 것으로, 이 글이 인용하는 페이지에는 들어 있지 않습니다. 여기서 공개된 세 가지 지표는 '실제로 속도 조절이 일어나고 있는지'를 펼쳐볼 수 있는 수치로 바꾸려는 Anthropic의 시도입니다. 그 3단계에 대해 알고 싶은 독자는 본문 끝의 두 번째 링크로 더 읽어볼 수 있습니다.

  • 라이프스타일

    Amodei, 프런티어 AI 속도 조절 촉구: 〈We Must Pace the Frontier〉의 주장과 경계

    Anthropic CEO Dario Amodei는 2026년 9월 12일 〈We Must Pace the Frontier〉를 발표하고, AI 역량 발전의 속도를 늦춰 위험 예방이 따라잡을 시간을 확보하고 이를 제3자 평가자가 확인하도록 해야 한다고 주장했습니다. 이 글은 '속도 조절'의 정의와 포함되지 않는 범위, 3단계 계획, Altman·Hassabis·Musk가 각각 어떻게 반응했는지, 그리고 이 제안이 일반 사용자에게 실제로 어떤 의미가 있는지 정리합니다.

  • 라이프스타일

    OpenAI, 정렬 실패 보고 프레임워크 공개: 보고서 6건 모두 훈련 단계 사례

    OpenAI 공식 페이지에 인쇄된 공개일은 미국 시간으로 2026년 9월 16일이지만, 타이베이 시간으로 환산하면 이미 9월 17일입니다. 같은 날 구체적인 사례 보고서 6건도 함께 공개되었습니다. 본 기사는 프레임워크 발표문, alignment.openai.com 개요 페이지와 사례 보고서 2건을 확인해, 이 6건의 보고서가 어떤 단계와 어떤 모델을 대상으로 표시되어 있는지, 신고가 어떤 절차를 거치는지, 그리고 OpenAI가 공개한 두 가지 비율이 각각 무엇을 측정한 것인지 설명합니다.

  • 라이프스타일

    Anthropic 9월 위협 인텔리전스 보고서: 일곱 가지 AI 악용과 표적이 된 API 키

    Anthropic은 2026년 9월 10일 위협 인텔리전스 보고서를 발표하고 2025년 12월부터 2026년 8월까지 차단한 일곱 가지 유형의 AI 악용을 정리했습니다. 이 글은 보고서가 말하는 것과 말하지 않는 것을 짚고, 일반인이 AI 사기를 막고 계정과 API 키를 보호하며 AI 에이전트 권한을 줄이고 의심스러운 이용을 신고하는 방법을 설명합니다.

  • 라이프스타일

    NVIDIA, DGX Spark 64GB 모델 출시: 10월 23일 판매 시작, 시작가 4,999달러, 두 대 연결 시 128GB

    NVIDIA는 2026년 10월 2일 개인용 AI 컴퓨터 DGX Spark에 더 저렴한 64GB 메모리 모델을 추가한다고 발표했다. 10월 23일부터 Acer, ASUS 등 6개 제조사를 통해 공급되며, 주요 대상은 자신의 기기에서 AI 모델을 실행하려는 개발자와 연구자다. NVIDIA가 공개한 사양, 두 대 연결에 관한 설명, 그리고 일반 독자에게 갖는 의미를 정리했다.

최신 여행 소식·가이드

출처

라이프스타일