스탠퍼드 연구, 실행 가능한 Claude 작업의 56%가 결과 중대 또는 고위험 작업으로 확인
스탠퍼드가 249,834건의 Claude 채팅을 분석한 결과, 실행 가능한 작업의 56%가 결과 중대 또는 고위험 작업인 것으로 나타났다.
1. 스탠퍼드 연구진, 실제 Claude 대화 249,834건 분석
스탠퍼드 대학교가 Claude.ai 대화 249,834건을 연구한 결과, 분류 가능하고 실행 가능한 작업을 포함한 대화의 56%가 결과 중대 또는 고위험 작업과 관련된 것으로 나타났다. 이 결과는 사용자가 이미 다른 사람에게 영향을 미치거나, 지속적인 결과를 낳거나, 되돌리기 어려울 수 있는 업무에 AI를 활용하고 있음을 시사한다.
논문 “Human–AI Collaboration at Scale: Task Criticality, Agency, and Friction Across 250,000 Conversations”는 2026년 8월 21일 제출됐다. 저자인 Yijia Shao, Dora Zhao, Vishakh Padmakumar, Jennifer Wang, Diyi Yang은 스탠퍼드의 Social and Language Technologies Lab 소속이다.
Anthropic은 8월 26일 연구 파트너십을 발표했다. 이는 이전에 Clio로 불렸던 프라이버시 보존형 사용 분석 시스템 Anthropic Insights를 통해 수행된 세 건의 파일럿 연구 중 하나였다. 스탠퍼드는 인간-AI 협업을 연구했고, 옥스퍼드 대학교의 Human Information Processing Lab은 사용자가 Claude와 상호작용하는 동안의 경험을 검토했으며, 비영리 단체 METR은 Claude Code 세션에서의 생산성 분석을 시작했다.
각 그룹은 자체 연구 질문을 설계했다. Anthropic은 승인된 분석을 자사 서버에서 실행하고, 대화 원문이 아니라 집계 결과를 연구진에게 제공했다. 스탠퍼드 논문은 이 파일럿에서 처음으로 완료된 연구 보고서다.
56%라는 수치에는 중요한 분모 관련 단서가 필요하다. 이 수치는 연구진이 실행 가능한 작업을 식별하고 중요도 등급을 부여할 수 있었던 대화에 적용된다. 전체 코퍼스의 약 3분의 1에는 적용 가능한 실행 가능 작업이 없었다. 따라서 이 결과를 모든 Claude 대화의 56%가 결과 중대 작업이라는 증거로 해석해서는 안 된다.
2. 법률 및 금융 자문이 가장 높은 작업 중요도를 기록
연구진은 실행 가능한 작업을 일시적, 운영적, 결과 중대, 고위험의 네 가지 등급으로 분류했다. 평가는 되돌릴 수 있는지 여부, 업무가 다른 사람에게 영향을 미치는지, 영향의 잠재적 심각도 등의 요인을 고려했다.
실행 가능한 작업 가운데 20%는 일시적, 24%는 운영적, 44%는 결과 중대, 12%는 고위험으로 분류됐다. 마지막 두 등급을 합치면 보고된 56%가 된다.
“결과 중대” 업무는 “다른 사람에게 영향을 미치거나 되돌리기 어려운” 업무로 정의됐다. 고위험 등급은 잠재적으로 심각한 직업적, 법적, 재정적, 건강상 또는 제도적 결과를 초래할 수 있는 작업을 포괄했다.
법률 및 금융 자문은 논문의 0점에서 3점까지의 작업 중요도 지수에서 2.14점으로 가장 높게 나타났다. 해당 영역 대화의 약 24%는 고위험으로 분류됐다. 기초 범주에는 계약서 작성, 고용 및 이민 관련 질문, 세금 계획, 투자 분석, 기타 전문 자문이 포함됐다.
비즈니스 지원은 1.75점, 경력 지원은 1.70점을 기록했다. 소프트웨어 개발은 1.37점, AI 및 데이터 작업은 1.32점이었다. 학업 과제는 1.06점으로 더 낮았다. 이러한 비교는 이 분류가 단순히 기술적 복잡성을 측정한 것이 아님을 보여준다. 외부적 결과를 수반하는 자문 작업은 기술적으로 까다로운 많은 활동보다 높은 점수를 받았다.
위험도가 높아질수록 사용자의 행동도 변했다. 고위험 대화는 평균 12.4턴으로, 일시적 업무의 6.5턴과 비교됐다. 중요도가 올라갈수록 사용자는 더 구체적인 표현을 사용하고 맥락을 점진적으로 추가했다.
그러나 작업 분해는 최고 등급에서 계속 증가하지 않았다. 사용자는 더 정밀해졌지만, 고위험 문제를 점진적으로 더 작은 단계로 일관되게 나누지는 않았다. 긴 대화는 반드시 신뢰할 수 있는 검토 과정을 제공하지 않으면서도 더 큰 관여를 반영할 수 있기 때문에 이 구분은 중요하다.
3. 인간이 대체로 주도했지만 감독 수준은 달랐다
이 연구는 AI 주도 자동화부터 인간의 참여가 필수적인 업무까지 이어지는 5단계 인간 주체성 척도를 사용했다. 적용 가능한 대화의 72%는 “인간이 주도하고 AI가 보조”하는 경우로 분류됐다. 사용자가 방향을 정하고 일차적 책임을 유지하는 가운데 Claude가 작업 완료를 도왔다.
이 결과는 전면 위임을 중심으로 한 AI 활용 모델과 다르다. 표본에 포함된 대부분의 사용자는 전체 목표를 Claude에 단순히 넘긴 뒤 첫 번째 응답을 수용하지 않았다.
연구진은 사람들이 Claude의 출력을 어떻게 다루었는지도 별도로 분류했다. 가능한 방식에는 직접 사용, 이해, 수정, 비평, 거부가 포함됐다. 응답을 사용하기 전에 수정하는 방식인 수정이 가장 일반적인 행동이었으며, 적용 가능한 결과 중대 작업 대화의 약 60%를 차지했다. 작업 중요도가 높아질수록 수정하지 않은 직접 사용은 감소했다.
고위험 작업에서 사용자는 출력을 완성된 산출물로 취급하기보다 이해하려는 시도를 더 자주 했다. 이 패턴은 더 큰 주의를 시사하지만, 사용자가 Claude의 주장을 검증했거나 오류를 식별할 충분한 분야 지식을 보유했음을 입증하지는 않는다. 인간의 주도와 효과적인 감독은 동등한 측정값이 아니다.
Claude는 대화의 67%에서 어떤 형태로든 능동적인 교육을 제공했다. 교육은 정규 교육을 넘어 확장됐다. 소프트웨어 개발과 건강 또는 라이프스타일 관련 질문은 각각 이러한 상호작용의 약 18%를 차지했고, 비즈니스는 12%를 차지했다. 절차적 지시와 개념적 설명을 결합한 혼합 교육 방식은 교육 사례의 61%에서 나타나 가장 일반적인 접근법이었다.
따라서 이 연구는 AI가 역량에 영향을 미칠 수 있는 두 가지 서로 다른 방식을 식별한다. 설명은 사용자가 작업을 이해하도록 도울 수 있는 반면, 직접 실행은 사용자가 그렇지 않았다면 수행했을 업무를 대체할 수 있다. 대화 데이터는 이러한 상호작용 패턴을 구분할 수 있지만, 사용자가 이후에도 지식을 유지했는지는 판단할 수 없다.
4. 대화의 약 절반에서 마찰 발생
연구진은 대화의 49.7%에서 마찰, 즉 어떤 형태의 어려움이나 중단을 감지했다. 이 사례들 가운데 38.6%는 역량 한계, 환각, 거부를 포함한 모델 주도형으로 분류됐다. 일반적으로 모호하거나 명세가 부족한 요청과 관련된 사용자 주도형 마찰은 19.4%를 차지했다.
나머지 42%는 복합적인 실패와 관련됐다. 이 경우 불명확한 요청과 그에 따른 Claude의 오해가 하나의 고립된 실수를 낳는 대신 서로를 강화했다.
사용자는 마찰이 포함된 대화의 78.7%에서 회복을 시도했다. 회복 행동에는 누락된 맥락 제공, 프롬프트 재구성, 오류 수정, 설명 요청, 모델의 추론에 이의 제기가 포함됐다.
모든 중단이 해로운 것으로 분류된 것은 아니다. 일부 마찰은 사용자가 목표를 명확히 하고, 응답을 더 면밀히 검토하거나, 요청한 출력을 다듬도록 유도했다. 모델의 추론에 대한 이의 제기는 이 전략이 나타난 사례의 81.5%에서 생산적인 것으로 분류됐다.
그럼에도 “생산적”은 사실 정확성이나 현실 세계에서의 성공을 측정한 값이 아니라 대화상의 분류다. 이 연구는 Claude가 궁극적으로 정확한 법률 자문, 안전한 의료 지침, 작동하는 소프트웨어 또는 성공적인 비즈니스 의사결정을 제공했는지를 독립적으로 평가하지 않았다.
5. 프라이버시 보호는 감사할 수 있는 범위도 제한
Anthropic Insights는 Claude가 각 대화에 대해 연구진이 작성한 질문, 즉 패싯(facets)에 답하도록 하는 방식으로 작동한다. 범주형 및 수치형 답변은 집계되며, 개방형 답변은 임베딩되어 클러스터로 묶일 수 있다. 외부 연구진은 대화 원문이 아니라 범주 설명, 건수, 백분율, 교차표를 받는다.
스탠퍼드 팀은 원문을 확인할 수 있는 공개 대화 데이터셋 WildChat에서 질문을 테스트했다. Anthropic은 WildChat이 일반적인 Claude 트래픽보다 일상적이고 창의적인 사용을 더 많이 포함한다고 인정했다. WildChat에서 잘 작동한 일부 질문은 Claude 대화에 적용했을 때 오해를 불러일으키는 범주를 만들었다.
연구진도 연구 시스템을 사용하는 일반 Anthropic 직원도 기초 대화를 읽지 않기 때문에, 이 한계는 해결하기 어렵다. Anthropic은 질문의 표현 방식이 Claude의 대화 분류를 바꿀 수 있으며, 개방형 클러스터 설명은 객관적 기록이 아니라 해석이라고 지적한다.
Clio 시스템의 최초 검증에서는 대화의 약 3%가 할당된 토픽 클러스터 설명으로 명확히 표현되지 않는 것으로 나타났다. Anthropic은 토픽 분류의 정확도 추정치를 모델 행동이나 사용자의 감정 상태를 판단하는 패싯의 검증에 사용해서는 안 된다고 추가로 경고한다.
표본은 Claude 고객 기반의 주요 부분도 제외한다. Free, Pro, Max 플랜의 소비자 대화는 포함하지만 Team, Enterprise, API 트래픽은 포함하지 않는다. 스탠퍼드는 Claude Code 세션이 아니라 Claude.ai 대화를 분석했으며, 데이터는 종단적 관점이 아니라 2026년 4월과 5월의 단일 기간을 나타낸다.
Anthropic은 집계 결과를 공개하기 전에 수동으로 검토했다. 스탠퍼드 분석에서는 프라이버시, 안전, 오용 또는 공개 관련 우려 때문에 개방형 클러스터의 1.9%를 수정하거나 제거했으며, 이는 대화의 4.28%에 해당한다. 회사는 연구진에게 변경 사항을 알렸고, 계약상 검토 권한은 프라이버시, 사용 정책 회피, 기밀 정보, 연구 정확성으로 제한됐다고 밝혔다.
임페리얼 칼리지 런던 연구진이 수행한 프라이버시 감사에서는 어떤 사용자도 재식별되지 않았다. 그러나 감사자는 설명에 고유한 세부 정보가 보존되어 있었기 때문에 하나의 클러스터를 널리 사용되는 오픈소스 프로젝트와 연결할 수 있었다. Anthropic은 향후 클러스터에 필요한 최소 사용자 수를 늘리고 생성된 설명의 고유한 표현을 줄일 계획이라고 밝혔다.
공개된 집계 데이터셋은 CC BY 4.0 라이선스로 제공된다. 연구진은 공개된 표의 분석을 재현하거나 해당 집계 데이터에 새 질문을 던질 수 있지만, 원본 대화를 독립적으로 검토하거나 Claude의 분류를 직접 감사할 수는 없다. 이 파일럿은 AI 기업 내부에서만 작성된 연구를 넘어 접근성을 확대하는 한편, 데이터 선택, 계산, 프라이버시 검토, 분류 시스템 자체에 대한 통제권은 제공업체에 남긴다.
자주 묻는 질문
이 연구는 모든 Claude 대화의 56%가 결과 중대 작업이라고 말하나요?
아니다. 56% 수치는 중요도 등급을 부여할 수 있는 실행 가능한 작업을 포함한 대화에 적용된다. 전체 표본의 약 3분의 1에는 적용 가능한 실행 가능 작업이 없었다.
스탠퍼드 연구진이 사용자의 비공개 대화를 읽었나요?
아니다. 원시 대화와 계산은 Anthropic 서버에 남아 있었다. 연구진은 집계된 범주, 설명, 건수, 백분율을 받았다.
스탠퍼드 표본에는 Claude Code가 포함됐나요?
아니다. 스탠퍼드는 Claude.ai 소비자 대화를 분석했다. METR은 약 250,000건의 Claude Code 대화에 대한 별도의 프라이버시 보존형 분석을 제공받았다.
이 연구는 Claude가 고위험 작업에서 정확하다는 것을 보여주나요?
아니다. 이 연구는 작업 특성과 상호작용 행동을 측정했으며, Claude 답변의 사실 정확성이나 그에 따른 결과를 측정하지 않았다.
연구 데이터는 공개되나요?
Anthropic은 집계 클러스터 데이터를 CC BY 4.0 라이선스로 공개했다. 원시 대화, 사용자 식별자, 조직 식별자는 포함되지 않는다.
참고 자료
Share