Исследование Stanford: 56% практических задач в Claude имеют существенные или высокие ставки
Анализ Stanford 249 834 чатов Claude показал, что 56% практических задач имели существенные или высокие ставки.
1. Исследователи Stanford проанализировали 249 834 реальных разговора с Claude
Исследование Stanford University, охватившее 249 834 разговора в Claude.ai, показало, что 56% разговоров, содержавших классифицируемую практическую работу, были связаны с задачами, имеющими существенные или высокие ставки. Этот результат указывает, что пользователи уже привлекают ИИ к работе, которая может затрагивать других людей, приводить к долгосрочным последствиям или быть труднообратимой.
Статья «Человеко-ИИ-взаимодействие в масштабе: критичность задач, агентность и трения в 250 000 разговорах» была подана 21 августа 2026 года. Её авторы — Yijia Shao, Dora Zhao, Vishakh Padmakumar, Jennifer Wang и Diyi Yang — связаны с Social and Language Technologies Lab при Stanford.
Anthropic объявила об исследовательском партнёрстве 26 августа. Оно стало одним из трёх пилотных исследований, проведённых через Anthropic Insights — систему анализа использования с защитой приватности, ранее называвшуюся Clio. Stanford изучал взаимодействие человека и ИИ, Human Information Processing Lab Оксфордского университета исследовал опыт пользователей при взаимодействии с Claude, а некоммерческая организация METR начала анализировать продуктивность в сессиях Claude Code.
Каждая группа самостоятельно разработала свои исследовательские вопросы. Anthropic выполнила одобренные анализы на своих серверах и предоставила исследователям агрегированные результаты, а не расшифровки разговоров. Статья Stanford — первая завершённая исследовательская публикация по итогам пилота.
Показатель 56% требует важного уточнения знаменателя. Он относится к разговорам, в которых исследователи выявили практическую задачу и смогли присвоить ей уровень критичности. Примерно в одной трети всего корпуса не было применимой практической задачи. Поэтому этот результат не следует трактовать как свидетельство того, что существенными являются 56% всех разговоров с Claude.
2. Юридические и финансовые консультации имели наивысшую критичность задач
Исследователи распределили практические задачи по четырём уровням: кратковременные, операционные, существенные и высокоставочные. Оценка учитывала такие факторы, как обратимость, влияние работы на других людей и потенциальная тяжесть её последствий.
Среди практических задач 20% были классифицированы как кратковременные, 24% — как операционные, 44% — как существенные и 12% — как высокоставочные. Объединение двух последних уровней даёт заявленные 56%.
Существенная работа была определена как работа, которая «затрагивает других людей или которую трудно отменить». Уровень высоких ставок охватывал задачи с потенциально тяжёлыми профессиональными, юридическими, финансовыми, медицинскими или институциональными последствиями.
Юридические и финансовые консультации заняли первое место по трёхбалльному индексу критичности задач в статье, получив 2,14 балла. Примерно 24% разговоров в этой области были классифицированы как высокоставочные. Базовые категории включали составление договоров, вопросы трудоустройства и иммиграции, налоговое планирование, инвестиционный анализ и другие профессиональные консультации.
Поддержка бизнеса получила 1,75 балла, а поддержка карьеры — 1,70. Разработка ПО набрала 1,37, а задачи, связанные с ИИ и данными, — 1,32. Учебные задания были ниже — 1,06. Эти сравнения показывают, что классификация не была лишь мерой технической сложности: консультационные задачи с внешними последствиями получали более высокие оценки, чем многие технически сложные виды деятельности.
По мере роста ставок пользователи также меняли своё поведение. В разговорах с высокими ставками было в среднем 12,4 хода, тогда как в кратковременной работе — 6,5 хода. По мере роста критичности пользователи использовали более конкретные формулировки и постепенно добавляли контекст.
Однако декомпозиция задач не продолжала усиливаться на наивысшем уровне. Пользователи становились точнее, но не всегда последовательно разбивали высокоставочные проблемы на всё более мелкие шаги. Это различие важно, поскольку более длинный разговор может отражать более активное участие, но не обязательно обеспечивает надёжный процесс проверки.
3. Обычно ведущую роль играли люди, но контроль различался
В исследовании использовалась пятиуровневая шкала человеческой агентности — от автоматизации под руководством ИИ до работы, в которой участие человека было необходимо. 72% применимых разговоров были отнесены к категории «человек ведёт, ИИ помогает»: пользователь задавал направление и сохранял основную ответственность, а Claude помогал выполнить задачу.
Этот результат отличается от модели использования ИИ, основанной главным образом на полной делегации. Большинство пользователей в выборке не просто передавали Claude всю цель и не принимали первый ответ без изменений.
Исследователи отдельно классифицировали, как люди обращались с результатами Claude. Доступные режимы включали прямое использование, понимание, адаптацию, критику и отклонение. Адаптация — изменение ответа перед использованием — была наиболее распространённым поведением и составила около 60% применимых разговоров с существенными задачами. Прямое использование без изменений сокращалось по мере роста критичности задачи.
При работе с высокими ставками пользователи чаще пытались понять результат, а не воспринимали его как готовый артефакт. Такая закономерность предполагает большую осторожность, но не доказывает, что пользователи проверяли утверждения Claude или обладали достаточными знаниями предметной области, чтобы выявлять ошибки. Лидерство человека и эффективный контроль — не эквивалентные измерения.
Claude также демонстрировал некоторую форму активного обучения в 67% разговоров. Обучение выходило за рамки формального образования: разработка ПО и вопросы здоровья или образа жизни каждая составляли около 18% этих взаимодействий, тогда как бизнес — 12%. Смешанные методы обучения — сочетание процедурных инструкций с концептуальными объяснениями — были наиболее распространённым подходом и встречались в 61% случаев обучения.
Таким образом, исследование выделяет два различных способа, которыми ИИ может влиять на способности. Объяснения могут помогать пользователям понять задачу, тогда как прямое выполнение может заменять работу, которую пользователь иначе выполнил бы сам. Данные разговоров позволяют различать эти модели взаимодействия, но не могут определить, сохранили ли пользователи знания впоследствии.
4. Трения возникали примерно в половине разговоров
Исследователи выявили трения — некоторую форму затруднения или сбоя — в 49,7% разговоров. Среди этих случаев 38,6% были отнесены к инициированным моделью, включая ограничения возможностей, галлюцинации и отказы. Трения, инициированные пользователем и обычно связанные с неоднозначными или недостаточно определёнными запросами, составили 19,4%.
Оставшиеся 42% были связаны с накапливающимися сбоями. В этих случаях неясный запрос и возникшая вследствие этого неверная интерпретация Claude усиливали друг друга вместо того, чтобы привести к одной изолированной ошибке.
Пользователи пытались восстановить ход взаимодействия в 78,7% разговоров с трениями. Стратегии восстановления включали добавление недостающего контекста, переформулирование промпта, исправление ошибки, запрос разъяснений или оспаривание рассуждений модели.
Не каждое прерывание было классифицировано как вредоносное. Некоторые трения побуждали пользователей уточнять свои цели, внимательнее изучать ответ или уточнять запрашиваемый результат. Оспаривание рассуждений модели было классифицировано как продуктивное в 81,5% случаев, где применялась эта стратегия.
Тем не менее «продуктивное» — это разговорная метка, а не измерение фактической точности или успеха в реальном мире. В исследовании независимо не оценивали, предоставил ли Claude в конечном итоге корректную юридическую консультацию, безопасную медицинскую рекомендацию, работающее ПО или решение, приведшее к успешному бизнес-результату.
5. Защита приватности также ограничивает возможности аудита
Anthropic Insights работает так: Claude отвечает на составленные исследователями вопросы, называемые facets, по каждому разговору. Категориальные и числовые ответы подсчитываются, а открытые ответы могут быть преобразованы в эмбеддинги и сгруппированы в кластеры. Внешние исследователи получают описания категорий, количество, проценты и перекрёстные таблицы, но не исходные сообщения.
Команда Stanford протестировала свои вопросы на WildChat — публичном наборе данных разговоров, где могла изучать исходный текст. Anthropic признала, что WildChat содержит больше повседневного и творческого использования, чем обычный трафик Claude. Некоторые вопросы, хорошо работавшие на WildChat, давали вводящие в заблуждение категории при применении к разговорам с Claude.
Это ограничение трудно устранить, поскольку ни исследователи, ни обычные сотрудники Anthropic, использующие исследовательскую систему, не читают исходные разговоры. Anthropic отмечает, что формулировка вопроса может менять классификацию разговора Claude, а описания открытых кластеров являются интерпретациями, а не объективными записями.
Первоначальная валидация системы Clio показала, что примерно 3% разговоров не были ясно представлены описаниями назначенных им тематических кластеров. Anthropic также предупреждает, что оценки точности тематической классификации не следует использовать для валидации facets, оценивающих поведение модели или эмоциональные состояния пользователей.
Выборка также исключает значительные части клиентской базы Claude. Она включает потребительские разговоры из планов Free, Pro и Max, но не трафик Team, Enterprise или API. Stanford анализировал разговоры Claude.ai, а не сессии Claude Code, и данные представляют один период в апреле и мае 2026 года, а не продольный обзор.
Перед публикацией Anthropic вручную проверила агрегированные результаты. В запуске Stanford она отредактировала или удалила 1,9% открытых кластеров, охватывавших 4,28% разговоров, из-за вопросов приватности, безопасности, неправомерного использования или раскрытия информации. Компания сообщила исследователям, что именно изменила, и заявила, что её договорные права на проверку были ограничены приватностью, обходом политики использования, конфиденциальной информацией и точностью исследования.
Аудит приватности, проведённый исследователями Imperial College London, не позволил повторно идентифицировать ни одного пользователя. Однако аудиторы смогли связать один кластер с широко используемым проектом с открытым исходным кодом, поскольку его описание сохранило отличительные детали. Anthropic сообщила, что планирует увеличить минимальное число пользователей, необходимое для будущих кластеров, и сократить количество отличительных формулировок в генерируемых описаниях.
Опубликованный агрегированный набор данных доступен по лицензии CC BY 4.0. Исследователи могут воспроизводить анализы опубликованных таблиц или задавать новые вопросы к этим агрегатам, но не могут независимо изучать исходные разговоры или напрямую проверять классификации Claude. Пилот расширяет доступ за пределы исследований, полностью проводимых внутри ИИ-компании, но оставляет за поставщиком контроль над отбором данных, вычислениями, проверкой приватности и самой системой классификации.
Частые вопросы
Утверждает ли исследование, что 56% всех разговоров с Claude являются существенными?
Нет. Показатель 56% относится к разговорам с практической задачей, которой можно было присвоить уровень критичности. Примерно в одной трети полной выборки не было применимой практической задачи.
Читали ли исследователи Stanford личные разговоры пользователей?
Нет. Исходные разговоры и вычисления оставались на серверах Anthropic. Исследователи получили агрегированные категории, описания, количество и проценты.
Включала ли выборка Stanford Claude Code?
Нет. Stanford анализировал потребительские разговоры в Claude.ai. METR получил отдельный анализ с защитой приватности примерно 250 000 разговоров в Claude Code.
Показывает ли исследование, что Claude точен в задачах с высокими ставками?
Нет. Оно измеряло характеристики задач и поведение при взаимодействии, а не фактическую корректность ответов Claude или их последующие результаты.
Доступны ли данные исследования публично?
Anthropic выпустила агрегированные кластерные данные по лицензии CC BY 4.0. Исходные разговоры, идентификаторы пользователей и идентификаторы организаций не включены.
Источники
- Оригинальный пост Anthropic в X
- Человеко-ИИ-взаимодействие в масштабе: критичность задач, агентность и трения в 250 000 разговорах
- Anthropic: обеспечение независимых исследований того, как люди используют Claude
- Приложение к «Обеспечение независимых исследований того, как люди используют Claude»
- Агрегированный набор данных пилота Anthropic Insights
- Anthropic: Clio, система для получения инсайтов о реальном использовании ИИ с защитой приватности
Share