Новости ИИЗнаков 12357Время чтения31 мин

Gemini Co-Scientist переходит от гипотез к экспериментам в реальном мире

Google Gemini Co-Scientist разработал лабораторные протоколы, предсказал морфологию бактерий, создал медицинского ИИ-агента и проверил написанные ИИ научные статьи.

Содержание · 12
  1. 1. Co-Scientist теперь охватывает большую часть исследовательского цикла
  2. 2. Лабораторные протоколы позволили получить три полупроводника в виде монослоя
  3. 3. Биологический тест предсказал морфологию колоний, а не новую биологию
  4. 4. Автономный поиск создал архитектуру для ответов на медицинские вопросы
  5. 5. Журналы исполнения сократили число сфабрикованных исследовательских утверждений
  6. Частые вопросы
  7. Управлял ли Gemini полностью всей лабораторией автономно?
  8. Были ли открыты три ранее неизвестных материала?
  9. Превзошёл ли AgentH каждую протестированную медицинскую модель?
  10. Означает ли уровень галлюцинаций 4%, что сгенерированные статьи были готовы к публикации?
  11. Доступна ли полная экспериментальная система Co-Scientist публично?
  12. Источники

Исследователи Google расширили Gemini Co-Scientist: из системы, предлагающей научные гипотезы, он превратился в систему, способную проектировать эксперименты, генерировать исполняемые протоколы, анализировать результаты и писать рукописи, привязанные к записям об исполнении.

Результаты представлены в *Accelerating Scientific Research with Gemini in the Real-World*, препринте на arXiv, поданном 27 августа 2026 года. В исследовании описаны эксперименты в области материаловедения, синтетической биологии, проектирования архитектур медицинского ИИ и автономных вычислительных исследований.

Наиболее конкретное достижение состоит не в том, что ИИ создал научный текст. Разные версии системы были связаны с экспериментальными данными: машинными командами для реактора химического осаждения из газовой фазы, неопубликованными изображениями колоний сконструированных бактерий, исполненным исходным кодом и детерминированными журналами, использованными для проверки утверждений в сгенерированных статьях.

Заявленные результаты значительны, но предварительны. Новая работа не прошла внешнее рецензирование, большая часть физической работы по-прежнему требовала участия учёных, а ряд выводов имеет существенные ограничения в отношении воспроизводимости или оценки.

1. Co-Scientist теперь охватывает большую часть исследовательского цикла

Изначально Google представляла Co-Scientist как основанную на Gemini многоагентную систему для структурированной генерации гипотез. В статье Nature от мая 2026 года описывались специализированные агенты, которые генерируют, критикуют, ранжируют и развивают гипотезы-кандидаты. Учёные задавали исследовательские цели, ограничения и обратную связь, а система искала литературу и организовывала «турнир идей».

Новая конфигурация добавляет к этому рабочему процессу эксперименты и генерацию рукописей.

На этапе выработки идей гипотезы-кандидаты получают независимые обзоры литературы, проверку безопасности и оценку новизны, правдоподобия и проверяемости. Байесовский процесс ранжирования отбирает кандидатов для дальнейшей разработки, а эволюционные операции объединяют или пересматривают перспективные идеи.

При проведении вычислительных экспериментов система генерирует программы, тестирует их на ограниченных данных, переводит успешные реализации к полноформатному выполнению и использует полученные журналы для обновления своего исследовательского плана. Для физических экспериментов её результат вместо этого может стать машиночитаемым протоколом для полуавтоматизированного лабораторного оборудования.

На этап написания поступают выбранная гипотеза, литература, исходный код, результаты экспериментов и журналы исполнения. Отдельные механизмы штрафуют за плагиат и неподтверждённые утверждения. Компонент верификации сопоставляет численные утверждения в рукописи с записанными результатами выполненного кода и переписывает расхождения. Если корректной записи об исполнении не существует, система должна остановиться, а не создавать статью на основе несуществующих результатов.

Следовательно, это не единый уровень автономности. Участие людей различалось между экспериментами: учёные выполняли и дорабатывали работы по материалам, эксперты многократно корректировали постановку биологической задачи, а поиск вычислительной архитектуры шёл без вмешательства человека после предоставления исходной директивы и ресурсов.

2. Лабораторные протоколы позволили получить три полупроводника в виде монослоя

В материаловедении исследователи подключили Co-Scientist к специализированной полуавтоматизированной системе химического осаждения из газовой фазы, используемой для выращивания двумерных материалов.

В одном эксперименте системе поручили определить менее опасный путь с прекурсором для восходящего синтеза материала из карбида титана, похожего на Ti₃C₂Tₓ MXene. Co-Scientist предложил твёрдый прекурсор гексахлорэтан, C₂Cl₆, а исследователи-люди дорабатывали маршрут более чем в 70 физических экспериментах.

Полученный слоистый материал имел дифракционные, элементные и межплоскостные измерения, согласующиеся с важными характеристиками Ti₃C₂Tₓ. Он выдержал обработку кислотой и фторидом, что помогло отличить его от распространённых побочных продуктов карбида титана.

Авторы не утверждают, что идентичность материала окончательно установлена. Окисление после роста и низкий выход не позволили дать окончательное определение на атомном уровне. Чтобы установить, является ли продукт Ti₃C₂Tₓ, Ti₂CCl₂ или другой фазой, всё ещё необходима атомно-разрешающая визуализация поперечного сечения.

Второй эксперимент был посвящён трём известным полупроводникам на основе дихалькогенидов переходных металлов: дисульфиду молибдена, диселениду молибдена и дисульфиду вольфрама — MoS₂, MoSe₂ и WS₂.

Используя Gemini 3 Deep Think, Co-Scientist за несколько минут перевёл ограничения лабораторного оборудования в рецептуры и команды реактора машинного уровня. Все три монослойных материала были успешно выращены с первой попытки приблизительно за один час суммарного экспериментального времени. Лаборатория ранее не имела опыта выращивания MoSe₂ или WS₂, и оба этих результата впоследствии были воспроизведены как минимум в пяти запусках.

Люди по-прежнему загружали прекурсоры и подложки, выполняли части рабочего процесса и характеризовали продукты. Быстро сгенерированные рецептуры также дали более мелкие и менее правильные кристаллы, чем рецептуры, разработанные в ходе более длительного процесса оптимизации.

Протоколы были протестированы только на специализированном оборудовании исследователей. Разная геометрия реакторов может менять характер роста материалов, поэтому успех «с первой попытки» в этой лаборатории не доказывает воспроизводимость между лабораториями.

3. Биологический тест предсказал морфологию колоний, а не новую биологию

В эксперименте по синтетической биологии использовались сконструированные колонии *E. coli*, характер роения которых менялся в зависимости от концентраций химического индуктора IPTG.

Co-Scientist получил изображения с высоким разрешением для граничных концентраций и построил конвейер компьютерного зрения на основе Gemini 3 Pro Image. Для каждого отложенного условия модель генерировала 16 изображений колоний-кандидатов, а вторичный оценщик выбирал лучшее предсказание.

Входные изображения на момент проведения оценки не были опубликованы. Предсказания сравнивались с физическими колониями, выращенными в течение 24 часов и отсканированными в тех же экспериментальных условиях.

По четырём измерениям — среднему радиусу, полярному эксцентриситету, вариации интенсивности по окружности и округлости — предсказанные и наблюдаемые траектории дозовой зависимости совпали по трём. Округлость существенно разошлась, поскольку сгенерированные колонии обычно выглядели геометрически более правильными, чем реальные. Система также верно предсказала отсутствие дозовой зависимости у контрольного штамма.

Этот результат уже, чем предсказание незнакомого биологического поведения. Модель интерполировала между наблюдаемыми точками на известном химическом градиенте; она не экстраполировала на новую генетическую схему, вид бактерий или среду выращивания. Эксперты-люди также уточняли постановку задачи между раундами, хотя саму архитектуру обработки изображений реализовал Co-Scientist.

Практическое применение соответственно ограничено: надёжная интерполяция могла бы сократить число физических условий, которые необходимо культивировать и визуализировать во время скрининга, однако эксперимент не показывает, что система понимает биологические механизмы, ответственные за эти паттерны.

4. Автономный поиск создал архитектуру для ответов на медицинские вопросы

В эксперименте по информатике исследователи дали Co-Scientist директиву обнаружить агентную архитектуру для ответов на вопросы о здоровье. После этой начальной настройки система генерировала, выполняла и итеративно дорабатывала код без дальнейшего вмешательства человека.

Она получила корпус из 1,282 синтетических запросов о здоровье, интерфейс к Gemini 3.1 Pro и инструмент со структурированными сводками клинических рекомендаций. Финальные наборы для оценки — HealthBench Hard и HealthBench Professional — были скрыты на этапе разработки.

Получившаяся архитектура под названием Agent_H использует восемь этапов. Она классифицирует запрос по медицинской специальности, целевой аудитории, намерению, сложности и риску состязательного воздействия; декомпозирует сложные запросы; генерирует от 28 до 48 ответов-кандидатов от имени нескольких медицинских персон; проводит турнир для отбора финалистов; использует трёх судей для выбора победителя; и выполняет до пяти циклов критики и доработки. Она также может проверять цитирования и сжимать финальный ответ до целевой длины.

Этот процесс требует приблизительно от 40 до 80 вызовов языковой модели на запрос.

Agent_H занял первое место среди шести базовых моделей передового уровня на обоих бенчмарках после корректировки оценок на многословность, по версии двух автоматизированных судей. Эта оговорка важна: Claude Opus 5 имела наивысший нескорректированный результат на HealthBench Professional, тогда как GPT-5 лидировала по исходной оценке HealthBench Hard у одного судьи.

Исследователи уже наблюдали, что более длинные ответы завышали оценки по рубрике. После добавления штрафа за длину значительная часть этого кажущегося преимущества исчезла. Этот эпизод демонстрирует, как автономная система оптимизации может эксплуатировать метрику оценки, а не улучшать основную задачу.

Затем три сертифицированных врачебных специалиста сравнили Agent_H с немодифицированной Gemini 3.1 Pro по девяти параметрам. Agent_H достиг статистически значимого преимущества только в снижении вероятности вреда, с сообщённым p-значением 0.0486. Различия по остальным восьми показателям не были значимыми, а согласованность между автоматизированными судьями и клиницистами была лишь слабой или умеренной.

Результат поддерживает более узкое утверждение о том, что обнаруженные меры защиты снизили число потенциально вредных ответов в этой оценке. Он не устанавливает, что Agent_H клинически превосходит другие системы или готов к медицинскому развёртыванию.

5. Журналы исполнения сократили число сфабрикованных исследовательских утверждений

Команда также протестировала полностью автономные вычислительные исследования по 50 темам ИИ. Каждая тема обрабатывалась в трёх условиях: Co-Scientist с модулями надёжности, та же система без этих модулей и система Agent Laboratory с открытым исходным кодом в качестве внешнего базового уровня.

Каждый запуск создавал идею, план эксперимента, код Python, журналы исполнения и скомпилированную статью. В трёх условиях эксперимент сгенерировал 150 рукописей.

Тридцать экспертов в предметных областях — 29 из которых имели степень PhD или постдокторскую позицию — провели 450 слепых рецензий. Рецензенты сопоставляли заявленные результаты с кодом и журналами, проверяли, соответствуют ли описанные методы их реализациям, и оценивали потенциально производные работы относительно литературы.

Дисквалифицирующие галлюцинации результатов обнаружились в 4% статей Co-Scientist с модулями надёжности, по сравнению с 46% для аблированной системы и 90% для Agent Laboratory. Поэтому часто цитируемое снижение с 90% до 4% представляет собой сравнение двух разных систем, а не просто измерение одной модели до и после изменений.

Среди 50 статей с Co-Scientist, оснащённым модулями надёжности, не было зарегистрировано случаев крайней фальсификации данных. Соответствующие показатели составили 40% для аблированной системы и 44% для Agent Laboratory.

Меры защиты не устранили другие проблемы добросовестности. Серьёзные расхождения между методами, описанными в статье, и фактически выполненным кодом сохранялись в 24% рукописей Co-Scientist, хотя это ниже 52% для аблированной версии и 100% для базового уровня. Производный или плагиатный контент высокой серьёзности встречался в 16% случаев против 50% и 60% соответственно.

Двухуровневая система безопасности также отклонила 691 из 700 вредоносных исследовательских запросов, или 98.7%, при этом ошибочно отклонив 22 из 700 невредоносных запросов. Когда первоначальный фильтр отказов был отключён, эксперты-рецензенты всё же оценили 96.3% сгенерированных идей и 96.7% экспериментальных планов как безопасные при включённом непрерывном надзоре.

Эти меры лучше всего подходят для вычислительных экспериментов, где детерминированные журналы могут предоставлять проверяемую запись. В статье прямо сказано, что их эффективность остаётся недоказанной для физических экспериментов с шумными измерениями, неоднозначными наблюдениями и вариацией приборов.

Для исследовательских организаций непосредственный вывод состоит в том, что происхождение исполнения может существенно улучшить рукописи, созданные ИИ, — но оно не может заменить проверку кода, воспроизведение экспериментов, рецензирование или предметную экспертизу. Google предложила функции генерации гипотез Co-Scientist через Gemini for Science, но в статье не объявляется общий доступ к полной интегрированной с лабораторией системе, описанной в этих экспериментах.

Частые вопросы

Управлял ли Gemini полностью всей лабораторией автономно?

Нет. Он генерировал и выполнял машинные команды для частей полуавтоматизированного рабочего процесса реактора, но люди загружали материалы, работали с образцами, проводили физические эксперименты и выполняли характеризацию.

Были ли открыты три ранее неизвестных материала?

Нет. MoS₂, MoSe₂ и WS₂ — известные полупроводники в виде монослоя. Система сгенерировала рецептуры, специфичные для оборудования, которые позволили вырастить их с первой попытки. Для отдельного материала, похожего на MXene, окончательное определение на атомном уровне ещё не получено.

Превзошёл ли Agent_H каждую протестированную медицинскую модель?

Только по оценкам HealthBench с поправкой на длину. Некоторые конкурирующие модели лидировали по исходным оценкам, а врачи-рецензенты обнаружили статистически значимое преимущество только по снижению вероятности вреда.

Означает ли уровень галлюцинаций 4%, что сгенерированные статьи были готовы к публикации?

Нет. Исследование всё же выявило серьёзные методологические несоответствия в 24% рукописей Co-Scientist и производный контент высокой серьёзности в 16%. Оценка охватывала вычислительные исследования ИИ, а не все научные дисциплины.

Доступна ли полная экспериментальная система Co-Scientist публично?

В статье не объявляется общий доступ к интегрированной с лабораторией конфигурации. Google отдельно предоставляет экспериментальный доступ к генерации гипотез через Gemini for Science.

Источники

Share

Поделиться статьёй