Google DeepMind, 90억 개 DNA 변이에 대한 예측을 담은 AlphaGenome Atlas 출시
AlphaGenome Atlas는 90억 개 인간 DNA 변이에 대한 예측 분자 효과를 1페타바이트 데이터베이스에서 검색할 수 있게 한다.
목차 · 12
Google DeepMind는 2026년 9월 8일 AlphaGenome Atlas를 출시해, 인간 게놈에서 가능한 약 90억 개 단일 문자 변화의 예측 분자 효과를 연구자들이 검색할 수 있도록 했다.
이 1페타바이트 데이터베이스는 인간 참조 게놈 전반에 DeepMind의 AlphaGenome 모델을 미리 적용한다. 연구자들은 변이를 개별적으로 선택하고, 코드를 작성하며, 분석마다 계산 집약적인 모델을 실행하는 대신 웹 포털이나 프로그래밍 인터페이스를 통해 이미 계산된 결과를 조회할 수 있다.
Atlas는 AlphaGenome Variant Impact 점수, 즉 AVI 점수도 도입한다. 이는 조절 효과에 대한 AlphaGenome의 예측과 단백질 변형 변이에 대한 AlphaMissense 예측을 결합해, 코딩 DNA와 비코딩 DNA의 변화를 모두 순위화하는 데 사용할 수 있는 하나의 점수를 만든다.
이는 임상 진단 데이터베이스가 아니라 연구 우선순위화 시스템이다. 수록 항목은 실험적으로 확립된 발견이 아닌 모델 예측이며, Google은 이를 임상 의사결정에 사용하는 것을 명시적으로 금지한다.
1. DeepMind는 가능한 모든 단일 문자 치환을 사전 계산했다
인간 게놈에는 약 30억 개의 염기쌍이 있다. 각 위치에서 참조 DNA 문자는 이론적으로 다른 세 문자 중 하나로 대체될 수 있으며, 약 90억 개의 가능한 단일 뉴클레오타이드 치환이 생성된다.
AlphaGenome Atlas에는 인간 참조 게놈을 기준으로 이 전체 탐색 공간에 대한 예측이 담겨 있다. 그 결과 데이터세트는 약 1페타바이트를 차지하며, DeepMind는 이것이 AlphaFold Database 크기의 30배 이상이라고 밝혔다.
이 규모가 Atlas가 가능한 모든 형태의 인간 유전 변이를 포괄한다는 뜻은 아니다. Atlas는 단일 문자 치환에 초점을 맞춘다. 삽입, 결실, 구조 변이, 그리고 개인 게놈 내 변이의 조합은 출시 발표에서 설명한 90억 개 변이 카탈로그의 범위 밖이다.
Atlas 이전에는 연구자들이 선택한 서열이나 변이를 AlphaGenome API에 제출할 수 있었다. 이 접근 방식은 표적 연구에는 적합하지만, 사용자가 무엇을 테스트할지 결정한 뒤 계산 자원을 들여 예측을 생성해야 한다. DeepMind는 일반 모델 API가 수천 건의 예측을 포함하는 분석에 적합하며, 100만 건을 초과하는 예측 워크로드에는 적절하지 않을 가능성이 크다고 말했다.
Atlas는 이 계산을 앞단으로 옮긴다. IEEE Spectrum의 출시 보도에 따르면, DeepMind는 처음에 전체 컬렉션을 실용적인 기간 안에 계산하려면 약 80배의 속도 향상이 필요하다고 추정했다. 팀은 필요한 규모에 도달하기 위해 모델 증류, 최적화된 GPU 커널, 중복 계산 제거를 사용했다.
실질적인 결과는 공동 조회 리소스다. 연구실은 공통 변이에 대해 동일한 모델 추론을 반복할 필요가 없으며, 최신 가속기에 접근할 수 없는 연구자도 브라우저를 통해 예측을 확인할 수 있다.
2. AlphaGenome이 예측하는 것
AlphaGenome은 2025년 6월에 소개됐으며, 2026년 1월 28일 출판된 동료 심사 Nature 논문에서 설명됐다. 이는 서열-기능 모델로, DNA 서열을 입력으로 받아 유전자 조절과 관련된 분자 측정값을 예측한다.
이 모델은 한 번에 최대 100만 개 DNA 염기쌍을 처리한다. 아키텍처는 국소 서열 패턴을 인식하는 합성곱 레이어, 입력 전반에서 정보를 교환하는 트랜스포머, 그리고 다양한 형태의 게놈 활동에 특화된 출력 레이어를 사용한다.
출판된 모델은 11개 모달리티에 걸쳐 인간 게놈 트랙 5,930개 또는 생쥐 게놈 트랙 1,128개를 동시에 예측한다. 여기에는 RNA 발현, 전사 개시, 크로마틴 접근성, 히스톤 변형, 전사 인자 결합, 3차원 크로마틴 접촉, 스플라이스 부위, 스플라이스 부위 사용, 스플라이스 접합부 좌표와 강도가 포함된다.
변이 분석을 위해 AlphaGenome은 참조 서열에서 생성한 예측과 대체 DNA 문자를 포함한 서열에서 생성한 예측을 비교한다. 그 차이는 모델이 해당 변화가 특정 생물학적 맥락에서 분자 과정에 어떤 영향을 미칠 것으로 예상하는지를 나타낸다.
Nature 평가에서 AlphaGenome은 26개 변이 효과 평가 중 25개에서 가장 강력한 외부 모델과 동등하거나 이를 능가했으며, 24개 게놈 트랙 과제 중 22개에서 최신 최고 성능 결과를 달성했다. 이 측정값은 정의된 벤치마크 아래에서 개별 모델 역량을 평가하는 것이며, 새 Atlas의 모든 예측이 정확하다는 것을 입증하지는 않는다.
Atlas에는 각 변이에 대한 수천 건의 분자 효과 예측이 포함된다. 또한 변이를 2,500개 이상의 반복적인 DNA 서열 모티프 컬렉션과 연결해, 연구자들이 변화가 인식 가능한 조절 패턴을 교란하는지 조사할 수 있도록 한다.
3. AVI 점수는 게놈 전반의 순위화 레이어를 추가한다
AlphaGenome이 생성하는 출력 수는 그 자체로 해석 문제를 만든다. 변이는 수많은 조직과 세포 유형에서 예측 RNA 양, 크로마틴 접근성 또는 스플라이싱에 서로 다르게 영향을 줄 수 있다. 연구가 수천 또는 수백만 개 후보에서 시작할 때 모든 출력을 검토하는 것은 비현실적이다.
AVI 점수는 이 정보를 하나의 영향 값으로 압축한다. 비코딩 영역에서는 AlphaGenome의 조절 예측을 활용한다. 단백질을 변형하는 변이에서는 미스센스 변이를 평가하는 DeepMind의 특화 모델인 AlphaMissense를 통합한다.
이는 단백질을 코딩하는 게놈의 약 2%와 유전자 활동 제어에 관여하는 훨씬 더 큰 비코딩 부분 전반에서 연구자들에게 공통의 순위화 메커니즘을 제공한다. 높은 점수는 면밀히 검토할 가치가 있는 변이를 식별하기 위한 것이며, 변이가 질병을 유발한다고 선언하기 위한 것은 아니다.
DeepMind는 점수와 함께 특성 기여도도 제공한다. 이는 결과를 RNA 스플라이싱, 유전자 발현, 크로마틴 접근성, 서열 보존성 또는 단백질 기능의 예측 변화 같은 생물학적 범주로 분해한다. 따라서 연구자들은 순위화된 후보에서 제안된 분자 메커니즘으로 이동할 수 있다.
단일 복합 점수는 중요한 차이를 감출 수 있기 때문에 이 해석 가능성 레이어는 중요하다. IEEE Spectrum이 인터뷰한 독립 게놈학자는 게놈 조절이 서로 상호작용하는 많은 과정을 포함하기 때문에 단순화된 숫자가 오해될 수 있다고 경고했다. 변이가 왜 해당 순위를 받았는지 이해하려면 상세한 예측과 특성 기여도가 여전히 필요하다.
4. 초기 연구는 Atlas가 검색 범위를 좁히는 방식을 보여준다
DeepMind는 외부 연구 그룹이 출시 전에 희귀 질환, 집단 유전학, 유전자 조절 프로젝트에서 Atlas를 사용했다고 보고했다. 이 사례들은 실험 연구를 위한 필터로서 Atlas의 의도된 역할을 보여준다.
Broad Institute 및 GREGoR Consortium과 연계된 연구자들은 해결되지 않은 희귀 질환 사례에서 변이의 우선순위를 정하기 위해 AVI 점수를 사용했다. 한 후보는 발달성 및 간질성 뇌병증과 연관된 DNM1 유전자에 영향을 미쳤다.
AlphaGenome은 이 변화가 잘못된 스플라이스 부위를 만들고 결과 단백질의 비정상적 연장을 생성한다고 예측했다. DeepMind는 실험 스크리닝이 예측된 메커니즘을 검증하고 유사한 효과를 보이는 인근 변이를 식별했다고 밝혔다. 검증 근거를 제공한 것은 원래 모델 점수가 아니라 실험이었다.
별도 분석에서 University of Exeter 연구자 Gareth Hawkes는 54,000명 이상의 UK Biobank 참가자로부터 얻은 전장 게놈 데이터에 Atlas를 적용했다. DeepMind는 희귀 비코딩 변이를 예측 분자 효과별로 그룹화했을 때 비교 접근법보다 검출 가능한 유전 연관성이 22% 더 많이 생성됐다고 보고했다.
한 분석은 526개의 초기 후보를 포함한 영역을 우선순위가 정해진 변이 4개로 줄였다고 전해진다. 이 연구는 PLA2G7 및 EGLN1을 포함한 단백질의 순환 수준과 연관된 조절 후보를 식별했다.
체질량지수 분석에서 Hawkes는 Atlas가 가장 큰 영향을 미치는 것으로 순위화한 비코딩 변이 1%로 검색을 제한했다. 이 과정은 추가 조사가 필요한 게놈 영역 19개를 식별했다. 이러한 연관성은 연구 대상을 확립하는 것이며, 강조된 변이가 각각 체질량 변화를 유발한다는 것을 입증하지는 않는다.
Stowers Institute for Medical Research의 연구자들은 크로마틴 접근성과 유전자 활성화에 관여하는 조절 서열을 연구하기 위해 모티프 리소스도 사용했다. 이는 질병 변이 순위화 외 Atlas의 두 번째 활용 방식을 보여준다. 즉, 유전자 활동을 제어하는 기본 규칙을 조사하기 위해 대규모로 예측 효과를 질의하는 것이다.
5. 접근 조건과 과학적 한계
AlphaGenome Atlas는 학술 및 기타 비상업 연구용으로 무료 웹사이트를 통해 제공된다. DeepMind는 AlphaGenome API와 Google Antigravity용 AlphaGenome Atlas 스킬을 통한 접근도 안내한다. Google Cloud를 통한 상업용 Atlas 접근은 출시 시점에 곧 제공될 예정이라고 설명됐으며, 기본 AlphaGenome 모델에는 이미 유료 허용 목록 기반 Google Cloud 배포 경로가 있다.
공개 API의 약관은 명시적으로 허용된 경우를 제외하고 AlphaGenome 출력과 Atlas 정보를 비상업적 용도로 제한한다. Google은 또한 출력물을 다른 머신러닝 모델 훈련에 사용해서는 안 된다고 명시한다.
가장 중요한 점은 AlphaGenome이 임상 진단 용도로 의도되거나 승인된 것이 아니라는 것이다. 예측은 환자 근거, 실험실 검증, 임상 해석 또는 의학적 조언을 대체할 수 없다.
모델의 100만 염기 입력은 이전 서열 모델과 비교해 크지만, 조절 요소는 먼 거리에서도 유전자에 영향을 미칠 수 있다. DeepMind의 Nature 논문은 100,000개 염기쌍 이상 떨어진 영향력을 정확하게 포착하는 일이 여전히 어렵다고 밝혔다. 조직 특이적 및 조건 특이적 효과도 일관되게 재현하기 어렵다.
AlphaGenome은 한 사람의 완전한 게놈이 초래하는 결과를 예측하도록 설계되거나 벤치마크되지 않았다. 복합 형질과 질병은 직접적인 서열-분자 기능 모델의 범위를 벗어나는 여러 변이, 발달, 유전자 기능 및 환경 요인에 좌우될 수 있다.
따라서 Atlas는 증거 기준이 아니라 가설 선택의 비용과 속도를 바꾼다. 수십억 개 후보 치환의 순위를 정하고 예측 메커니즘을 즉시 드러낼 수 있지만, 중요한 발견에는 여전히 집단 근거, 독립적인 계산 검증 및 실험적 확인이 필요하다.
자주 묻는 질문
AlphaGenome Atlas에는 무엇이 포함되어 있나요?
인간 참조 게놈에서 가능한 약 90억 개 단일 뉴클레오타이드 치환에 대한 사전 계산된 분자 효과 예측과 AVI 점수가 포함되어 있다.
가능한 변화가 왜 90억 개인가요?
게놈에는 약 30억 개 위치가 있으며, 각 위치의 참조 문자는 세 가지 대체 DNA 문자로 바뀔 수 있다.
Atlas는 모든 유형의 유전 돌연변이를 포괄하나요?
아니다. 90억 개 변이 카탈로그는 단일 문자 치환을 포괄하며, 개인 게놈에서 발견되는 모든 삽입, 결실, 구조 변이 또는 변화의 조합을 포괄하지는 않는다.
의사가 AVI 점수를 사용해 환자를 진단할 수 있나요?
아니다. Google은 AlphaGenome 예측이 이론적 모델링과 연구를 위한 것이며 임상 의사결정에 사용해서는 안 된다고 명시한다.
연구자는 Atlas에 어떻게 접근할 수 있나요?
비상업 연구자는 브라우저 기반 포털 또는 AlphaGenome API를 사용할 수 있다. DeepMind는 Google Antigravity용 Atlas 스킬도 제공하며 Google Cloud를 통한 상업적 제공을 계획하고 있다.
참고 자료
Share