AI News글자 수 4139읽는 시간11

향후 Claude 모델, EU AI 법 규정에 따라 전 세계 텍스트에 워터마크 적용

Anthropic은 향후 Claude 모델에 SynthID 기반 텍스트 워터마크와 C2PA 파일 자격 증명을 전 세계적으로 추가할 예정이다.

Anthropic은 향후 Claude 모델에 기계 판독 가능한 출처 신호를 내장해, 생성된 텍스트에는 통계적 워터마크를 추가하고 지원되는 파일에는 서명된 C2PA 메타데이터를 첨부할 예정이다. 이 변경은 유럽연합의 AI 법을 준수하기 위한 것이지만, Anthropic은 텍스트 워터마크를 유럽 사용자로 제한하지 않고 전 세계에 적용할 계획이다.

이 정책은 2026년 8월 2일 이후 EU에서 출시되는 Claude 모델에 적용된다. 해당 모델은 출시 시점부터 마킹을 지원하며, Anthropic은 그 날짜 이전에 출시된 모델에도 향후 몇 달 동안 시스템을 확대 적용하기 위해 작업하고 있다고 밝혔다. 회사는 첫 구현 대상이 될 특정 신규 Claude 모델의 이름은 밝히지 않았다.

워터마크는 응답의 라벨, 숨겨진 Unicode 문자, 또는 추가 줄로 표시되지 않는다. 대신 Claude가 생성 중 토큰을 선택하는 데 사용하는 통계적 과정을 변경한다. Anthropic은 이것이 의미, 가독성, 지연 시간, 가격에 영향을 주지 않아야 한다고 말했지만, 아직 Claude 전용 탐지기, 임계값, 오탐률 또는 전체 기술 평가를 공개하지 않았다.

1. 마킹은 Claude 제품과 클라우드 액세스를 포괄한다

Anthropic은 지원되는 모델이 Claude 소비자 서비스, Claude Platform API, Claude Code, Claude Cowork, Claude Tag 전반에 걸쳐 텍스트 워터마크를 적용한다고 밝혔다. 해당 모델에 AWS, Google Cloud 또는 Microsoft Foundry를 통해 액세스하는 경우에도 워터마크가 적용된다.

특정 사용자 인터페이스에 의존하지 않는다는 점에서 이러한 모델 수준 구현은 중요하다. API를 호출하는 개발자와 Claude를 직접 사용하는 사람은 지원되는 모델을 사용할 때 동일한 워터마킹 과정을 통해 생성된 텍스트를 받아야 한다.

출시는 전 세계적으로 이뤄진다. Anthropic은 아직 이 메커니즘을 지역별로 제한할 지속 가능한 방법이 없으므로, 지원되는 모델은 Claude가 제공되는 모든 곳에서 텍스트를 마킹한다고 밝혔다. 이에 따라 EU 규정 준수 요건은 EU 외부 Claude 사용자와 개발자에게도 제품 변경으로 적용된다.

이 광범위한 범위에는 몇 가지 단서가 있다. 서명된 파일 메타데이터는 모든 클라우드 플랫폼, 제품 기능 또는 파일 유형에서 제공되지 않을 수 있다. 기존 Claude 모델도 Anthropic이 업데이트할 때까지는 마킹되지 않은 상태로 남을 수 있다. 따라서 탐지 가능한 마크가 없다는 사실만으로 어떤 문단이 Claude 없이 생성되었다고 확정할 수는 없다.

Anthropic은 워터마크에 텍스트를 생성한 사용자, 조직, 계정 또는 대화에 관한 정보가 포함되지 않는다고 밝혔다. 이는 개인 출처가 아니라 Claude의 생성 과정과 연관된 통계적 패턴을 식별한다. 또한 이 메커니즘은 추가 출력 토큰을 생성하지 않으므로, Anthropic은 사용 요금이 증가하지 않는다고 밝혔다.

2. Claude는 SynthID-Text의 한 버전을 사용한다

Claude의 텍스트 워터마크는 Google DeepMind가 2024년 Nature 논문에서 설명하고 이후 다른 모델 개발자에게 제공한 SynthID-Text 방법에 기반한다.

언어 모델은 일반적으로 앞선 텍스트에 조건화된 확률 분포에서 다음 토큰을 하나씩 선택한다. 많은 문장에는 여러 선택지가 비슷하게 적절할 수 있는 지점이 존재한다. 워터마킹 시스템은 이러한 선택지를 활용해 가시적 기호나 별도 메타데이터 필드를 삽입하지 않고도 반복적인 통계 패턴을 만들 수 있다.

Anthropic은 자사의 구현이 비공개 키와 앞선 단어를 사용해 적격 선택지에 사용되는 무작위성의 출처를 결정한다고 설명한다. 관련 키에 접근할 수 있는 탐지기는 문단을 검사하고 그 토큰 시퀀스가 Claude의 워터마크 생성 과정과 얼마나 일관적인지 점수화할 수 있다.

Google의 참조 구현은 SynthID-Text를 top-k 및 top-p 필터링 이후 적용되는 logits processor로 설명한다. 의사난수 함수가 모델의 어휘 전반에 점수를 할당하고, 워터마킹 구성은 토큰 선택에 영향을 준다. 추가 모델 학습은 필요하지 않지만 키와 구성은 비공개로 유지되어야 한다. 그렇지 않으면 제3자가 신호를 재현할 수 있기 때문이다.

따라서 워터마크는 생성된 문구의 일부이며, 일반적으로 복사 및 붙여넣기 후에도 유지된다. 가벼운 편집이나 발췌문에도 탐지 가능한 상태를 유지할 만큼 충분한 패턴이 남을 수 있다. 철저한 재작성, 번역 또는 다른 텍스트와의 혼합은 탐지기의 신뢰도를 낮추거나 사용 가능한 신호를 제거할 수 있다.

워터마크 밀도는 작업에 따라 달라진다. 개방형 산문에는 중요도가 낮은 단어 선택지가 많지만, 사실적 답변에는 대안보다 하나의 완성이 명백히 더 정확한 토큰이 더 많다. Anthropic은 워터마킹 유도가 정확성을 해칠 수 있는 경우 이를 적용하지 않겠다고 밝혔다.

같은 한계는 소스 코드에도 적용된다. 정확한 구문, 식별자, 프로그램 동작은 서로 바꿔 쓸 수 있는 토큰 선택지의 수를 제한하므로, 코드는 산문보다 탐지 가능한 워터마킹이 적을 수 있다. 주석이나 기타 임의의 문구에는 여전히 패턴이 담길 수 있다. Claude가 사람의 원래 표현 대부분을 보존하는 교정 작업도 신호가 거의 남지 않을 수 있는 반면, Claude가 번역된 출력의 모든 단어를 선택하므로 번역에는 워터마크가 포함될 가능성이 더 높다.

3. 파일에는 텍스트 기법이 아닌 C2PA 메타데이터를 사용한다

SVG, PNG, JPEG 출력과 같은 지원 파일에 Anthropic은 Coalition for Content Provenance and Authenticity 표준을 따르는 작은 암호학적으로 서명된 출처 기록을 첨부할 예정이다.

C2PA 자격 증명은 파일의 출처와 처리 이력에 관한 정보를 기록한다. 호환되는 검증 도구는 서명된 기록을 검사하고 파일이 해당 기록과의 암호학적 관계를 깨뜨리는 방식으로 변경되었는지 판단할 수 있다.

이 메커니즘은 Claude의 텍스트 워터마크와는 다르다. C2PA 정보는 픽셀이나 문구에 통계적으로 인코딩되는 것이 아니라 파일의 메타데이터에 존재한다. 이는 Claude가 파일을 생성하거나 처리했음을 시사할 수 있지만, 파일 안의 모든 요소가 Claude에서 비롯되었음을 확정하지는 않는다.

메타데이터는 텍스트 수준의 통계 패턴보다 더 쉽게 사라질 수도 있다. Anthropic은 형식 변환, 재저장, 스크린샷 촬영 또는 기타 처리로 인해 파일의 자격 증명이 제거될 수 있다고 경고한다. 일부 플랫폼은 처음부터 메타데이터를 보존하거나 지원하지 않을 수 있다.

따라서 자격 증명이 없다고 해서 Claude가 파일에 아무 역할도 하지 않았다는 증거는 아니다. 반대로 유효한 자격 증명은 기록된 처리 이벤트만 입증할 뿐, 콘텐츠가 정확한지, 더 넓은 편집적 의미에서 진정성 있는지, 또는 주로 사람이 작성했는지에 대한 판단은 아니다.

4. 탐지는 여전히 확률적이며 Claude API는 아직 제공되지 않는다

Anthropic은 워터마크 탐지 API를 제공할 예정이라고 밝혔지만, 8월 27일 현재 해당 API, 출시일, 결정 임계값 또는 상세한 Claude 전용 성능 결과를 공개하지 않았다. 도움말 문서에는 추가 기술 지침이 제공될 예정이라고 적혀 있다.

이 누락된 정보 때문에 Claude의 오탐 확률을 정확히 평가할 수 없다. SynthID-Text 탐지는 본질적으로 확률적이며, Google의 공개 구현은 “watermarked”, “not watermarked”, 또는 “uncertain”을 반환할 수 있다. 운영자는 오탐과 미탐 사이의 균형을 맞추기 위해 임계값을 구성한다.

Anthropic의 탐지기는 제한된 질문에 답할 것이다. 즉, 제출된 텍스트의 적어도 일부를 만드는 데 Claude가 관여했을 가능성이 얼마나 높은지다. 전체 문서를 Claude가 작성했음을 증명하거나, 생성과 대규모 편집을 구분하거나, 사용자를 식별하거나, 다른 워터마킹 키를 사용하는 관련 없는 모델이 생성한 텍스트를 탐지하지는 못한다.

긍정적 결과는 기저 아이디어나 원래 문구가 사람에게서 나온 자료에도 적용될 수 있다. Claude가 해당 자료를 번역, 요약, 재형식화 또는 대폭 편집했을 수 있다. 부정적 결과 역시 문단이 너무 짧거나, 크게 재작성되었거나, 다른 글과 섞였거나, 이전 Claude 모델에서 생성되었거나, 지원되지 않는 표면을 통해 생성되었을 수 있으므로 결론을 내릴 수 없다.

Anthropic은 내부 테스트에서 콘텐츠, 창의성 또는 가독성에 영향이 없었다고 보고했지만, 근거가 되는 Claude 평가는 공개하지 않았다. 가장 가까운 공개 대규모 증거는 Google DeepMind의 SynthID-Text 연구로, 약 2,000만 건의 워터마크 적용 및 미적용 Gemini 응답에 대한 피드백을 비교해 사용자 평가에서 통계적으로 유의미한 차이가 없다고 보고했다. 이 결과는 일반적인 방법을 뒷받침하지만, 공개되지 않은 Anthropic 구현에 대한 독립적 측정은 아니다.

이러한 한계 때문에 탐지기는 고용, 교육, 표절 또는 징계 결정에서 독립적인 증거로 사용하기에 부적합하다. API가 제공된 이후에도 책임 있는 사용을 위해서는 공개된 임계값, 평가 데이터, 문단 길이, 언어, 편집 이력 및 기타 출처 증거가 필요하다.

5. 이 변경은 법적 마킹 요건을 구현한다

EU AI 법 제50조는 2026년 8월 2일부터 적용되기 시작했다. 이 조항은 생성형 AI 시스템 제공자가 기술적으로 가능한 범위 내에서 효과적이고, 상호운용 가능하며, 견고하고, 신뢰할 수 있는 기법을 사용해 합성 오디오, 이미지, 비디오 및 텍스트 출력을 기계 판독 가능한 형식으로 탐지 가능하게 만들도록 요구한다.

Anthropic은 AI 생성 콘텐츠의 투명성에 관한 EU 실천 강령에 서명한 조직 중 하나다. 이 강령은 자발적이지만, 기초가 되는 제50조 의무는 법적 구속력을 가진다. 유럽연합 집행위원회와 AI 위원회는 서명자가 규정 준수를 입증할 수 있는 체계로 이 강령을 인정했다.

제공자 측 마킹 요건은 가시적 공개를 규율하는 규칙과는 별개다. Anthropic과 같은 제공자는 적용 대상 시스템에 기계 판독 가능한 신호를 내장해야 한다. 배포자는 인적 검토와 편집 책임 등을 포함한 예외를 전제로, 딥페이크와 공익 사안에 대해 대중에게 알리기 위해 공개된 특정 AI 생성 또는 조작 텍스트에 추가 라벨링 의무를 부담한다.

다른 제품에 Claude를 내장하는 개발자의 경우, Anthropic의 모델 수준 워터마크는 필요한 출처 인프라의 일부를 제공할 수 있지만 개발자 자신의 규정 준수 의무를 해결해 주지는 않는다. Anthropic은 하위 단계 개발자에게 제50조가 자신의 제품과 서비스에 어떻게 적용되는지 평가하라고 명시적으로 조언한다.

자주 묻는 질문

모든 Claude 응답에는 이미 워터마크가 포함되어 있나요?

아니요. 이 약속은 2026년 8월 2일 이후 출시된 지원 모델에 적용되며, 이전 모델에 대한 마킹은 아직 개발 중입니다.

Claude 텍스트를 복사하면 워터마크를 제거할 수 있나요?

일반적인 복사 및 붙여넣기로는 단어 선택에 패턴이 인코딩되어 있으므로 워터마크가 유지되어야 합니다. 대폭 재작성하거나 번역하거나 다른 텍스트와 섞으면 탐지 가능한 신호가 약해지거나 제거될 수 있습니다.

워터마크로 Claude가 전체 문서를 작성했음을 증명할 수 있나요?

아니요. Claude가 관여했을 가능성을 나타낼 수는 있지만, 완전한 생성과 대규모 편집, 번역 또는 요약을 구분할 수는 없습니다.

워터마킹은 Claude의 토큰 사용량이나 가격을 높이나요?

Anthropic은 추가 토큰이 생성되지 않고 이 메커니즘이 생성 속도에 미치는 영향도 무시할 만하므로, 워터마크로 인해 가격이 변경되지 않는다고 밝혔습니다.

Claude의 워터마크 탐지기는 공개적으로 이용할 수 있나요?

아직 아닙니다. Anthropic은 탐지 API와 추가 기술 문서가 제공될 예정이라고 밝혔지만, 출시일이나 Claude 전용 오류율은 공개하지 않았습니다.

참고 자료

Share

이 글 공유