단백질에 '투명 도장' 찍는 기술, 딥마인드가 만든 신스아이디 바이오(SynthID Bio)
AI가 설계한 단백질이 실제 실험실에서 작동하는지 가짜인지 구분 못 해 생물보안 구멍이 뚫릴 위기였습니다. 딥마인드는 단백질 서열과 3D 구조에 생물학적 기능을 해치지 않는 워터마크를 심는 '신스아이디 바이오'로 이 문제를 해결했습니다. 이 자료는 단백질 바인더 설계와 폴딩 예측 두 분야에서 워터마크가 실제 습식 실험과 예측 정확도 검증을 모두 통과했음을 보여줍니다.
생성형 AI가 신약 후보 단백질을 뚝딱 만들어내는 시대, '이 단백질이 AI가 만든 건지 사람이 만든 건지' 증명 못 하면 생물보안 검색대를 그대로 통과해버립니다. 구글 딥마인드가 내놓은 신스아이디 바이오(SynthID Bio)는 단백질이라는 생물학적 실물 자체에 지워지지 않는 서명을 박아 넣으면서도, 약효 같은 본연의 기능은 그대로 살려낸 첫 기술입니다.
신스아이디 바이오(SynthID Bio)란 무엇인가요
SynthID Bio는 딥마인드가 개발한 워터마크 기술로, 단백질의 서열과 구조 양쪽에 눈에 띄지 않는 서명을 삽입합니다. 이 서명은 디지털 모델뿐 아니라 실제 합성된 물리적 단백질에서도 검증이 가능해, 생물보안과 연구 무결성을 강화하는 핵심 도구가 됩니다.
워터마킹 방식은 데이터 종류에 따라 조정됩니다. 서열 워터마크는 아미노산 선택을 미묘하게 바꾸고, 구조 워터마크는 3D 좌표를 조정해 신뢰할 수 있는 신호를 만듭니다. 실험 결과, 이러한 조정이 단백질의 생물학적 기능을 손상시키지 않았으며, 치료 및 연구에 활용 가능한 물리적 단백질을 만들 수 있었습니다.
| 항목 | 설명 |
|---|---|
| 단백질 서열 워터마크 | 아미노산 선택을 미묘하게 조정 |
| 단백질 구조 워터마크 | 3D 좌표를 조정 |
왜 필요할까요?
AI 기반 단백질 설계는 기존 DNA 합성 스크리닝을 우회할 수 있고, 잘못된 구조가 공공 데이터베이스를 오염시킬 위험이 있습니다. SynthID Bio는 이러한 위험을 최소화하고, 연구 데이터의 신뢰성과 보안을 확보합니다.
왜 지금 단백질 워터마크가 필요한가요
AI가 단백질 설계에 혁신을 가져왔습니다. 딥마인드의 AlphaProteo와 ProteinMPNN 같은 생성 모델은 새로운 단백질을 빠르게 만들어내고, AlphaFold 3는 정확한 3D 구조를 예측합니다. 하지만 이 기술들이 기존의 DNA 합성 스크리닝 절차를 우회할 수 있다는 점이 큰 문제로 떠오르고 있습니다. AI가 만든 서열이 검증 없이 합성되면, 실제 실험에서 예상치 못한 특성을 보일 수 있으며, 실험실에서 재현할 수 없는 단백질이 생길 위험이 커집니다.
또한, AI가 생성한 3D 구조가 공개 데이터베이스에 잘못 기재되면, 그 구조를 바탕으로 하는 후속 연구가 잘못된 정보를 기반으로 진행될 수 있습니다. 이는 과학적 신뢰성을 해치고, 실제로는 존재하지 않는 단백질을 대상으로 한 연구가 이어질 수 있어, 전체 연구 커뮤니티에 부정적 영향을 미칩니다. 따라서 단백질에 ‘투명 도장’을 찍어 원본과 변조를 구분할 수 있는 기술이 절실히 요구됩니다.
워터마크를 심는 두 가지 방식: 서열 vs 3D 구조
SynthID Bio는 AI가 생성한 단백질에 눈에 띄지 않는 서명을 삽입해 물리적 단백질에서도 검증이 가능하도록 설계되었습니다. 서열 워터마크는 SynthID Bio‑Enabled ProteinMPNN을 활용해 아미노산 선택을 미묘하게 유도함으로써 서열에 ‘신호’를 삽입합니다. 이 방식은 생성 모델이 제공하는 서열을 그대로 사용하면서도, 물리적 단백질 합성 시에도 서명 검출이 가능하도록 합니다.
구조 워터마크는 AlphaFold 3의 디퓨전 네트워크 중 일부를 미세 조정하여, 모델 가중치 자체에 서명을 심습니다. 결과적으로 예측된 3D 좌표가 누구든지 모델을 실행해도 자동으로 ‘시그널’을 내포하게 됩니다. 이 방법은 구조적 특성 분포를 거의 그대로 유지하면서, 디지털 노이즈나 좌표 변동에도 견고한 검출성을 제공합니다.
- 서열 워터마크는 단백질 생성 단계에서 바로 적용 가능
- 구조 워터마크는 모델 예측 단계에서 서명 삽입
- 두 방법 모두 물리적 단백질에서도 검출 가능
- 생물학적 기능 유지가 핵심 목표
실제 실험실 검증: VEGF-A·스파이크·PD-L1 바인더 결과
우리는 VEGF‑A, SARS‑CoV‑2 스파이크 단백질 RBD, 그리고 PD‑L1이라는 세 가지 표적 단백질에 대해 바인더를 설계했습니다. 각 표적에 대해 워터마크가 삽입된 디자인과 삽입되지 않은 디자인을 모두 만들고, AlphaProteo와 SynthID Bio‑활성화 버전 ProteinMPNN을 사용해 서열을 생성했습니다. 만든 바인더들을 실제 실험실(습식 실험)에서 발현·정제한 뒤, 결합률(히트율), 결합 친화도(KD), 그리고 서열 다양성을 측정했어요.
그 결과, 워터마크가 들어간 바인더는 워터마크가 없는 바인더와 동등한 성능을 보였습니다. 히트율은 거의 차이가 없었고, KD 값도 두 그룹 간에 차이가 없으며, 서열 다양성 역시 비워터마크 설계와 동일했습니다. 즉, 눈에 보이지 않는 서명을 넣어도 단백질의 생물학적 기능은 전혀 손상되지 않았다는 것을 입증했어요.
디자인
AlphaProteo와 SynthID Bio‑활성화 ProteinMPNN으로 워터마크 포함·미포함 바인더 서열 생성
발현·정제
합성된 서열을 세포에 발현시켜 단백질을 정제
결합 테스트
표적 단백질과의 결합률, KD, 서열 다양성 측정
왜 이 결과가 중요한가요?
워터마크가 실제 단백질 기능을 방해하지 않으면, 연구자는 합성 단백질에 신뢰성 있는 ‘디지털 서명’을 남길 수 있습니다. 이는 데이터 위변조 방지와 생물안보 강화에 큰 도움이 돼요.
- VEGF‑A 바인더
- SARS‑CoV‑2 스파이크 RBD 바인더
- PD‑L1 바인더
구조 예측 쪽 정확도·탐지율·내노이즈 성능 한눈에 보기
| 항목 | 성능 |
|---|---|
| AlphaFold 3 정확도 | 유지 |
| 주요 구조 분포 | 보존 |
| 디지털 노이즈 견딤 | 가능 |
| 좌표 변형 견딤 | 가능 |
이러한 정량적·정성적 지표는 실험적으로 세 가지 타깃 단백질(VEGF‑A, SARS‑CoV‑2 스파이크 RBD, PD‑L1)에서 검증되었습니다. 각각의 워터마크 단백질은 비워터마크 버전과 동일한 결합 친화도와 자연 서열 다양성을 보였으며, 실험실 테스트에서도 기능적 손실 없이 검출이 가능합니다.
도입 전 체크할 주의점과 다음 단계
SynthID Bio를 실무에 도입하기 전에 가장 먼저 확인해야 할 점은 오픈소스 공개 여부와 모델 가중치 배포 방식입니다. 공개 소스가 아니라면, 내부에서 직접 검증 및 수정이 어려워 실험실에서의 재현성이 떨어질 수 있으며, 가중치가 외부에 공개되지 않는 경우에는 타 연구팀이 동일한 워터마킹 기능을 재현하거나 검증할 수 없게 됩니다. 따라서 오픈소스로 제공되는 경우에는 소스와 가중치를 모두 확보하고, 비공개라면 해당 모델이 제공하는 API 수준에서의 접근 권한과 보안 인증 절차를 명확히 해야 합니다.
다음으로는 SynthID Bio가 기존 단백질 설계 도구와의 호환성을 검토해야 합니다. 예를 들어 AlphaProteo와 ProteinMPNN의 워터마크 기능을 활용하려면, 두 도구가 지원하는 서열 형식이나 구조 파일 포맷이 일치해야 합니다. 또한, 워터마크 삽입 과정에서 서열이나 3D 좌표가 미세하게 변형되더라도, 사용 중인 모델이 그 변형을 그대로 반영하도록 설계되어야 하며, 이는 구조 예측 정확도와 바인딩 특성에 미치는 영향을 최소화합니다. 마지막으로, 규제와 관련해서는 생체윤리와 바이오보안 기준을 충족하는지, 그리고 데이터베이스에 공개될 때 워터마크가 식별 가능하도록 필요한 메타데이터를 함께 제공하는지를 확인해야 합니다.
| 고려 요소 | 예시 |
|---|---|
| 오픈소스 여부 | 공개 vs 비공개 |
| 가중치 배포 | API 제공 여부 |
| 도구 호환성 | AlphaProteo, ProteinMPNN |
| 규제 연계 | 생체윤리, 바이오보안 |