본문 바로가기
NGS & 유전체 산업

GRCh38로 재면 안 보이는 구멍 — Roche SBX는 substitution은 받고, indel은 못 받았다

by 웅곰박 2026. 8. 16.
반응형

Roche가 새 시퀀서 AXELIOS 1을 팔기 시작한 바로 그 주에, 워싱턴대(UW)와 SMaHT 컨소시엄이 숏리드 시퀀서 아홉 대를 다시 채점한 논문을 올렸다. 회사 쪽 이야기는 “하루 만에 전장을 읽는다”이고, 논문이 숫자로 받쳐 주는 것은 다른 한 줄이다. 염기 하나가 다른 염기로 바뀌는 오류(substitution)는 잘 잡히지만, 염기가 끼어들거나 빠지는 오류(indel)는 그렇지 않다.

무슨 일이 있었는가

시퀀서 오류를 재려면 “정답지”가 필요하다. 랩이 흔히 쓰는 정답지는 GRCh38이다. 여러 사람의 유전체를 섞어 만든 표준 인간 참조 유전체다. 문제는 정답지 자체가 틀린 자리와, 시퀀서가 틀린 자리가 한 점수로 붙는다는 점이다.

McGee 등(논문, preprint: 아직 동료 심사 전인 초고)은 그 둘을 나누려고 사람마다 따로 짠 참조본, DSA(donor-specific assembly, 기증자 맞춤 조립본)에 다시 정렬했다. HG002는 T2T Q100 컨소시엄이 만든 DSA다. COLO829BL은 SMaHT가 PacBio HiFi Fiber-seq, 아주 긴 리드 ONT, Illumina Hi-C로 새로 짠 DSA다. 아홉 케미스트리, 일곱 대 시퀀서. 2026년 6월 28일 bioRxiv. 피어리뷰(동료 심사)는 아직 없다.

그 목록에 Roche Axelios의 SBX-D가 들어 있다. SBX는 Sequencing-by-Expansion이다. DNA나 RNA를 약 50배 긴 Xpandomer(팽창 고분자)로 바꾼 뒤, 재사용 CMOS 나노포어로 읽는 방식이다. 논문 Methods는 기기를 “prototype Axelios systems”(시제품)로 적는다. 라이브러리는 SBX-D SOP LP.11, 입력 50 ng.

Roche의 베이스퀄리티(BQ, 이 염기를 얼마나 믿을지 매긴 점수)는 흔한 Phred 점수와 다르다. 한 가닥만 읽으면(simplex) 22, 두 가닥이 같으면(duplex 일치) 39, 두 가닥이 다르면 5, 호모폴리머(같은 염기가 이어진 구간)에서 불일치가 있으면 25. 그래서 필터 없는 1차 순위에는 SBX-D가 빠지고, BQ 30 이상만 남긴 비교에서야 들어온다. 그 필터는 duplex가 일치한 염기만 남긴다.

사흘 뒤인 2026년 6월 29일, 회사 PR은 AXELIOS 1 상업 출시를 알렸다. 셀링포인트는 연구 워크플로에서 하루 만에 전장(한 사람의 유전체 전체)을 읽고, 몇 시간 단위로 결과가 나온다는 것이다. Hartwig, Broad Clinical Labs, 10x, DeepVariant, XOOS 이름을 걸었다. 임상 사용은 future/potential(앞으로의 가능성)이다. 기기 자체는 Research Use Only, 연구용이다. PR 본문에는 Q스코어(품질 점수), Gb당 가격, indel 숫자가 없다.

한 달 뒤 Element Biosciences 회사 블로그(벤더 해석, 2026-07-27)가 이 프리프린트를 다시 그렸다. 글쓴이 Brian Coullahan은 논문 Acknowledgements에도 있다. 블로그 한 줄은 “최저 에러는 UltraQ, SNV와 indel 모두”다. SNV는 single nucleotide variant, 염기 하나짜리 변이이고 여기서는 substitution과 같은 층이다. 논문 표는 그 한 줄을 받쳐 주지 않는다.

랩이 받을 질문은 단순하다. 새 화학의 출시 문장을, 출시 직후 나온 미스매치 표가 어디까지 받쳐 주는가.

발표 원문은 무엇인가

네 종류의 문서를 한 덩어리로 읽으면 안 된다.

  1. 논문(preprint) — 2026년 6월 28일. McGee SR et al. Short-Read Sequencing Benchmarking with Donor-Specific Assemblies. bioRxiv 2026.06.24.734333. “This article is a preprint and has not been certified by peer review.” https://www.biorxiv.org/content/10.64898/2026.06.24.734333v1
  2. 회사 PR — 2026년 6월 29일. Roche, AXELIOS 1 출시. https://www.roche.com/media/releases/med-cor-2026-06-29
  3. 제품 스펙 — AXELIOS 1 제품 페이지와 스펙시트 MC-US-18900 v1.0.0626. Q38, 1.8 Tb, 16 genomes는 여기에만 있다. PR 본문에는 없다. https://diagnostics.roche.com/global/en/products/systems/axelios-1-sys-597.html
  4. 회사 블로그(벤더 해석) — 2026년 7월 27일. Element Biosciences, Brian Coullahan. https://www.elementbiosciences.com/blog/measuring-what-actually-matters-the-quest-for-unbiased-sequencing-benchmarks

논문 Acknowledgements는 Element와 Roche Sequencing Solutions 직원 이름을 숨기지 않는다. 데이터 제공과 지원을 밝힌 벤치마크이지, 마케팅용 “완전 독립” 문장은 논문에 없다. Competing interests(이해충돌)는 E.E.E.(Variant Bio SAB), J.T.B.(Mosaica 컨설턴트)만 적혀 있다.

기술적으로 무엇이 달라졌는가

달라진 것은 시퀀서 한 대가 아니라, 오류를 재는 분모다.

논문이 DSA에서 만든 151 bp 페어엔드(양쪽 끝을 짝으로 읽는 짧은 리드)를 GRCh38에 올리면 SNMR 1.57, 삽입 93.70, 삭제 91.18이 남는다. SNMR은 substitution mismatch rate다. 읽은 염기 가운데 정답과 다른 염기로 바뀐 비율이다. 같은 가짜 리드를 DSA에 올리면 셋 다 0.00이다. GRCh38 점수의 상당 부분은 시퀀서 오류가 아니라 참조 유전체가 틀린 자리, 레퍼런스 바이어스였다.

필터 전, SBX-D를 뺀 여덟 플랫폼을 DSA에 올리면 SNMR은 약 0.5–3.6으로 떨어진다. 논문 본문: PacBio Onso 0.5–0.6, Ultima ppmSeq 0.6–0.9, NovaSeq 6000 3.5–3.6(Onso의 약 7배). Element UltraQ는 표준 AVITI보다 2–3배 낫다. 삽입·삭제는 대부분 백만 염기당 10사건 아래로 떨어지고, UltraQ는 삽입·삭제 모두 3×10⁻⁶ 미만이다. 백만 염기당 3번보다 적다는 뜻이다. Ultima UG100·ppmSeq는 약 1,000–2,000×10⁻⁶로 남는다. 이 표에 Roche는 없다.

Roche가 들어오는 자리는 BQ 30 이상, DSA, 아홉 플랫폼이다. 논문 본문: 이 임계값은 Onso에서 염기 약 1%, UG100에서 17%를 버리고 SNMR을 70–99% 낮춘다. 남은 SNMR은 2.4×10⁻⁵에서 3.5×10⁻⁴. “Roche SBX-D consistently achieving the lowest SNMRs.” 보충 Table S5 원숫자(헤더 SNMR ×10⁻³): HG002에서 Roche 24.07, UltraQ 34.91, NovaSeq X 151.98, UG100 350.81. 본문 단위로 각각 2.41×10⁻⁵, 3.49×10⁻⁵, 1.52×10⁻⁴, 3.51×10⁻⁴/base. 한 줄로 말하면, 필터를 건 뒤 substitution만 보면 Roche가 1위다.

삽입은 반대다. 같은 표에서 대부분 플랫폼은 백만 염기당 1.6–5.3사건. Roche는 30.54–30.95, Ultima는 약 28–38. 논문 본문은 Roche를 “31 events per 10⁶ bases sequenced”로 적고, 초록은 Ultima와 Roche를 가장 강한 indel 바이어스로 묶는다. UltraQ 1.65–2.37과 나누면 약 13–19배다. 삭제(염기가 빠지는 쪽)의 고퀄리티 율은 논문이 계산하지 않았다. 지워진 염기의 퀄리티를 일관되게 정할 수 없어서다.

저복잡도 구간에서는 구멍이 더 커진다. LCR(low-complexity region)은 같은 패턴이 반복되는 구간이다. 호모폴리머나 탠덤 반복이 여기 들어간다. 논문은 GA4GH 정의를 DSA 좌표로 옮겨 썼다. Table S7, BQ≥30, 삽입 ×10⁻³: Roche LCR 212.35–262.33, UltraQ LCR 6.45–59.59. substitution은 둘이 비슷하거나 Roche가 약간 높다. 논문 본문은 Roche LCR 삽입을 이 숫자로 문장화하지 않는다. 표에만 있다.

컨텍스트도 균질하지 않다. 논문: Illumina, Ultima, Roche는 A/T 편향 미스매치가 가장 뚜렷하다. COLO829BL에서 Roche 미스매치의 46%가 A→G 또는 T→C다. 네 가지 염기가 고르다면 약 16%여야 한다. 약 2.9배다. “Q가 높다”와 “에러가 고르다”는 다른 문장이다.

출시 쪽 숫자는 다른 벤치마크에 앉아 있다. 제품 스펙은 SBX-D 4시간 런당 일치 duplex 1.8 Tb 이상, 약 Q38, 4시간에 인간 전장 약 16개(30× 중앙값, 중복 제거 일치 duplex), 하루 64개, 시퀀싱 장비 1런 약 5.5시간을 적는다. Q38은 대략 오류 1/6,300 수준으로 읽는 품질 점수다. 각주는 GIAB 고신뢰 구간, BWA 정렬이다. DSA가 아니다. 스펙시트의 “robust SNV and indel F1”에는 숫자가 없다. F1은 맞춘 변이와 놓친 변이를 한 점수로 묶은 값이다. 회사 PR은 이 표 숫자를 본문에 넣지 않고, same-day와 hours만 쓴다.

정리하면 논문은 Roche duplex substitution을 최상위로 받쳐 주고, indel·LCR 삽입·전이 편향에서는 약점을 숫자로 보여 주며, 속도·처리량·가격·Q38·임상은 침묵한다.

NGS 실무자에게 왜 중요한가

플랫폼을 Q30 한 줄로 고르는 관행이 이 표에서 깨진다. 같은 BQ 30 이상을 걸어도 버려지는 염기 비율이 Onso 약 1%에서 UG100 17%까지 벌어진다. 남은 염기의 substitution과 삽입이 같은 방향으로 움직이지 않는다. Roche SBX-D는 필터 후 substitution 1위이고, 삽입은 Ultima와 같은 칸이다.

희귀 체세포 변이, 낮은 빈도의 삽입, 호모폴리머·반복 구간을 먹는 파이프라인은 그 갈림을 설계에 넣어야 한다. MSI, EGFR exon 19/20 결실, BRCA 프레임시프트를 SBX-D의 “practical barrier”로 연결한 문장은 논문에 없다. 회사 블로그(벤더 해석)가 붙인 응용 서사다. 논문이 보여 주는 것은 더 좁다. LCR 삽입이 다른 케미스트리보다 수십 배 남고, 삭제 율은 아예 안 잰다. 그 구간을 쓰는 랩은 교차 확인과 필터를 플랫폼별로 다시 짜야 한다. 진단·치료 결정은 이 글의 범위가 아니다.

레퍼런스도 실무 변수다. 논문은 DSA가 베이스퀄리티 재보정에도 필요하다고 적는다. GRCh38로 맞춘 BQ 모델은 참조 유전체 오류를 샘플 오류로 학습할 수 있다. 종양과 정상 조직을 짝으로 보거나 희귀 구조 변이를 보는 랩일수록, “표준 인간 참조본에 올린 Q”와 “그 사람의 조립본에 올린 미스매치”를 같은 점수로 취급하면 안 된다. COLO829BL DSA는 배양 중 생긴 체세포 변이와 아직 안 풀린 조립 아티팩트가 남아 SNMR이 더 높다고 논문이 한계로 적는다. HG002 숫자가 더 깨끗한 쪽이다.

출시 문장을 구매 체크리스트에 옮길 때도 분리가 필요하다. same-day 전장, 4시간 1.8 Tb, Q38은 Roche 제품 스펙과 내부 검증이다. 이 프리프린트는 그것을 재현하지 않았다. 반대로 “새 화학이 substitution에서 일루미나·엘리먼트와 붙는다”는 문장은 Table S5가 받쳐 준다. 다만 그 1위는 prototype, SBX-D, BQ 30 이상, duplex 일치 염기 위에서다. 필터 없는 원데이터 최저 에러로 옮겨 쓰면 논문과 어긋난다.

한국 설치, 국내 정가, 필드 수율은 출시 PR과 논문 어디에도 없다. 스펙시트의 센서 20회 재사용, 브로셔의 90일도 이 실험의 측정이 아니다. 논문 보충이 적는 30× 전장 150달러, 시간당 7개 전장은 Roche PR에 없고 이 실험도 아니다.

아직 확인되지 않은 것은 무엇인가

피어리뷰 전이다. bioRxiv v1이고, TRiP와 공개 코멘트는 0이다. 저널 게재 표시는 없다.

논문이 돌린 것은 prototype Axelios다. 6월 29일 상업용 AXELIOS 1과 하드웨어, 케미스트리, 소프트웨어가 같은지는 이 논문에 없다. SBX-S(초고처리량 모드)는 논문이 안 돌렸다. 제품만 언급한다.

BQ 30 이상 이후 남은 염기가 플랫폼 사이에 동등한지는 논문이 비율만 준다. Onso 약 1%, UG100 17%. “같은 비율을 버렸다”는 Element 블로그 문장은 논문과 모순이다. 삭제 에러율은 고퀄리티 구간에서 비어 있다.

Table 1(수율, 리드 길이, 매핑률, 데이터 출처)과 Table S6(어떤 염기 다음에 어떤 오류가 나는지 원표)은 PDF 이미지라 선택 텍스트가 없다. 본문이 글로 확정한 것만 썼다. raw 29–1040 Gb, 매핑 95% 초과, 리드 길이 중앙 150–316 bp. Roche 매핑이 타사보다 낮은지, COLO829BL Roche 데이터가 랩 내부인지 벤더인지는 표 이미지를 다시 열기 전 확정하지 않는다.

한국 공급, 국내 정가, 필드 수율, Hartwig와 Broad가 본 정확도·속도의 원데이터, DeepVariant와 10x 키트 성능은 미확인이다. Q38을 DSA SNMR로 환산하지 않았다.

반응형