최신연구결과(해외)

General studyA multimodal artificial intelligence method for accurate diagnosis of autoimmune gastritis

관리자
2026-07-31
조회수 104

Cao Y, Jin X, Zhao Y, Zhang G, Ge W, Zhou J, Liu Y, Huang P, Zhang G, Han Y.

Dig Liver Dis. 2026 Jul 29:S1590-8658(26)00793-0. doi: 10.1016/j.dld.2026.07.005.


작년 9월에 "Development of a Multimodal Deep Learning Model for Early Diagnosis of Autoimmune Gastritis" 라는 연구계획서를 만들어 본 적이 있었는데, 역시 중국에서는 작년 10월에 이 논문을 제출하여 2026년 7월에 accept 시켰네요. 앞으로 내시경 검사 시 혈청검사나 조직검사를 함께 시행하면서 응용하면 내시경 검사의 정확도가 높아질 듯 싶습니다. 한 가지 가능하다면, 조직검사 결과지의 문구를 입력하기 보다 digital pathology 사진을 이용한 진단 정확도를 확인해 본다면 더 좋을 듯 싶습니다. 하지만, 중국의 연구 역량에 다시 한번 놀라게 되네요. 대단합니다. 내용 살펴 보겠습니다.


1. Introduction

자가면역성 위염(autoimmune gastritis, AIG)자가면역체계의 이상으로 위산을 분비하는 위 체부와 기저부의 산분비 점막만성적이고 진행성인 염증이 발생하는 면역매개 질환이다[1]. 전 세계 유병률은 약 0.5%–4.5%로 추정된다[2]. 그러나 질환에 대한 임상적 인지도가 낮고 초기 증상이 비특이적이어서, 헬리코박터 파일로리(H. pylori) 연관 위염으로 잘못 진단되는 경우가 많다. 이로 인해 적절한 치료가 지연되거나 부적절한 치료가 시행되어 난치성 질환으로 진행할 수 있다[3]. AIG가 계속 진행되면 비가역적인 위점막 위축뿐 아니라 제1형 위 신경내분비종양과 위선암이 발생할 수 있어 환자의 예후와 삶의 질에 심각한 영향을 미친다[4]. 따라서 AIG를 조기에 발견하고 적절히 관리하기 위해서는 정확하면서도 효율적인 진단 방법이 필요하다.

AIG의 임상적 진단을 위해서는 내시경 소견, 조직병리학적 검사 및 혈액검사 결과를 종합적으로 평가해야 한다[5–8]. 그러나 여러 유형의 위염에서 내시경 소견이 서로 중복되어 나타날 수 있고[9], 일부 질환의 진단에서 표준검사로 여겨지는 조직생검 역시 검체 채취가 충분하지 않으면 진단에 한계가 있다[10,11]. 혈액검사는 위염의 보조 진단에 중요한 역할을 하지만, 민감도와 특이도를 모두 만족하는 이상적인 바이오마커는 아직 부족하다. 임상 문헌에 따르면 AIG 환자의 약 80%–90%에서 항벽세포항체(parietal cell antibody, PCA)가 양성으로 나타나지만, AIG가 아닌 사람에서도 PCA 양성이 확인될 수 있다[12]. 또한 환자마다 증상이 다양하여, 특히 AIG 진료 경험이 부족한 의료진에게는 일상적인 임상 현장에서 정확한 진단이 어려 수 있다. 따라서 기존 진단 방법의 한계를 보완할 수 있는 더욱 신뢰성 높은 AIG 진단법의 개발시급하다.

인공지능(artificial intelligence, AI)의 급속한 발전은 신속하고 정확한 AIG 진단을 포함하여 소화기 분야의 다양한 임상 과제를 해결할 수 있는 새로운 방법을 제시하고 있다[13–28]. Franklin 등AIG와 H. pylori 양성 만성 위축성 위염(Hp+ CAG)을 감별하기 위해 병리 데이터를 기반으로 위의 염증성 병변 특징을 인식하는 알고리즘을 개발하였으며, 이 알고리즘은 소화기 병리 전문의와 유사한 수준의 진단 성능을 보였다[27]. Chen 등백색광 내시경 영상을 이용하여 AIG와 비-AIG 질환을 감별하는 내시경 AI 시스템을 개발하였고, 곡선하면적(area under the curve, AUC)은 0.990으로 매우 우수하였다[28]. 그러나 한 가지 유형의 데이터만 사용하는 단일모달 접근법비전형적인 소견을 보이는 환자를 놓칠 가능성이 있으며, 이는 실제 임상 환경에서 AI 시스템의 진단 성능을 저하시킬 수 있다.

본 연구에서는 이러한 한계를 보완하기 위해 자가면역성 위염을 위한 다중모달 AI 보조 진단 시스템(multimodal AI-assisted diagnostic system for autoimmune gastritis, MMADS-AIG)을 개발하였다. 연구의 주요 목적첫째, AIG, H. pylori 양성 만성 위축성 위염(Hp+ CAG) 및 H. pylori 음성 만성 위축성 위염(Hp− CAG)을 감별할 수 있는 다중모달 진단 체계를 구축하는 것이었다. 둘째, AIG를 식별하는 과정에서 세 가지 데이터 유형과 혈액검사 바이오마커 사이의 연관성을 정량적으로 분석하고자 하였다. 셋째, 외부 데이터셋을 이용한 검증과 두 내시경 의사군과의 진단 성능 비교를 통해 이 시스템의 임상적 활용 가능성과 일반화 성능을 평가하고자 하였다.


2. Materials and methods 

2.1. Ethics

본 연구는 헬싱키 선언의 원칙에 따라 수행되었다. 연구계획서는 저장대학교 의과대학 제2부속병원 임상연구윤리위원회의 승인을 받았으며(승인번호: Y2024–1105), 다른 모든 참여기관에서도 연구 수행에 대한 승인을 받았다. 모든 환자로부터 연구 참여 전에 서면 동의서를 받았다.


2.2. Data collection 

AIG특징적인 조직병리학적 소견혈청학적 검사 결과를 바탕으로 진단하였다[29–31]. 구체적인 포함 기준은 다음과 같았다. 첫째, 전정부가 보존되고 활동성 H. pylori 감염이 없는 체부 우세 위축을 바탕으로, ECL 세포 과형성 또는 내분비세포 미세둥지(micronests) 등 자가면역성 위염에 부합하는 조직학적 소견이 확인되어야 했다. 둘째, 혈청검사에서 항벽세포항체(parietal cell antibody, PCA) 또는 항내인자항체(intrinsic factor antibody, IFA) 중 하나 이상이 양성이어야 했다.

H. pylori 양성 만성 위축성 위염(Hp+ CAG)의 포함 기준첫째, 13C/14C 요소호기검사가 양성이거나 조직병리학적으로 H. pylori가 확인된 경우, 둘째, 조직병리학적으로 만성 위축이 확인된 경우였다. 

H. pylori 음성 만성 위축성 위염(Hp− CAG)첫째, 13C/14C 요소호기검사가 음성이면서 조직병리학적으로 H. pylori가 관찰되지 않고, 둘째, 조직병리학적으로 만성 위축이 확인된 경우로 정의하였다.

내시경 영상이 흐리거나 일부 부위가 누락되었거나 공기 주입이 충분하지 않아 영상의 질이 낮은 경우, 식도 또는 위 수술력이 있는 경우, 식도나 위의 악성종양 병력이 있는 경우에는 연구에서 제외하였다. 각 증례는 20년 이상의 임상 경험과 평균 18,000건 이상의 상부위장관 내시경검사 경험을 보유한 숙련된 내시경 의사 2명이 평가하였다. 조직병리학적 결과 역시 위장관 질환 분야에서 20년 이상의 경험을 가진 병리의사 2명이 판독하였다.

저장대학교 의과대학 제2부속병원(Second Affiliated Hospital, Zhejiang University School of Medicine, SAHZU)에서 모집된 환자들은 상부위장관 내시경검사 시행 시점에 따라 서로 독립적인 두 코호트로 구분하여 내부 데이터셋을 구성하였다. 닝보대학교 부속 양밍병원저장중의약대학교 제2부속병원에서 모집된 환자들외부 데이터셋에 포함하였다.

각 환자로부터 인구학적 정보, 내시경 영상, 생검 조직병리 결과 및 혈액검사 결과를 수집하였다. 내시경 영상(endoscopic images, EIs)은 숙련된 내시경 의사 2명이 위저부, 위체부전정부세 부위로 분류하였다. 생검 조직병리 보고서(pathological reports, PRs)는 진단에 편향을 유발할 수 있는 내용을 제거하고 병리 소견을 기술한 문장만 남기도록 전처리하였다. 혈액검사 결과(laboratory tests, LTs)에는 항벽세포항체(PCA), 항내인자항체(IFA), 펩시노겐 I(PGI), 펩시노겐 II(PGII), PGI/PGII 비율(PGR) 및 가스트린-17(G-17)의 여섯 가지 지표가 포함되었으며, 이들은 AIG 진단에 중요한 지표로 간주된다.


2.3. Study design 

본 연구에서는 자가면역성 위염을 진단하기 위한 다중모달 인공지능 보조 진단 시스템(multimodal AI-assisted diagnostic system for autoimmune gastritis, MMADS-AIG)을 개발하였으며, 전체 연구 과정은 Fig. 1에 제시하였다. 데이터를 무작위로 분할하는 과정에서 발생할 수 있는 편향을 줄이기 위해 코호트 1에서 5겹 교차검증(five-fold cross-validation)을 시행하였다. 데이터 누출을 방지하기 위해 환자 단위로 데이터를 엄격하게 분리하였으며, 동일한 환자의 데이터가 학습 데이터셋과 검증 데이터셋에 동시에 포함되지 않도록 하였다. 모델 학습을 완료한 후에는 내부 테스트 데이터셋과 외부 데이터셋을 이용하여 각각 독립적인 내부 검증과 외부 검증을 시행하였다.

Fig. 1. Overview of the multimodal task for gastritis diagnosis. (a) The model was trained and validated on an internal training-validation dataset using five-fold cross validation (CV) and was tested in internal test dataset and external dataset.

973b8112c25fc.png

이 시스템은 크게 두 단계로 구성되었다. 첫 번째 단계에서는 내시경 영상(endoscopic images, EIs), 조직병리 보고서(pathological reports, PRs) 및 혈액검사 결과(laboratory tests, LTs)의 각 데이터 유형으로부터 정보와 특징을 독립적으로 추출하였다. 두 번째 단계에서는 중간 융합 또는 후기 융합 전략(intermediate/late fusion strategy)을 이용하여 각 데이터에서 추출된 정보를 통합하였다. 모델의 학습 및 평가 환경에 관한 세부 내용Supplementary S1에 제시하였다. MMADS-AIG의 주요 임상적 목적 AIG, H. pylori 양성 만성 위축성 위염(Hp+ CAG)H. pylori 음성 만성 위축성 위염(Hp− CAG)감별하는 것이었다.


2.4. Model development 

모델에 입력하기 전모든 원본 내시경 영상(endoscopic images, EIs), 조직병리 보고서(pathological reports, PRs) 및 혈액검사 결과(laboratory tests, LTs)를 전처리하였다. 

* 내시경 영상에서는 진단에 불필요한 검은색 배경과 개인건강정보(protected health information, PHI)를 자동으로 잘라내어 진단에 필요한 영역만 남겼으며, 모델 입력을 위해 모든 영상을 224×224픽셀로 조정하였다.

* 조직병리 보고서에서는 병리 소견을 기술한 내용만 남겼다. 모델 학습 과정에서 확증편향이 발생하는 것을 줄이기 위해 AIG와 같은 잠재적 진단명이 포함된 문장이나 혈액검사 및 기타 임상자료와의 종합적인 판단을 권고하는 문장은 제거하였다.

* 혈액검사 결과0에서 1 사이의 값으로 정규화하였다. PCA가 0.0 이상 20.0 미만이거나 G-17이 500.0을 초과하는 경우처럼 정확한 값이 제시되지 않은 결과에는 별도의 처리 기준을 적용하였다. 상한값이 없는 결과에는 보고된 최솟값을 부여하였고, 일정한 범위로 제시된 결과에는 가우시안 분포를 가정하여 해당 범위 내에서 값을 무작위로 추출하였다. 이후 모든 데이터를 정규화한 후 모델 학습에 사용하였다.

다중모달 모델단일모달 특징 추출다중모달 특징 융합두 단계로 구성되었다. 첫 번째 단계에서는 SE-RepLKNet을 이용하여 내시경 영상의 공간적 특징을 추출하였다[32]. Fig. 1(b)에 제시된 것처럼, 모델은 위저부, 위체부 및 전정부에서 각각 얻은 3장의 내시경 영상 특징을 통합하였다. 이러한 방식은 AIG와 다른 유형의 위염을 감별하는 데 널리 사용되고 있다[26,28]. 위 부위별로 영상을 구분하여 특징을 추출하고 통합하는 전략은 AIG의 질병 특성을 반영한 것이다. AIG는 주로 위체부와 위저부에 우세한 위축을 보이는 반면, Hp+ CAG는 일반적으로 전정부 우세의 위축성 변화를 보이기 때문이다.

조직병리 보고서의 텍스트 정보를 효과적으로 추출하기 위해 사전 학습된 언어모델인 Chinese-RoBERTa-wwm-ext를 사용하였다[33]. 혈액검사 결과의 비선형적 특징 변환에는 다층 퍼셉트론(multilayer perceptron)을 적용하였다. 두 번째 단계에서는 각 데이터 유형에서 추출된 특징을 통합하고 세 가지 위염을 분류하기 위해 중간 융합과 후기 융합이라는 두 가지 특징 융합 방법의 성능을 평가하였다. 모델의 구체적인 설계는 Supplementary S2에 제시하였다.

Fig 1.  (b) MMADS-AIG included independent feature extraction from three modalities (endoscopic images, biopsy pathology reports, and laboratory test results), multi-modal feature fusion and final diagnostic prediction. AIG, Hp+ CAG and Hp- CAG represent autoimmune gastritis, H. pylori positive chronic atrophic gastritis and H. pylori negative chronic atrophic gastritis, respectively. The primary purpose of the model was to assist in diagnosis by classifying patients into AIG, Hp+ CAG or Hp- CAG.

cbb00bb573a22.png


2.5. Interpretability study for multimodal models 

Shapley 값협력적 게임이론에서 유래한 개념으로, 모델의 예측 결과에 각 데이터 유형얼마나 기여했는지공정하게 정량화하는 방법이다. 각 데이터 유형 (i)의 Shapley 값은 다음 식으로 계산하였다.

337293dd72487.png

여기서 (파이i)해당 데이터 유형의 평균적인 한계 기여도를 의미하며, (M={EIs, PR, LTs})는 내시경 영상, 조직병리 보고서 및 혈액검사 결과로 구성된 전체 데이터 유형의 집합이다. 보상함수 (v(S)) 데이터 유형의 부분집합 (S\subseteq M)을 사용했을 때의 분류 정확도의미한다. 즉, 가능한 모든 데이터 조합에서 특정 데이터 유형을 추가했을 때 분류 정확도가 얼마나 변하는지를 계산하여 Shapley 값을 산출하였다. 이 값은 대략 −1에서 +1 사이로 나타났다.

SHAP(SHapley Additive exPlanations)Shapley 값의 원리를 기반으로 하는 모델 독립적 해석 방법으로, 모델의 예측 결과를 각 개별 특징의 기여도로 분해하여 보여준다. 개별 환자에 대한 예측에서 특정 특징의 SHAP 값이 양수이면 해당 특징이 AIG로 예측될 확률을 높였다는 의미이며, 음수이면 반대로 AIG 예측 가능성을 낮췄다는 의미이다. 본 연구에서는 SHAP 값을 이용하여 여섯 가지 혈액검사 지표가 AIG 예측에 미치는 영향을 평가하였다[34]. SHAP 값일반적으로 −5에서 +5 사이로 나타났다. Shapley 값SHAP 값 모두 절댓값이 클수록 해당 데이터 유형 또는 특징이 모델의 예측에 더 큰 영향을 미쳤음을 의미한다.

또한 MMADS-AIG가 내시경 영상에서 어떤 영역을 근거로 특징을 추출하고 예측했는지 직관적으로 확인하기 위해 모델 사후 설명 기법인 EigenCAM을 적용하였다[35]. EigenCAM은 마지막 합성곱층에서 얻은 정보를 이용하여 각 질환의 분류에 중요한 내시경 영상 영역열지도로 표시한다. 이를 통해 모델의 예측에 가장 크게 기여한 부위를 시각적으로 확인할 수 있었으며, 모델이 주목한 영역은 실제 염증이 발생한 부위와 대체로 잘 일치하였다.


2.6. Statistical analysis

본 연구에서는 단일모달 모델다중모달 모델진단 성능민감도, 특이도, 정확도, 양성예측도(positive predictive value, PPV) 및 음성예측도(negative predictive value, NPV)를 이용하여 평가하였다. 각 평가 지표의 95% 신뢰구간은 15개의 데이터 분할에서 얻은 추정치를 바탕으로 자유도 14의 t-분포를 이용하여 산출하였다. 서로 다른 데이터 유형 조합 간의 성능은 양측 대응표본 t-검정을 이용하여 비교하였으며, 유의수준은 &alpha=0.001로 설정하였다.

통제된 조건에서 내시경 의사의 진단 성능을 평가하기 위해 내시경검사 경력이 5년을 초과한 전문 내시경 의사 3명경력이 5년 미만인 초심자 내시경 의사 3명내부 테스트 데이터셋을 각각 독립적으로 판독하였다. 각 내시경 의사군의 진단 성능 지표는 평균±표준편차로 제시하였다.

모든 통계분석은 Python version 3.9.19를 이용하여 수행하였으며, scikit-learn version 1.4.2SHAP version 0.47.0 패키지를 사용하였다. 수신자조작특성(receiver operating characteristic, ROC) 곡선의 작성곡선하면적(area under the curve, AUC)의 계산에는 MATLAB version 2023b를 사용하였다.


Results

3.1. Baseline characteristics

내부 데이터셋에는 저장대학교 의과대학 제2부속병원(SAHZU)에서 모집된 총 372명의 환자가 포함되었으며, 내시경검사 시행 시기에 따라 두 개의 코호트로 구분하였다. 코호트 12022년 1월부터 2024년 3월까상부위장관 내시경검사를 받은 환자로, AIG 65명, Hp+ CAG 72명 및 Hp− CAG 110으로 구성되었다. 코호트 22024년 3월부터 12월까지 검사를 받은 환자로, AIG 44명, Hp+ CAG 31명 및 Hp− CAG 50명이 포함되었다. 

외부 데이터셋 총 218명으로, AIG 67명, Hp+ CAG 61명 및 Hp− CAG 90명으로 구성되었다.

환자 1명당 평균 41.2±19.9장의 내시경 영상과 1건의 조직병리 보고서 및 1세트의 혈액검사 결과가 수집되었다. 모든 환자에서 OLGA 체계와 개정 Houston-Sydney System을 바탕으로 위축의 존재를 확인하였다. 조직학적 위축의 중증도침범된 위샘 단위의 비율에 따라 경도, 중등도 및 중증으로 구분하였다. 위샘 단위의 약 1%–30%가 침범된 경우는 경도, 31%–60%는 중등도, 60% 초과는 중증으로 분류하였다[36–38]. 후향적 연구의 특성상 외부 데이터셋의 Hp+ CAG 및 Hp− CAG 환자에서는 모든 바이오마커 검사 결과를 확보할 수 없었다. 

대표적인 내시경 영상내부 데이터셋의 경우 Supplementary Fig. 2에, 외부 데이터셋의 경우 Supplementary Fig. 3에 제시하였다. 


ea4b8f69edb16.png


내부 데이터셋의 환자 특성Table 1Supplementary Table S2에, 

b177663e3c611.png

외부 데이터셋의 환자 특성Supplementary Table S3에 제시하였다.

내부 데이터셋에서 PCA 양성률AIG 환자에서 96.3%로, Hp+ CAG 환자의 12.6%Hp− CAG 환자의 12.5%보다 현저히 높았다. 반면 AIG 환자의 IFA 양성률은 20.2%에 불과했으며, Hp+ CAG와 Hp− CAG 환자에서는 각각 0.971%와 1.25%로 더욱 낮았다. 

외부 데이터셋에서 AIG 환자의 PCA와 IFA 양성률은 각각 100.0%와 41.8%였다.

내부 데이터셋에서는 환자의 45.9%에서 빈혈이 있었고, 16.5%에서는 비타민 B12 수치가 정상 참고범위보다 낮았다. 하시모토 갑상선염은 AIG 환자에서 가장 흔하게 동반되는 자가면역질환 중 하나로 알려져 있으며[39], 본 연구에서는 환자의 16.5%가 하시모토 갑상선염 확진 또는 의심 환자로 분류되었다.


3.2. Performance of AIG diagnosis

본 연구에서는 내시경 영상(EIs), 조직병리 보고서(PR) 및 혈액검사 결과(LTs)를 각각 이용한 세 가지 단일모달 모델세 가지 이중모달 모델, 그리고 세 가지 데이터를 모두 통합한 삼중모달 모델MMADS-AIG를 개발하였다. 각 모델의 혼동행렬과 ROC 곡선Fig. 2제시하였으며, 

Fig. 2. Performance comparison of the multimodal gastritis-assisted diagnostic system. (a) Confusion matrix obtained by the trimodal model MMADS-AIG. AIG, Hp+ and Hp- represent autoimmune gastritis, H. pylori positive chronic atrophic gastritis and H. pylori negative chronic atrophic gastritis, respectively. (b) ROC curves for the diagnosis of gastritis types using unimodal, bimodal, and trimodal models (MMADS-AIG). (c–e) Confusion matrices using unimodal models (Endoscopic images, biopsy pathological report, and laboratory test results, respectively). (f–h) Confusion matrices using bimodal models (Endoscopic images and biopsy pathological report, endoscopic images and LTs, and biopsy pathological report and laboratory test results, respectively).

9f9deda2fe602.png

분류 성능 지표Table 2에 정리하였다. 

a458f86654325.png

Sections 3.2–3.4에서 제시하고 논의한 결과모두 중간 융합 전략을 적용하여 얻은 것이다. 후기 융합 전략과의 비교를 위해 추가적인 실험을 광범위하게 수행한 결과, 모든 데이터 조합에서 중간 융합 전략이 후기 융합 전략보다 우수한 성능을 보였다((P<0.001)). 후기 융합 전략의 성능과 분석 결과는 Supplementary Table S4와 Supplementary S3에 제시하였다.

62e86ed0fc653.png

단일모달 모델 중에서는 조직병리 보고서를 이용한 PR 모델이 0.869의 정확도(95% CI, 0.859–0.878)를 보여 가장 우수하였다. 이는 혈액검사 결과를 이용한 LTs 모델의 정확도 0.836(95% CI, 0.830–0.841; (P<0.001))과 내시경 영상을 이용한 EIs 모델의 정확도 0.809(95% CI, 0.805–0.814; (P<0.001))보다 유의하게 높은 결과였다.

두 가지 데이터를 통합한 이중모달 모델모든 비교에서 단일모달 모델보다 유의하게 우수한 성능을 보였다(모두 (P<0.001)). 그러나 이중모달 모델 중 내시경 영상과 조직병리 보고서를 결합한 EIs–PR 모델의 성능이 가장 낮았((P<0.001)). 이는 내시경 영상과 조직병리 정보 사이에 중복되는 정보가 많고, 서로 보완하는 정보는 상대적으로 제한적임을 시사한다. 그럼에도 다중모달 통합 방식을 적절히 최적화하면 두 데이터가 제공하는 서로 다른 관점을 효과적으로 결합하여 각각을 단독으로 사용했을 때보다 진단 정확도를 높일 수 있다.

혈액검사 결과만을 이용한 LTs 모델단일모달 모델 중 가장 높은 진단 성능을 보이지는 않았지만, LTs내시경 영상이나 조직병리 보고서와 결합하면 위염 분류 성능이 뚜렷하게 향상되었다. EIs 모델에 LTs를 추가한 EIs–LTs 모델에서는 정확도가 0.809에서 0.942로 증가하였고((P<0.001)), 민감도도 0.718에서 0.912로 향상되었다((P<0.001)). 마찬가지로 PR 모델에 LTs를 추가한 PR–LTs 모델에서는 정확도가 0.869에서 0.936으로 증가하였으며((P<0.001)), 민감도 0.802에서 0.905로 향상되었다((P<0.001)). 이러한 결과는 혈액검사 정보가 내시경 영상 및 조직병리 정보와 중복되기보다는 강한 상호보완적 가치를 가지고 있음을 보여준다.

내시경 영상, 조직병리 보고서 및 혈액검사 결과를 모두 통합한 MMADS-AIG 민감도는 0.931(95% CI, 0.927–0.935), 특이도는 0.963(95% CI, 0.960–0.965), 정확도는 0.954(95% CI, 0.951–0.957)로 나타났다. 이는 다른 모든 모델보다 유의하게 우수한 성능이었다(모두 (P<0.001)). MMADS-AIG는 육안적 내시경 소견, 현미경적 조직병리 소견 및 전신적 바이오마커 정보를 하나의 체계로 통합함으로써 AIG를 포함한 위축성 위염을 보다 종합적으로 감별할 수 있는 진단 체계를 제공하였다.


3.3. Comparison of clinicians and AI system

6명의 내시경 의사가 MMADS-AIG에 제공된 것동일한 다중모달 정보를 바탕으로 내부 데이터셋의 코호트 2를 AIG, Hp+ CAG 및 Hp− CAG의 세 범주로 각각 독립적으로 분류하였다. 평가 결과는 Table 3에 제시하였다. 

3573eef93c87a.png

전문 내시경 의사군민감도는 0.786±0.050, 특이도는 0.892±0.025, 정확도는 0.857±0.033이었다. 비전문 내시경 의사군의 민감도는 0.757±0.053, 특이도는 0.878±0.028, 정확도는 0.838±0.036이었다.

동일한 데이터셋과 통제된 조건에서 세 가지 데이터 유형을 모두 이용한 삼중모달 모델가장 우수한 성능을 보인 내시경 의사보다도 높은 진단 성능을 나타냈다. 또한 혈액검사 결과가 누락되어 내시경 영상과 조직병리 보고서만 사용한 이중모달 모델민감도 0.845(95% CI, 0.839–0.850), 특이도 0.912(95% CI, 0.908–0.915), 정확도 0.896(95% CI, 0.892–0.900)으로 임상의보다 우수한 성능을 보였다. 특히 임상의에게는 내시경 영상, 조직병리 보고서 및 혈액검사 결과를 포함한 모든 이용 가능한 정보가 제공되었다는 점을 고려하면, 혈액검사 정보 없이도 이중모달 모델이 더 높은 성능을 보였다는 결과는 의미가 있다.


3.4. Performance on multicenter dataset

다중모달 모델의 일반화 성능을 평가하기 위해 외부 데이터셋을 구축하였으며, 평가 결과는 Table 3에 제시하였다. 외부 데이터셋의 AIG 환자에서 MMADS-AIG의 민감도와 정확도는 모두 0.828(95% CI, 0.743–0.912)이었다.

일상적인 진료 과정에서 Hp+ CAG 및 Hp− CAG 환자에게는 AIG 진단과 관련된 일부 바이오마커 검사가 시행되지 않았기 때문에, 이들 환자에서는 내시경 영상과 조직병리 보고서의 특징을 통합한 이중모달 모델을 이용하여 외부 검증을 시행하였다. 이중모달 모델의 민감도는 0.742(95% CI, 0.728–0.755), 특이도는 0.813(95% CI, 0.804–0.823), 정확도는 0.777(95% CI, 0.767–0.787)이었다.

외부 데이터셋에서의 모델 성능 내부 테스트 데이터셋과 비교하여 다소 감소하였다((P<0.001)). 연구진은 이러한 성능 차이가 의료기관마다 조직병리 보고서의 작성 방식과 표현이 달라 발생한 데이터 분포의 차이, 즉 도메인 이동(domain shift) 때문인 것으로 해석하였다.


3.5. Interpretability findings of the multimodal model

본 연구에서는 세 가지 데이터 유형최종 예측에 기여한 정도Shapley 값으로 정량화하였으며, 그 결과는 Supplementary Table S5에 제시하였다.

f8aff2b53c9b6.png

조직병리 보고서(PR)의 Shapley 값0.197±0.002로 가장 높았다. 조직병리 보고서는 위샘 위축과 장상피화생을 포함한 현미경적 변화에 대한 근거를 제공하며, 이러한 소견은 AIG를 다른 위염 아형과 감별하는 데 높은 특이성을 가진다.

혈액검사 결과(LTs)의 Shapley 값0.194±0.008로 두 번째로 높았다. 혈액검사 지표는 PCA와 IFA를 통해 환자의 자가면역 상태를, G-17을 통해 위의 염증 및 산분비 상태를, PGI, PGR 및 G-17을 통해 위점막 위축 정도를 반영한다. 특히 본 연구에서는 PCA 또는 IFA 하나 이상이 양성인 환자만 AIG군에 포함하는 엄격한 기준을 적용하였기 때문에, 혈액검사 결과의 진단 기여도가 높아졌을 가능성이 있다.

내시경 영상(EIs) 점막의 얇아짐, 점액 부착 및 지도상 발적과 같은 육안적 변화를 보여준다. 그러나 내시경 영상의 Shapley 값은 0.163±0.005로 세 가지 데이터 유형 중 가장 낮았다. 이는 위염의 병변 분포가 불균일한 상황에서 위저부, 위체부 및 전정부의 영상 각 1장씩, 총 3장만으로는 위 전체의 상태를 충분히 반영하기 어려웠기 때문일 수 있다. 한편 세 데이터 유형 모두에서 표준편차가 작았다는 점반복 실험에서도 각 데이터의 기여도 추정치가 안정적이고 일관되었음을 보여준다.

연구진은 PCA, IFA, PGI, PGII, PGR 및 G-17의 여섯 가지 혈액검사 지표AIG 진단에 기여한 정도를 SHAP 값으로 분석하였으며, 그 결과는 Fig. 3에 제시하였다. Fig. 3(a)에서 각 지표의 왼쪽에 위치한 점해당 지표가 AIG 예측 가능성을 낮추는 데 기여했음을 의미하고, 오른쪽의 점은 AIG 예측 가능성을 높이는 데 기여했음을 의미한다. 예를 들어 PCA처럼 높은 값을 나타내는 점들이 오른쪽에 집중되어 있다면, 해당 지표의 값이 높을수록 AIG일 가능성이 증가한다는 뜻이다. 다만 여러 지표 사이에는 복잡한 비선형적 상호작용이 존재하므로, 동일한 검사값이라도 다른 지표와의 조합에 따라 서로 다른 SHAP 값을 나타낼 수 있다.

Fig. 3. Model Interpretability framework, including SHAP values of laboratory test indicators for AIG prediction and representative images with heatmaps generated by EigenCAM. (a) Beeswarm plot of the SHAP value for every case to the final diagnosis. Each point represents a case, and the color indicates the value of the indicator. The horizontal position reflects the SHAP value.

bd099336aaa58.png

Fig. 3(b)의 막대그래프기여 방향과 관계없이 각 혈액검사 지표가 모델의 예측에 미친 전반적인 영향력을 보여준다. PCA, PGRPGI의 기여도가장 높았으며, G-17, IFA 및 PGII는 모델의 예측 결과에 상대적으로 제한적인 영향을 미쳤다. 이러한 결과는 기존 연구 결과와도 일치하였다[5–8,40].

Fig. 3. (b) Bar plot of mean absolute SHAP value of each indicator for the prediction of AIG. Indicators are grouped by type, with the same color assigned to antibodies, pepsinogen, and gastrin, respectively. PCA , IFA , G-17, PGI, PGII, and PGR denote parietal cell antibody, intrinsic factor antibody, gastrin- 17, pepsinogen I, pepsinogen II, and pepsinogen I / pepsinogen II ratio, respectively.

c650b6e7bc9da.png

Fig. 3(c–h)에는 대표적인 내시경 영상 6개와 각각의 열지도를 함께 제시하였다. 강조된 영역은 모델이 위염을 감별하는 데 중요하게 판단한 정보를 포함부위를 의미한다. 이러한 영역은 실제 점막 위축, 백색 점액 부착 또는 부종이 관찰되는 부위와 일치하였으며, 이들 소견은 위염 진단에 중요한 내시경적 특징으로 간주된다.

Fig. 3. Representative images of autoimmune gastritis(c-d), H. pylori positive chronic atrophic gastritis(e-f), and H. pylori negative chronic atrophic gastritis(g-h). The highlighted areas indicated stronger relations with the prediction of model, and these areas are highly consistent with discriminative changes of atrophy and edema.

76eff14b0c8e6.png


4. Discussion

AIG는 자가면역질환이지만 증상이 비특이적이고 서서히 진행하며 임상적 인지도가 충분하지 않아 진단이 늦어지는 경우가 많다. 특히 경험이 적은 임상의에게는 조기 진단이 더욱 어려울 수 있다. AIG를 진단하지 못한 채 방치하면 거대적아구성 빈혈, 비가역적 신경학적 손상과 같은 심각한 합병증이 발생할 수 있으며, 위선암과 제1형 위 신경내분비종양을 포함한 위 종양의 위험도 크게 증가한다. 아직 전 세계적으로 통일된 진단 기준은 마련되어 있지 않지, 여러 지역의 진료지침에서는 특징적인 내시경 소견, 조직병리학적 평가, 혈청학적 바이오마커 및 임상정보를 종합하는 다중모달 진단 방식을 권고하고 있다[1,5,6].

본 연구의 가장 중요한 성과 AIG, H. pylori 양성 만성 위축성 위염(Hp+ CAG)H. pylori 음성 만성 위축성 위염(Hp− CAG)을 정확하게 분류하고 진단하기 위한 다중모달 AI 보조 진단 시스템인 MMADS-AIG구축한 것이다. 이 시스템은 여러 의료기관에서 수집한 내시경 영상(EIs), 조직병리 보고서(PR) 및 혈액검사 결과(LTs)로 구성된 다중모달 데이터셋을 이용하여 학습하고 평가하였다. MMADS-AIG는 서로 다른 출처와 형식의 데이터효과적으로 통합함으로써 진단 정확도와 안정성을 향상시켰다. 분류 민감도는 0.931(95% CI, 0.927–0.935), 특이도는 0.963(95% CI, 0.960–0.965), 정확도는 0.954(95% CI, 0.951–0.957)였다.

MMADS-AIG한 가지 데이터만 사용하는 단일모달 접근법과 달리, 서로 보완적인 정보를 통합하여 AIG와 다른 위염의 복잡한 특징을 더욱 충실하게 반영할 수 있었다. 이러한 장점은 전형적이지 않은 양상을 보이는 환자에서 특히 중요하다. 한 가지 데이터가 진단에 충분한 정보를 제공하지 못하거나 누락되더라도 다른 데이터가 이를 효과적으로 보완할 수 있었다. 이 시스템은 실제 임상에서 여러 검사 결과를 종합하여 판단하는 임상의의 진단 과정을 반영하며, AIG 진단의 정확도를 높이고 진단 지연을 줄여 위염 환자의 예후를 개선할 가능성을 보여준다. MMADS-AIG에 제공한 것과 동일한 정보를 이용하여 내시경 의사의 진단 성능을 평가한 결과, 통제된 조건에서 이 모델은 가장 우수한 성능을 보인 내시경 의사보다도 높은 진단 성능을 나타냈다. 또한 외부 데이터셋을 이용하여 모델의 일반화 가능성을 평가하였다.

다중모달 모델의 해석 가능성을 높이기 위해 각 데이터 유형이 최종 예측에 기여한 정도Shapley 값으로 정량화하였다. 또한 AIG 환자의 PCA, IFA, PGI, PGII, PGR 및 G-17을 분석한 결과, 이들 지표의 변화가 AIG의 체부 우세 위축이라는 형태학적 특성과 자가면역반응의 생물학적 기반을 반영하며 진단적으로 중요한 정보를 제공한다는 점을 확인하였다. 이와 함께 EigenCAM을 이용하여 모델이 AIG 내시경 영상을 인식할 때 가장 중요하게 판단한 영역을 시각화하였다.

본 연구에는 몇 가지 제한점이 있다. 첫째, 연구 대상군이 AIG, Hp+ CAG 및 Hp− CAG의 세 집단으로 제한되었으며, H. pylori 감염이 동반된 AIG나 다른 질환이 중복된 환자는 포함되지 않았다. 따라서 실제 임상에서 다양한 중복 질환을 가진 환자에게 적용할 때시스템의 일반화 성능이 제한될 수 있다. 또한 실제 활용 가능성을 검증하려면 더 많은 의료기관에서 광범위한 평가가 필요하다. PCA와 IFA 같은 바이오마커는 모든 의료기관에서 일상적으로 검사할 수 있는 항목이 아니므로, 현재의 다중모달 진단법을 일반적인 임상 현장에 적용하는 데에도 어려움이 있다. 향후에는 AIG의 예후 예측과 전암성 병변의 조기 발견에 연구의 초점을 확대하여, AIG가 위암으로 진행할 위험을 조기에 경고할 수 있는 시스템을 개발할 필요가 있다.

결론적으로, 본 연구에서는 내시경 영상, 조직병리 보고서혈액검사 결과를 통합하여 세 가지 위염 아형을 정확하게 감별하는 다중모달 AI 보조 진단 시스템MMADS-AIG를 개발하였다. 이 시스템은 진단 정확도를 높일 뿐 아니라, 데이터 융합 구조, 각 데이터 유형의 기여도 정량화주요 바이오마커의 우선순위 분석을 통해 임상적으로 해석할 수 있는 정보를 제공한다. 이는 표준화되고 근거에 기반한 위염 진단 체계로 나아가기 위한 중요한 진전으로 평가할 수 있다.


<Abstract>

Background: Autoimmune gastritis (AIG), a chronic inflammatory disease associated with various comorbidities and complications, is often subject to missed or delayed diagnoses.

Aims: The objective of this study was to develop an artificial intelligence (AI) system to assist in the diagnosis of AIG by integrating multimodal information, including endoscopic images, biopsy pathological reports, and laboratory test results.

Methods: Multimodal data were collected from 590 patients diagnosed with AIG, H. pylori positive, and H. pylori negative chronic atrophic gastritis at three medical centers. A multimodal AI system was developed to diagnose AIG and other types of chronic gastritis. The performance of the AI system was evaluated using both internal and external datasets. Six endoscopists were invited to perform three-category classification for comparison. The SHapley Additive exPlanations (SHAP) framework and EigenCAM were used to improve the interpretability of the AI system.

Results: The proposed multimodal AI system achieved a sensitivity of 0.931, specificity of 0.963, and accuracy of 0.954, significantly outperforming unimodal models (all P<0.001) and the best-performing invited expert endoscopist under controlled conditions. SHAP analysis indicated that the three modalities provided complementary and synergistic information.

Conclusion: This multimodal AI system has the potential to enable practical AI-assisted diagnosis of AIG with exceptional accuracy.

Keywords: Autoimmune gastritis identification; Deep learning; Model interpretability; Multimodal feature fusion.


References

[1] Terao S, Suzuki S, Yaita H, et al. Multicenter study of autoimmune gastritis in Japan: clinical and endoscopic characteristics. Dig Endosc 2020;32:364–72. doi: 10.1111/den.13500. 

[2] Massironi S, Zilli A, Elvevi A, et al. The changing face of chronic autoimmune atrophic gastritis: an updated comprehensive perspective. Autoimmun Rev 2019;18:215–22. doi: 10.1016/j.autrev.2018.08.011. 

[3] Hall SN, Appelman HD. Autoimmune gastritis. Arch Pathol Lab Med 2019;143:1327–31. doi: 10.5858/arpa.2019- 0345- RA. 

[4] Lenti MV, Rugge M, Lahner E, et al. Autoimmune gastritis. Nat Rev Dis Primers 2020;6:56. doi: 10.1038/s41572-020-0187-8. 

[5] Kamada T, Maruyama Y, Monobe Y, et al. Endoscopic features and clinical importance of autoimmune gastritis. Dig Endosc 2022;34:700–13. doi: 10.1111/ den.14175. 

[6] Livzan MA, Gaus OV, Mozgovoi SI, et al. Chronic autoimmune gastritis: modern diagnostic principles. Diagnostics 2021;11:2113. doi: 10.3390/ diagnostics11112113. 

[7] Orgler E, Dabsch S, Malfertheiner P. Autoimmune gastritis: update and new perspectives in therapeutic management. Curr Treat Options Gastroenterol 2023;21:64–77. doi: 10.1007/s11938-023-00406-4. 

[8] Toh BH. Diagnosis and classification of autoimmune gastritis. Autoimmun Rev 2014;13:459–62. doi: 10.1016/j.autrev.2014.01.048. 

[9] El-Zimaity HM. Recent advances in the histopathology of gastritis. Curr Diagn Pathol 2007;13:340–8. doi: 10.1016/j.cdip.2007.05.006. 

[10] Bornschein J, Tran-Nguyen T, Fernandez-Esparrach G, et al. Biopsy sampling in upper gastrointestinal endoscopy: a survey from 10 tertiary referral centres across europe. Dig Dis 2021;39:179–89. doi: 10.1159/0 0 0511867. 

[11] Pouw RE, Bisschops R, Gecse KB, et al. Endoscopic tissue sampling–Part 2: lower gastrointestinal tract. European society of gastrointestinal endoscopy (ESGE) guideline. Endoscopy 2021;53(12):1261–73. doi: 10.1055/a- 1671- 6336. 

[12] Castellana C, Eusebi LH, Dajti E, et al. Autoimmune atrophic gastritis: a clinical review. Cancers 2024;16(7):1310. doi: 10.3390/cancers16071310. 

[13] Luo J, Cao S, Ding N, et al. A deep learning method to assist with chronic atrophic gastritis diagnosis using white light images. Dig Liver Dis 2022;54:1513–19. doi: 10.1016/j.dld.2022.04.025. 

[14] Marcinkevics R, Wolfertstetter PR, Klimiene U, et al. Interpretable and intervenable ultrasonography-based machine learning models for pediatric appen- dicitis. Med Image Anal 2024;91:103042. doi: 10.1016/j.media.2023.103042. 

[15] Ge P, Yan T, Wong PK, et al. Simultaneous segmentation and classification of esophageal lesions using attention gating pyramid vision transformer. IEEE Trans Emerg Top Comput Intell 2024;9:1961–75. doi: 10.1109/TETCI.2024. 3485704. 

[16] Jin J, Hu D, Pu W, et al. Few-shot learning with task adaptation for multicategory gastrointestinal endoscopy classification. Biomed Signal Proc Cont 2024;95:106387. doi: 10.1016/j.bspc.2024.106387. 

[17] Krishna S, Anu KV, Paulose R. BoostedNet: a decision support model for the diagnosis of helicobacter pylori from gastric histopathology images. Biomed Signal Pro Cont 2024;96:106612. doi: 10.1016/j.bspc.2024.106612 . 

[18] Hu C, Xia Y, Zheng Z, et al. AI-based large-scale screening of gastric cancer from noncontrast CT imaging. Nat Med 2025;31:3011–19. doi: 10.1038/ s41591-025-03785-6.

[19] Ma M, Zeng X, Qu L, et al. Advancing automatic gastritis diagnosis: an interpretable multilabel deep learning framework for the simultaneous assessment of multiple indicators. Am J Pathol 2024;194:1538–49. doi: 10.1016/j.ajpath. 2024.04.007. 

[20] Yokote A, Umeno J, Kawasaki K, et al. Small bowel capsule endoscopy examination and open access database with artificial intelligence: the SEE-artificial intelligence project. DEN Open 2024;4:e258. doi: 10.1002/deo2.258. 

[21] Ma S, Zhang M, Sun W, et al. Artificial intelligence and medical-engineering integration in diabetes management: advances, opportunities, and challenges. Healthc Rehabil 2025;1:100006. doi: 10.1016/j.hcr.2024.100006. 

[22] Shao J, Ma J, Yu Y, et al. A multimodal integration pipeline for accurate diagnosis, pathogen identification, and prognosis prediction of pulmonary infections. Innovation (Camb) 2024;5:100648. doi: 10.1016/j.xinn.2024.100648. 

[23] Qiu Z, Yang P, Xiao C, et al. 3D multimodal fusion network with disease induced joint learning for early Alzheimer’s disease diagnosis. IEEE Trans Med Imaging 2024;43:3161–75. doi: 10.1109/TMI.2024.3386937. 

[24] Cui H, Zhao Y, Xiong S, et al. Diagnosing solid lesions in the pancreas with multimodal artificial intelligence: a randomized crossover trial. JAMA Netw Open 2024;7:e2422454. doi: 10.1001/jamanetworkopen.2024.22454.

[25] Lipkova J, Chen RJ, Chen B, et al. Artificial intelligence for multimodal data integration in oncology. Cancer Cell 2022;40:1095–110. doi: 10.1016/j.ccell.2022.09.012.

[26] Cao Y, Zhao Y, Jin X, et al. A Multitask network for the diagnosis of autoimmune gastritis. J Imag 2025;11:154. doi: 10.3390/jimaging11050154. 

[27] Franklin MM, Schultz FA, Tafoya MA, et al. A deep learning convolutional neural network can differentiate between Helicobacter pylori gastritis and autoimmune gastritis with results comparable to gastrointestinal pathologists. Arch Pathol Lab Med 2022;146:117–22. doi: 10.5858/arpa.2020-0520-OA. 

[28] Chen S, Xu L, Yan L, et al. A novel endoscopic artificial intelligence system to assist in the diagnosis of autoimmune gastritis: a multicenter study. Endoscopy 2025;57:299–309. doi: 10.1055/a-2451-3071. 

[29] Rugge M, Genta RM, Malfertheiner P, et al. RE. GA. IN.: the real-world Gastritis Initiative–updating the updates. Gut 2024;73(3):407–41. doi: 10.1136/ gutjnl-2023-331164. 

[30] Lahner E, Lenti MV, Massironi S, et al. Autoimmune gastritis: diagnosis, clinical management and natural history. A position paper by the Autoimmune gastRitis Italian netwOrk Study grOup (ARIOSO). Dig Liver Dis 2025;58(1):38–50. doi: 10.1016/j.dld.2025.10.015.

[31] Rugge M, Bricca L, Guzzinati S, et al. Autoimmune gastritis: long-term natural history in naïve Helicobacter pylori-negative patients. Gut 2023;72(1):30–8. doi: 10.1136/gutjnl-2022-327827. 

[32] Jin X, Zhao Y, Cao Y, et al. Research on Gastritis endoscopic images classification based on SE-RepLKNet. In: In2024 2nd International Conference on Computer, Vision and Intelligent Technology (ICCVIT). IEEE; 2024. p. 1–5. doi: 10.1109/ICCVIT63928.2024.10872498. 

[33] Cui Y, Che W, Liu T, et al. Pre-training with whole word masking for chinese bert. IEEE/ACM Trans Audio Speech Lang Proc 2021;29:3504–14. doi: 10.1109/ TASLP.2021.3124365. 

[34] Lundberg SM, Lee SI. A unified approach to interpreting model predictions, 30. Advances in neural information processing systems; 2017 https://proceedings. neurips.cc/paper/2017/hash/8a20a8621978632d76c43dfd28b67767-Abstract.html.

[35] Muhammad MB, Yeasin M. Eigen-cam: class activationmap using orincipal components. In: In2020 International Joint Conference on Neural Networks (IJCNN). IEEE; 2020. p. 1–7. doi: 10.1109/IJCNN48605.2020.9206626. 

[36] Shah SC, Piazuelo MB, Kuipers EJ, et al. AGA clinical practice update on the diagnosis and management of atrophic gastritis: expert review. Gastroenterology 2021;161(4):1325–32. doi: 10.1053/j.gastro.2021.06.078. 

[37] Banks M, Graham D, Jansen M, et al. British Society of Gastroenterology guidelines on the diagnosis and management of patients at risk of gastric adenocarcinoma. Gut 2019;68(9):1545–75. doi: 10.1136/gutjnl-2018-318126. 

[38] Rugge M, Genta RM, Fassan M, et al. OLGA gastritis staging for the prediction of gastric cancer risk: a long-term follow-up study of 7436 patients. Am J Gastroenterol 2018;113(11):1621–8. doi: 10.1038/s41395-018-0353-8. 

[39] Cellini M, Santaguida MG, Virili C, et al. Hashimoto’s thyroiditis and autoimmune gastritis. Front Endocrinol 2017;8:92. doi: 10.3389/fendo.2017.00092. 

[40] Zhang Z, Zhu T, Zhang L, et al. Critical influence of cytokines and immune cells in autoimmune gastritis. Autoimmunity 2023;56:2174531. doi: 10.1080/ 08916934.2023.2174531.

0 0


대한자가면역성위염연구회

주소 : 경기도 용인시 기흥구 중부대로 579, 508-23호

대표전화 : 070-8080-0453

이메일 : autogastritis@gmail.com 


Copyright (c)대한자가면역성위염연구회. All Rights Reserved.

Design Hosting By 위멘토.


대한자가면역성위염연구회

(주)퍼피블루      사업자등록번호 : 706-87-01923

주소 : 경기도 용인시 기흥구 중부대로 579, 508-10호 (구갈동, 강남대프라자)

대표전화 : 070-8080-0453 이메일 : autogastritis@gmail.com 


Copyright (주)퍼피블루. All Rights Reserved. Design Hosting By 위멘토.