Tao J, Meng L, Li T, Wang J, Zhang L, Zhang X, Li Z.
Front Immunol. 2026 Jul 29;17:1883686. doi: 10.3389/fimmu.2026.1883686.
Introduction
자가면역성 위염(autoimmune gastritis, AIG)은 T세포 매개성 위벽세포 파괴, 무산증 및 진행성 위체부·위저부 위축을 특징으로 하는 만성 장기 특이적 자가면역질환이다[1–3]. 주로 중년 및 고령 여성에서 발생하며, 자가면역성 갑상선질환과 제1형 당뇨병을 비롯한 다른 자가면역질환이 흔히 동반된다[1]. 임상 양상이 서서히 나타나기 때문에 상당수의 환자는 질환이 이미 진행된 단계에 이른 후에야 진단된다. AIG는 초기의 염증세포 침윤 단계에서 시작하여, 위산분비샘이 가성유문샘화생으로 대체되는 활동기 단계를 거쳐, 장상피화생이 주를 이루는 진행된 선 구조 재형성 단계에 이르기까지 연속적으로 진행하며, 각 단계에 따라 내시경적·혈청학적 소견과 임상적 위험 양상이 다르게 나타난다[2]. 진행된 질환에서는 지속적인 고가스트린혈증과 장크롬친화세포 유사세포(enterochromaffin-like cell) 증식으로 제1형 위 신경내분비종양의 발생 위험이 현저히 증가하므로 체계적인 내시경 감시가 필요하다. 반면, 초기 단계에서는 자가면역성 손상이 여전히 활발하게 진행되므로 원칙적으로 이를 조절할 가능성이 있다[4]. 따라서 AIG의 질환 내 단계를 정확하게 평가하는 것은 환자별 감시 전략과 위험도 층화를 위해 반드시 필요하다.
이러한 임상적 중요성에도 불구하고 현재 AIG에 대한 통일된 병기 분류 체계는 확립되어 있지 않다. Kimura–Takemoto 분류[5]는 Helicobacter pylori 연관 위축성 위염에서 위축이 전정부에서 위체부 방향으로 진행하는 양상을 평가하기 위해 개발되었으므로, AIG에서 나타나는 이른바 ‘역위축(reverse atrophy)’ 양상에는 적합하지 않다[2]. 조직학적 3단계 분류[6]는 질환의 진행 과정을 포괄적으로 반영하지만, 표적 생검에 의존한다는 한계가 있다. AIG의 위축은 공간적으로 균일하지 않기 때문에 특정 지점에서 시행한 생검만으로는 위점막 전체의 상태를 제대로 반영하기 어렵고, 광범위하게 얇아진 위벽에서는 여러 부위의 생검으로 인한 출혈 위험도 증가한다. 한 조직학적 확진 환자군 연구에서는 모든 환자가 활동기 또는 말기 단계로 분류되었는데, 이는 초기 질환을 놓칠 수 있는 상당한 사각지대가 존재함을 시사한다[7]. 따라서 전체 위점막의 전반적인 특징을 바탕으로 위축의 진행 정도를 평가할 수 있는 객관적인 ‘전체 영역(whole-field)’ 내시경 평가법을 마련하는 것이 중요한 미충족 과제이다.
Maruyama 등은 최근 잔존 위산분비점막(remnant oxyntic mucosa, ROM)이 차지하는 면적의 비율을 기준으로 자가면역성 위염 위축 단계(AIG-atrophic stage, AIG-AS) 분류를 제안하였다. 이 분류는 1단계(50%<ROM≤100%), 2단계(10%<ROM≤50%), 3단계(ROM≤10%)로 구성된다[8]. ROM은 위점막 전체를 대상으로 잔존 위산분비샘의 정도를 역동적으로 추정할 수 있는 지표이다[2]. 그러나 ROM 면적은 주관적으로 판정되며, 특히 단계의 경계값 부근에서는 관찰자 간 의견이 자주 일치하지 않는다. 다기관 검증 연구에서 보고된 관찰자 간 카파값도 약 0.50으로 중등도 수준에 그쳤다[9]. 따라서 AIG-AS를 기반으로 객관적이고 정량적이며 다차원적인 예측 인자를 구축하는 것은 여전히 해결되지 않은 과제로 남아 있다.
머신러닝은 H. pylori 연관 위축성 위염의 OLGA/OLGIM 병기 평가[10]와 영상 기반 AIG 진단[11,12]에 성공적으로 적용되어 왔으며, 다기관 딥러닝 시스템은 0.97을 초과하는 곡선하면적(area under the curve, AUC)을 보였다. 그러나 저자들이 아는 한, AIG 환자 내에서 질환 단계를 예측하는 데 머신러닝을 적용한 연구는 아직 없다. 이에 본 연구에서는 통합 진단 기준에 따라 AIG로 진단된 환자를 등록하고, 백색광 내시경(white-light endoscopy, WLE) 소견, 확대 협대역 영상 내시경(magnifying endoscopy with narrow-band imaging, ME-NBI) 소견 및 혈청학적 검사 패널을 수집하였다. 또한 AIG-AS를 병기 분류 체계로 채택하고, 단계 예측 모델을 구축하며 각 특징이 예측에 기여하는 정도를 정량화하기 위해 여러 알고리즘으로 구성된 분석 파이프라인을 구축하였다. 본 연구의 목적은 AIG의 정밀한 병기 평가와 환자별 맞춤형 감시 전략을 위한 근거를 마련하는 것이었다.
Methods
Study design and patients
본 단일기관 단면연구는 2023년 12월부터 2025년 12월까지 베이징중의약대학교 동직문병원 소화기내과에서 자가면역성 위염(AIG)으로 진단받은 환자를 대상으로 하였다. 모든 환자는 일반적인 백색광 내시경(white-light endoscopy, WLE)을 이용한 표준 상부위장관 내시경검사를 받았으며, 일부 환자에서는 동일한 검사 중 확대 협대역 영상 내시경(magnifying endoscopy with narrow-band imaging, ME-NBI)을 추가로 시행하였다. 혈청학적 검사는 내시경검사 시점을 전후하여 시행하였다. 최초 연구 대상에 해당한 환자 235명 가운데 32명을 제외하였으며, 최종적으로 환자 203명과 내시경 영상 11,557장을 분석에 포함하였다. 내시경검사는 최소 5년 이상의 경험을 갖춘 전문의급 이상의 소화기내과 의사가 시행하였다. 본 연구는 동직문병원 연구윤리위원회의 승인을 받았으며(승인번호 DZM-EC-2025-540), 헬싱키선언에 따라 수행되었다. 본 연구는 비식별화된 임상자료와 보관된 내시경 영상을 이용한 후향적 단면연구였으므로, 연구윤리위원회는 서면동의 취득 요건을 면제하였다.
Diagnostic and staging criteria
AIG는 2023년 일본 A형 위염 진단기준[13]과 2024년 『Stomach and Intestine』 단행본[2,3,8]에 따라 내시경적·조직학적·혈청학적 기준을 통합하여 확진하였다. 연구의 포함 기준은 다음과 같았다. 첫째, 내시경검사 및/또는 조직검사에서 위체부·위저부 위축이 확인된 경우, 둘째, 벽세포 항체(parietal cell antibody, PCA) 및/또는 내인자 항체가 양성인 경우, 셋째, 13C/14C 요소호기검사 또는 신속요소분해효소검사 결과가 음성인 경우, 넷째, 연령이 18–85세인 경우, 다섯째, 내시경 영상 기록이 완전하게 보존된 경우였다. 제외 기준은 위 수술의 과거력, 위 신경내분비종양을 제외한 조직학적 악성종양, 자가면역 이외의 원인에 의한 위축, 중증 동반질환, 임신 또는 수유 중인 경우 및 불완전한 의무기록이었다.
AIG의 단계는 AIG-AS 분류체계에 따라 결정하였다[8]. 이분형 분류에서는 AIG-AS 1단계와 2단계를 초기–중간 단계 AIG로 통합하고, 3단계는 진행된 AIG로 구분하였다. 이는 종양 발생에 대한 강화된 감시를 언제 시작할 것인가라는 임상적 질문을 반영한 것이다.
Feature collection
백색광 내시경(WLE)에서는 위체부, 위저부, 전정부, 위각부 및 식도의 소견을 기록하였다. 평가 항목에는 점막의 얇아짐, 점막하 혈관의 투영, 위 주름의 소실, 위소구(areae gastricae)의 종창, 점막 부종, 발적 양상(점상형, 지도상형, 미만형), 끈적하게 부착된 농후한 점액, 과형성 용종, 잔존 위산분비점막(ROM)의 형태학적 아형, 보존된 전정부 점막의 범위(0–3등급), 그리고 Prague C&M 기준[14]에 따른 바렛식도(Barrett esophagus, BE)의 등급[없음, 단분절(<3 cm), 장분절(≥3 cm)]이 포함되었다.
확대 협대역 영상 내시경(ME-NBI) 평가 항목에는 가성유문샘화생, 벗겨진 피부 모양(cast-off skin appearance, CSA), 백색 구상 외관(white globe appearance, WGA)[15], 변연 음와상피(marginal crypt epithelium, MCE)의 종창, 백색 불투명 물질(white opaque substance), 연청색 융기(light blue crest), 경계선(demarcation line), 불규칙한 미세혈관·미세표면 양상 및 음와 개구부(crypt opening, CO)의 등급이 포함되었다. CO 등급은 1등급이 점상 형태, 2등급이 불분명한 형태, 3등급이 짧은 막대 모양, 4등급이 개구부가 관찰되지 않는 경우로 정의하였다[16].
혈청학적 지표에는 펩시노겐 I(pepsinogen I, PGI), 펩시노겐 II(PGII), PGI/PGII 비율, 가스트린-17(gastrin-17, G-17), 벽세포 항체(PCA) 역가(1:40–1:3200, 로그 변환 후 순서형 변수로 처리), 엽산, 비타민 B12, 혈색소 및 갑상선 자가항체인 갑상선과산화효소 항체(TPOAb), 갑상선글로불린 항체(TgAb), 갑상선자극호르몬 수용체 항체(TRAb)가 포함되었다. 결측률이 50%를 초과한 지표인 항-H. pylori I형·II형 항체, 내인자 항체 및 갑상선기능검사는 모델링에서 제외하였다.
내시경 영상은 두 명의 숙련된 내시경 전문의가 서로 독립적으로 판독하였으며, 판독 결과가 일치하지 않는 경우 세 번째 전문의가 최종 판정하였다.
조직학적 소견은 두 명의 병리의사가 서로 독립적으로 검토하였다.
Statistical analysis
연속형 변수는 평균±표준편차 또는 중앙값(제1사분위수–제3사분위수)으로 제시하였고, 범주형 변수는 빈도와 백분율[n(%)]로 제시하였다. 세 군 간 비교에서는 연속형 변수에 대해 일원배치 분산분석 또는 Kruskal–Wallis 검정을 사용하였으며, 범주형 변수에는 카이제곱검정 또는 G-검정을 적용하였다. 이분형 비교에서는 연속형 변수에 대해 독립표본 t-검정 또는 Mann–Whitney U 검정을 사용하였고, 범주형 변수에는 카이제곱검정 또는 Fisher의 정확검정을 적용하였다. 전체 군 간 차이가 유의한 경우에는 Bonferroni 보정을 적용한 사후 쌍별 비교를 시행하였다.
효과크기는 세 군의 연속형 변수 비교에서 η² 또는 ε², 범주형 변수 비교에서 Cramér의 V, 이분형 연속형 변수 비교에서 Cohen의 d 또는 순위양분상관계수(rank-biserial r)로 산출하였다. 모든 검정은 양측검정으로 시행하였으며, 유의수준 α는 0.05로 설정하였다. 통계분석에는 SPSS version 30.0(IBM, Armonk, NY, USA)을 사용하였다.
Machine-learning modeling
다섯 가지 특징 변수 세트를 구성하였다. 첫째는 백색광 내시경(WLE) 세트(n=203), 둘째는 WLE와 확대 협대역 영상 내시경(ME-NBI)을 결합한 세트(n=160), 셋째는 결측률이 50% 미만인 7개 지표, 즉 PGI, PGII, PGI/PGII 비율, PCA 역가, G-17, 엽산 및 비타민 B12로 구성된 핵심 혈청학적 세트, 넷째는 여기에 TPOAb, TgAb, TRAb 및 혈색소를 추가한 11개 지표의 확장 혈청학적 세트, 다섯째는 WLE와 핵심 혈청학적 지표를 통합한 내시경·혈청학적 결합 세트(31개 변수)였다.
각 특징 변수 세트에는 LASSO 로지스틱 회귀, 엘라스틱 넷(elastic net), 랜덤 포레스트(random forest), XGBoost, 서포트 벡터 머신(support vector machine, SVM), 그래디언트 부스팅(gradient boosting) 및 스태킹 앙상블(stacking ensemble)의 7가지 알고리즘을 적용하였다. 스태킹 앙상블에서는 랜덤 포레스트, XGBoost 및 SVM을 기본 학습기로 사용하고, 로지스틱 회귀를 메타 학습기로 사용하였다.
층화 5겹 교차검증을 시행하였으며, 각 훈련 폴드 내에서 하이퍼파라미터를 조정하기 위해 중첩 3겹 무작위 탐색을 적용하여 모델별로 10개의 후보 조합을 평가하였다. 특징 변수별 중앙값 대치, 분산이 0인 변수의 제거 및 Z-점수 표준화로 구성된 전처리 과정과 2단계 환자 수가 36명인 클래스 불균형을 보정하기 위한 합성 소수 클래스 과표본추출 기법(synthetic minority oversampling technique, SMOTE)은 정보 누출을 방지하기 위해 훈련 폴드 내에서만 적용하였다. 검사 폴드에서는 원래의 클래스 분포를 그대로 유지하였다.
주요 평가 지표는 세 범주 분류 과제에서는 매크로 평균 곡선하면적(macro-averaged area under the curve, macro-averaged AUC)이었고, 이분형 분류 과제에서는 AUC였다. 특징 중요도는 트리 기반 모델에서는 지니 중요도(Gini importance), 선형 모델에서는 표준화 회귀계수, SVM과 스태킹 앙상블에서는 순열 중요도(permutation importance)를 이용하여 산출하였다. 각 특징 변수 세트에서 가장 우수한 성능을 보인 트리 기반 모델은 SHAP을 이용하여 추가로 분석하였다. 결합 세트의 다중공선성은 Pearson 상관계수(|r|>0.7)와 분산팽창계수(variance inflation factor, VIF>10)를 이용하여 평가하였다. 분석은 Python 3.13 환경에서 scikit-learn, XGBoost, imbalanced-learn 및 SHAP 라이브러리를 사용하여 수행하였다.
Results
Patient characteristics
전체 환자 203명 중 여성은 131명(64.5%), 남성은 72명(35.5%)으로 남녀 비는 1:1.8이었으며, 연령의 중앙값은 62세였다(제1–제3사분위수, 54–67세). AIG-AS에 따른 분포는 1단계 87명(42.9%), 2단계 36명(17.7%), 3단계 80명(39.4%)이었다. 이분형으로 분류하였을 때는 초기–중간 단계가 123명(60.6%), 진행 단계가 80명(39.4%)이었다. 연령과 성별은 단계에 따라 유의한 차이를 보이지 않았다(P>0.05)(표 1, 그림 1A). 이 가운데 160명은 ME-NBI 검사를 추가로 받았으며, AIG-AS 1단계가 68명, 2단계가 26명, 3단계가 66명이었다.

FIGURE 1 Stage distribution and frequency of endoscopic features across AIG-AS stages.
(A) Distribution of patients across the three-class and binary schemes.

Endoscopic features across stages
백색광 내시경(WLE)에서는 서로 반대 방향으로 변화하는 두 가지 소견군이 병기 진행의 연속적인 양상을 형성하였다(그림 1B, C).
FIGURE 1. (B) Heat map of WLE feature frequency across stages — corpus and fundus. (C) Heat map of WLE feature frequency —antrum and incisura angularis.

위축 관련 소견은 병기가 진행할수록 일관되게 증가하였다. 점막의 얇아짐은 1단계의 34.5%에서 3단계의 90.0%로 증가하였고, 점막하 혈관의 투영은 20.7%에서 75.0%로, 위 주름의 소실은 14.9%에서 85.0%로 증가하였다(모두 P<0.001). 집합세정맥의 규칙적 배열 소실은 2–3단계에서 100%에 이르렀다(P<0.001). 끈적하게 부착된 농후한 점액은 1단계(34.5%)보다 2단계(69.4%)와 3단계(67.5%)에서 더 흔하게 관찰되었다(P<0.001).
반대로 염증 및 부종과 관련된 소견은 병기가 진행할수록 감소하였다. 점막 부종은 74.7%에서 32.5%로 감소하였고(P<0.001), 위소구(areae gastricae)의 종창은 71.3%에서 35.0%로(P<0.001), 위 주름의 비대는 29.9%에서 12.5%로 감소하였다(P<0.01). 점상형, 지도상형 및 미만형 발적은 1단계에서 가장 흔했으며, 이후 단계에서는 대부분 관찰되지 않았다(모두 P<0.05). Bonferroni 보정을 적용한 사후 쌍별 비교에서 위 주름의 소실은 모든 병기 전환을 유의하게 구별하였다(1단계 대 2단계, P=0.003; 2단계 대 3단계, P<0.001).
ME-NBI를 시행한 160명에서는(그림 1D) 벗겨진 피부 모양(cast-off skin appearance, CSA)이 1단계의 32.4%에서 2단계의 88.5%로 급격히 증가하였으며, 3단계에서는 77.3%로 나타났다(P<0.001). 백색 구상 외관(white globe appearance, WGA)도 이와 유사한 양상을 보였다(각각 17.6%, 46.2%, 42.4%; P=0.002). 변연 음와상피(marginal crypt epithelium, MCE)의 종창은 병기가 진행함에 따라 감소하였으며(각각 72.1%, 61.5%, 33.3%; P<0.001), 이는 WLE에서 관찰된 위소구 종창의 변화 양상과 일치하였다. 음와 개구부가 관찰되지 않는 CO 4등급은 1단계의 25.4%에 비해 2단계와 3단계에서 각각 73.1%와 87.3%로 우세하게 나타났다(P<0.001).
FIGURE 1. (D) Heat map of ME-NBI feature frequency across stages.

바렛식도는 전체 환자의 66.8%에서 관찰될 정도로 매우 높은 유병률을 보였으며, 단분절 바렛식도는 41.3%, 장분절 바렛식도는 25.5%였다. 장분절 바렛식도의 유병률은 1단계의 13.4%에서 3단계의 43.0%로 증가한 반면(P<0.001), 단분절 바렛식도는 1단계에서 가장 흔하게 관찰되었다(54.9%).
Serological features
PGI는 병기가 진행됨에 따라 점진적으로 감소하였다(중앙값 67.6→30.2→23.7 μg/L, P<0.001). PGI/PGII 비율도 이와 유사하게 감소하였다(4.21→1.89→2.10, P<0.001). PGII는 소폭 감소하였다(P=0.002). G-17은 비선형적 변화 양상을 보였으며, 2단계에서 중앙값 34.8 pmol/L로 가장 높았고 1단계에서 7.4 pmol/L로 가장 낮았다(P<0.001). 비타민 B12는 병기가 진행됨에 따라 점진적으로 감소하였다(581.5→411.0→375.0 pg/mL, P=0.010).
벽세포 항체(PCA) 양성률은 1단계의 61.7%에서 2단계의 85.3%와 3단계의 81.8%로 증가하였으나(P=0.005), PCA 역가는 병기 간 유의한 차이를 보이지 않았다. 갑상선글로불린 항체(TgAb)는 3단계에서 가장 높았다(P<0.05). 반면, 갑상선과산화효소 항체(TPOAb), 갑상선자극호르몬 수용체 항체(TRAb), 엽산 및 혈색소는 병기 간 유의한 차이를 보이지 않았다.
사후 쌍별 비교 결과, PGI와 PGI/PGII 비율은 1단계와 2단계 및 1단계와 3단계를 구별할 수 있었으나, 2단계와 3단계는 구별하지 못하였다. 이는 진행된 질환에서 혈청학적 병기 평가가 지니는 내재적 한계를 보여준다.
Machine-learning performance
각 특징 변수 세트에서 가장 우수한 모델의 성능은 표 2에 제시하였다.

세 범주 분류 과제에서는 내시경·혈청학적 결합 세트에 랜덤 포레스트를 적용한 모델이 가장 높은 매크로 평균 AUC(0.878±0.051)와 정확도(74.9%)를 보였다. 그다음으로 WLE 스태킹 앙상블 모델(0.853±0.056)과 WLE+ME-NBI 엘라스틱 넷 모델(0.841±0.038)이 높은 성능을 나타냈다. 반면, 혈청학적 지표만 사용한 모델의 성능은 상당히 낮았으며, 핵심 혈청학적 세트의 스태킹 앙상블 모델은 0.693±0.075, 확장 혈청학적 세트의 랜덤 포레스트 모델은 0.659±0.051의 매크로 평균 AUC를 보였다.
이분형 분류 과제에서는 WLE+ME-NBI 랜덤 포레스트 모델이 0.913±0.046으로 가장 높은 AUC를 나타냈으며, 민감도는 0.816±0.089, 특이도는 0.827±0.134였다. 내시경·혈청학적 결합 랜덤 포레스트 모델의 AUC는 0.907±0.065였고, 가장 높은 특이도(0.886±0.033)와 정확도(85.2%)를 보였다. WLE 단독 랜덤 포레스트 모델의 AUC는 0.887±0.068이었다. 두 혈청학적 지표 기반 이분형 모델의 AUC는 모두 0.693 이하에 머물렀다.
중첩하여 제시한 ROC 곡선(그림 2)에서는 결합 모델과 내시경 기반 모델의 곡선이 혈청학적 지표 기반 모델의 곡선보다 일관되게 위쪽에 위치하였다. 혼동행렬 분석 결과, 가장 우수한 모델들은 1단계와 3단계를 각각 80% 이상의 환자에서 정확하게 분류한 반면, 2단계는 인접한 단계로 가장 빈번하게 오분류되었다.
FIGURE 2. ROC curves comparing the best models across the five feature sets.
(A) Three - class task (macro-averaged). (B) Binary task (early-to-intermediate vs advanced). 
Feature importance and SHAP interpretability
위 주름의 소실은 모든 내시경 기반 모델에서 가장 중요한 특징 변수로 평가되었다. 점막의 얇아짐과 점막하 혈관의 투영도 일관되게 중요도 상위 5개 변수에 포함되었으며, 끈적하게 부착된 농후한 점액과 위소구(areae gastricae)의 종창도 예측에 기여하였다. WLE+ME-NBI 이분형 모델에서는 음와 개구부(CO) 등급과 바렛식도 등급이 각각 두 번째와 세 번째로 중요한 변수였다.
혈청학적 지표 가운데 G-17과 PGI는 세 범주 분류 모델에서 번갈아 중요도 1위와 2위를 차지하였다. 이분형 혈청학적 모델에서는 PGI가 가장 중요한 변수로 평가되었으며, 내시경·혈청학적 결합 모델에서는 PGI/PGII 비율이 높은 예측 기여도를 보였다. PCA 역가, 엽산 및 비타민 B12의 판별력은 상대적으로 제한적이었다.
SHAP 분석(그림 3)에서는 위 주름의 소실, 점막의 얇아짐, 점막하 혈관의 투영, 벗겨진 피부 모양(CSA), 음와 개구부의 소실, 낮은 PGI 및 PGI/PGII 비율, 그리고 장분절 바렛식도가 예측 결과를 진행된 질환 쪽으로 이동시키는 것으로 나타났다. 반면, 점막 부종, 위소구의 종창, 변연 음와상피(MCE)의 종창, 높은 PGI 및 낮은 G-17은 예측 결과를 초기 질환 쪽으로 이동시켰다.
각 단계별 벌떼그림(beeswarm plot)에서는 1단계가 염증성 소견 및 위축성 소견의 부재와 강하게 연관되었고, 3단계는 위축성 소견 및 장분절 바렛식도와 강하게 연관되었다. 반면, 2단계에서는 양방향으로 기여도가 작은 특징들이 넓게 분산된 SHAP 분포가 나타났다. 이는 2단계의 분류 정확도가 상대적으로 낮았던 이유를 모델 해석의 관점에서 설명해 주는 결과이다.
FIGURE 3. SHAP analyses for serology-based and combined feature sets.
(A) Core serum panel. (B)Extended serum panel.

(C) Combined endoscopy + serology — the best three-class model overall. Each sub-panel contains the three-class beeswarm plot, the binary beeswarm plot, and the corresponding mean (|SHAP|) bar plots. Atrophy-related features and low pepsinogen I push predictions toward advanced disease; inflammation related features push toward early disease.


Multicollinearity
31개 변수로 구성된 결합 세트에서 분산팽창계수(VIF)는 PGI가 8.89, PGI/PGII 비율이 6.89였다. 이러한 관련성은 PGI/PGII 비율이 PGI로부터 산출된다는 점에서 기전적으로 설명할 수 있었다. 그 밖의 모든 변수의 VIF는 5.0 미만이었다. Pearson 상관계수의 절댓값이 0.7을 초과한 경우는 PGI와 PGI/PGII 비율 사이에서만 관찰되었다. 결합 세트에서 가장 우수한 성능을 보인 랜덤 포레스트 모델은 공선성을 가진 입력 변수에 비교적 강건하므로, 모든 특징 변수를 최종 모델에 유지하였다.
Discussion
저자들이 아는 한, 본 연구는 AIG 환자 내에서 질환의 단계를 예측하기 위해 머신러닝을 적용한 최초의 연구이다. 통합 진단 기준에 따라 진단된 환자 203명을 대상으로 다섯 가지 특징 변수 세트와 일곱 가지 알고리즘을 평가한 결과, 내시경 소견이 혈청학적 지표보다 현저히 우수한 예측 성능을 보였다. 두 가지 양식의 정보를 결합했을 때 세 범주 분류에서 가장 우수한 성능을 나타냈으며, 결합 모델의 매크로 평균 AUC는 0.878이었다. 또한 ‘진행 단계 대 이전 단계’의 이분형 구분은 내시경 소견만으로도 가능했으며, WLE+ME-NBI 모델의 AUC는 0.913이었다.
본 연구의 환자군은 지금까지 보고된 중국 AIG 환자군 가운데 비교적 규모가 큰 편에 속한다. 또한 정보 누출을 통제한 SMOTE와 중첩 교차검증을 적용함으로써 모델의 일반화 성능을 보수적으로 추정하였다. 이하에서는 본 연구의 주요 결과를 기존 연구의 맥락에서 고찰하고자 한다.
Stage 2 as a transitional, intervention-relevant window
2단계는 모든 분석에서 일관되게 가장 구별하기 어려운 단계였으며, 이는 방법론적 인공물이 아니라 생물학적 특성에 따른 결과로 해석된다. 2단계의 표현형에는 점막 부종과 위소구(areae gastricae)의 종창과 같은 초기 염증성 소견이 일부 남아 있는 동시에, 끈적하게 부착된 농후한 점액, 벗겨진 피부 모양(CSA) 및 위 주름의 부분적 소실과 같은 위축성 변화가 새롭게 나타난다. 2단계의 SHAP 분포는 양방향으로 기여도가 작은 특징들이 넓게 분산된 양상을 보였다.
기전적으로 2단계는 G-17이 가장 높게 상승하고(중앙값 34.8 pmol/L) G세포의 보상 반응이 최대에 이르는 시점이자, 위샘의 화생성 변화가 가장 활발하게 일어나는 단계에 해당한다[17]. 이 단계에서는 가성유문샘화생과 장상피화생이 여전히 진행 중이며, 위벽세포 손상도 지속된다[18]. 따라서 2단계는 자가면역성 손상을 차단함으로써 질환의 진행을 지연시킬 가능성이 있는 치료적 시기에 해당하며, 향후 면역조절 치료의 임상시험에서는 2단계 환자를 우선적인 대상으로 고려해야 한다.
Loss of gastric folds: a near-linear surrogate of ROM
모든 내시경 기반 모델에서 위 주름의 소실이 가장 중요한 예측 인자였으며, 점막의 얇아짐과 점막하 혈관의 투영도 일관되게 중요도 상위 5개 변수에 포함되었다. 이러한 결과는 기전적으로도 타당하다. 위산분비샘이 소실되면 위체부 주름은 팽창성과 탄력을 잃게 되며, 잔존 위산분비점막(ROM)이 약 10% 미만으로 감소하면 위 주름이 완전히 소실되기 때문이다. 따라서 이 세 가지 소견은 진행된 AIG를 평가할 수 있는 간결하고 재현성 높은 내시경적 대리지표를 구성하며, 육안으로 ROM을 추정하는 방법보다 표준화하기가 용이하다.
끈적하게 부착된 농후한 점액은 3단계 환자의 67.5%에서 관찰되었으며, 무산증 상태의 위에서 H. pylori 이외의 요소분해효소 생성 세균이 과증식하여 발생하는 것으로 알려져 있다[9]. 따라서 이 소견 역시 진행된 AIG를 시사하는 추가적인 시각적 단서가 될 수 있다. 반면, 전형적인 염증성 소견인 위소구(areae gastricae)의 종창과 변연 음와상피(MCE)의 종창은 병기가 진행될수록 감소하였으며, SHAP 분석에서도 예측 결과를 초기 질환 방향으로 이동시켰다. 이는 초기 AIG에서 특징적으로 관찰되는 고유판 심부의 림프구 침윤과 일치하는 결과이다[19,20].
Barrett esophagus link
본 연구에서 가장 새롭게 주목할 만한 결과는 환자군에서 바렛식도의 유병률이 66.8%에 달했다는 점이다. 이는 선택되지 않은 일반 위식도역류질환 환자에서 보고된 약 7%보다 거의 10배 높은 수치이다[21]. 또한 AIG의 병기가 진행됨에 따라 단분절 바렛식도에서 장분절 바렛식도로 뚜렷하게 전환되는 양상이 관찰되었으며, 장분절 바렛식도의 유병률은 1단계에서 13.4%였으나 3단계에서는 43.0%로 증가하였다. AIG가 진행될수록 위산 분비가 점차 소실되므로, 이러한 결과는 고전적인 위산 역류 모형만으로는 쉽게 설명하기 어렵다[22].
이를 설명할 수 있는 위산 비의존적 기전으로 두 가지를 생각해 볼 수 있다. 첫째, 위축된 위점막의 장벽 기능이 약화되면서 십이지장 담즙이 식도로 역류하고, 이로 인해 식도점막에 직접적인 화학적 손상이 발생할 수 있다[23]. 둘째, 지속적인 고가스트린혈증이 CCK2 수용체(CCK2R) 양성 분문부 전구세포를 자극하여 바렛 유사 원주상피로 분화하도록 유도할 수 있다[24]. AIG는 무산증과 고가스트린혈증이 함께 나타나는 질환이므로, 바렛식도의 진행에 특히 유리한 환경을 제공할 가능성이 있다. 이러한 결과의 실질적인 임상적 의미는 AIG 환자의 내시경 추적관찰에서 식도에 대한 명확하고 체계적인 평가를 일상적인 검사 항목으로 포함해야 한다는 것이다.
Endoscopy versus serology
혈청학적 지표만을 사용한 모델은 두 분류 과제 모두에서 약 0.69의 AUC에 그쳤다[26]. PGI와 G-17은 2단계와 3단계 사이에서 유의한 차이를 보이지 않았으며, 이는 혈청학적 지표만을 이용한 병기 평가에 내재적인 성능 한계가 있음을 보여준다[25]. 갑상선 자가항체와 혈색소를 추가해도 모델의 성능은 향상되지 않았으며, 오히려 예측에 불필요한 잡음을 더했을 가능성이 있다.
내시경 소견에 핵심 혈청학적 지표 패널을 결합하면 세 범주 분류 과제의 성능은 0.853에서 0.878로 향상되었다. 그러나 이분형 분류에서는 내시경 단독 모델보다 성능이 더 향상되지 않았다. 이는 세부적인 병기 평가에서는 혈청학적 검사가 보조 수단으로서 제한적이나마 도움이 될 수 있지만, 진행된 질환과 그 이전 단계를 구분하는 이분형 평가에는 내시경 소견만으로도 충분할 수 있음을 시사한다.
Comparison with prior work
CorpusNet-AIG[11]와 다기관 융합 모델[12] 등 영상 기반 AIG 딥러닝 시스템은 0.97을 초과하는 진단 AUC를 보이지만, 이러한 모델은 AIG 환자와 비AIG 환자를 구분하는 데 초점을 두며 AIG 환자 내에서 병기를 평가하는 것은 아니다. 따라서 본 연구는 기존 연구와 경쟁하는 것이 아니라 이를 보완하는 연구라고 할 수 있다.
본 연구에서 사용한 SHAP 기반 해석은 각 임상적 특징이 예측에 기여하는 방향과 크기를 정량화함으로써, 영상 기반 인공지능에서 사용하는 픽셀 수준의 Grad-CAM 중요 영역 시각화를 보완한다. 본 연구의 결과는 자가면역성 위염과 만성 위염이 나타내는 보다 광범위한 임상적·병리학적 스펙트럼 안에서 해석되어야 한다[27,28].
Limitations
본 연구는 단일기관에서 시행된 후향적 연구이므로, 향후 다기관 외부 검증이 필요하다. ROM 면적은 여전히 관찰자가 육안으로 판정하며, 특히 병기 경계값 부근에서는 판단의 주관성이 개입될 수 있다. 따라서 ROM 면적을 객관적이고 자동화된 방식으로 정량화하는 것이 자연스러운 다음 연구 단계가 될 것이다.
또한 본 연구에서는 각 특징과 조직학적 소견 사이의 개별적인 연관성을 분석하지 않았다. 향후 생검 결과를 기준으로 삼는 전향적 코호트 연구를 통해 병리학적 해석을 강화할 필요가 있다. 아울러 2단계 환자를 더 많이 포함한 연구는 세부적인 병기 판별 성능을 향상하는 데 도움이 될 수 있다.
Conclusions
통합 진단 기준에 따라 진단된 AIG 환자 203명을 대상으로 한 본 연구에서 머신러닝은 질환 내 중증도를 병기화할 수 있는 실현 가능하고 해석 가능한 분석 체계를 제공하였다. 백색광 내시경(WLE)에서는 위 주름의 소실, 점막의 얇아짐 및 점막하 혈관의 투영이, 확대 협대역 영상 내시경(ME-NBI)에서는 음와 개구부 등급과 벗겨진 피부 모양(cast-off skin appearance)이 주요 예측 인자로 나타났으며, 이러한 내시경 소견은 혈청학적 지표보다 우수한 예측 성능을 보였다.
내시경 소견과 핵심 혈청학적 지표를 결합한 모델은 세 범주 병기 분류에서 가장 높은 성능을 나타냈으며, 매크로 평균 AUC는 0.878이었다. 반면, 진행된 질환을 구분하는 이분형 분류에는 내시경 소견만으로도 충분한 성능을 보였으며, WLE+ME-NBI 모델의 AUC는 0.913, 민감도는 0.80을 초과하였다.
2단계는 자가면역성 손상이 여전히 활발하게 진행되는 동시에 위샘의 화생성 변화가 가장 두드러지는 과도기적 단계로 확인되었으며, 치료적 개입과 관련하여 중요한 시기에 해당할 가능성이 있다. 또한 전체 환자의 66.8%에서 바렛식도가 관찰되었고, 장분절 바렛식도는 진행된 AIG에서 3.3배 더 흔하게 나타났다. 이러한 결과는 AIG 환자의 추적관찰 과정에서 식도에 대한 명확하고 체계적인 평가를 일상적으로 시행할 필요성을 뒷받침한다.
향후 다기관 외부 검증을 거친다면, 본 연구에서 제시한 다중 특징 지표 체계와 머신러닝 분석 과정은 AIG 환자의 정밀한 감시 전략과 개별화된 임상 관리에 활용될 수 있을 것이다. 특히 진행된 질환에서 종양 감시를 적절한 시점에 시작하는 데 유용한 근거를 제공할 수 있다.
<Abstract>
Objectives: Autoimmune gastritis (AIG) lacks a unified, practical staging system. The AIG-atrophic stage (AIG-AS) scheme, based on the proportional area of remnant oxyntic mucosa (ROM), is promising but observer-dependent. We developed machine-learning models to stage AIG using endoscopic and serological features.
Methods: This single-center cross-sectional study enrolled 203 patients with AIG confirmed by integrated endoscopic, histological, and serological criteria between December 2023 and December 2025. White-light endoscopy (WLE), magnifying endoscopy with narrow-band imaging (ME-NBI), and a serum panel were collected. Patients were classified under AIG-AS as Stage 1 (50%<ROM ≤ 100%), Stage 2 (10%<ROM ≤ 50%), or Stage 3 (ROM ≤ 10%), and additionally as early-to-intermediate (Stages 1 + 2) versus advanced (Stage 3). Seven algorithms-LASSO logistic regression, elastic net, random forest, XGBoost, support vector machine, gradient boosting, and stacking-were trained on five feature sets using stratified 5-fold nested cross-validation, with SMOTE applied only within training folds. SHAP analysis provided interpretability.
Results: Stages 1, 2, and 3 included 87 (42.9%), 36 (17.7%), and 80 (39.4%) patients. The combined endoscopy+serology random forest achieved the highest three-class macro-AUC (0.878 ± 0.051; accuracy 74.9%), surpassing WLE stacking (0.853 ± 0.056) and serology-only models (≤0.693). For binary staging, the WLE+ME-NBI random forest reached an AUC of 0.913 ± 0.046. Loss of gastric folds, gastrin-17, pepsinogen I, crypt-opening grade, and cast-off skin appearance were the dominant predictors. Barrett esophagus prevalence was 66.8%, with long-segment Barrett esophagus 3.3-fold more common in advanced AIG than in earlier disease.
Conclusions: Multi-modal machine learning enables accurate, interpretable AIG staging. Endoscopic features outperform serology, and combined models offer the best three-class performance. The high prevalence of Barrett esophagus supports routine esophageal surveillance in AIG.
Keywords: Barrett esophagus; atrophic; autoantibodies; endoscopy; gastritis; gastrointestinal; machine learning.
References
1. Massironi S, Gallo C, Lahner E, Sciola V, Cavalcoli F, Lenti MV, et al. Occurrence and characteristics of endoscopic gastric polyps in patients with autoimmune gastritis (AGAPE study): A multicentric cross-sectional study. Digestive Liver Dis. (2025) 57:198–205. doi: 10.1016/j.dld.2024.07.024
2. Terao S, Suzuki S, Nishizawa A, Imai Y, Kushima R. Autoimmune gastritis: Stage classification and imaging findings—Comprehensive understanding of clinical, labo ratory, endoscopic, and pathological findings according to disease stage. Stomach Intestine. (2024) 59:10–21. [in Japanese].
3. Kushima R, Kotera T, Terao S. Histopathological findings of autoimmune gastritis. Stomach Intestine. (2024) 59:23–33. doi: 10.1186/s12876-022-02251-8. [in Japanese].
4. Kamada T, Maruyama Y, Monobe Y, Haruma K. Endoscopic features and clinical importance of autoimmune gastritis. Digestive Endoscopy. (2022) 34:700–13. doi: 10.1111/den.14175
5. Kimura K, Takemoto T. An endoscopic recognition of the atrophic border and its significance in chronic gastritis. Endoscopy. (1969) 1:87–97. doi: 10.1055/s-0028 1098086
6. Coati I, Fassan M, Farinati F, Graham DY, Genta RM, Rugge M. Autoimmune gastritis: Pathologist’s viewpoint.World J Gastroenterol. (2015) 21:12179–89. doi: 10.3748/wjg.v21.i42.12179
7. Kishino M, Nonaka K. Endoscopic features of autoimmune gastritis: Focus on typical images and early images. J Clin Med. (2022) 11:3523. doi: 10.3390/jcm11123523
8. Maruyama Y, Yasuda K, Baba S, Yoshii S, Kageoka M, Ohata A, et al. Endoscopic diagnosis of autoimmune gastritis—Endoscopic findings of early, middle, and end stage disease: A proposal of the AIG-atrophic stage (AIG-AS). Stomach Intestine. (2024) 59:34–46. [in Japanese].
9. Terao S, Suzuki S, Yaita H, Kurahara K, Shunto J, Furuta T, et al. Multicenter study of autoimmune gastritis in Japan: Clinical and endoscopic characteristics. Digestive Endoscopy. (2020) 32:364–72. doi: 10.1111/den.13500
10. Tao J, Zhang Z, Meng L, Zhang L, Wang J, Li Z. Risk prediction model for precancerous gastric lesions based on magnifying endoscopy combined with narrow band imaging features. Front Oncol. (2025) 15:1554523. doi: 10.3389/fonc.2025. 1554523
11. Song Y, Zhang X, Shi L, Lu J, Li Z, Wang R, et al. Artificial intelligence for single image diagnosis of autoimmune gastritis using gastric corpus atrophy images: A multicenter retrospective diagnostic study. J Gastroenterol Hepatol. (2026) 41 (4):1292–302. doi: 10.1111/jgh.70296. advance online publication.
12. Chen S, Xu L, Yan L, Zhang J, Zhou X, Wang J, et al. A novel endoscopic artificial intelligence system to assist in the diagnosis of autoimmune gastritis: A multicenter study. Endoscopy. (2025) 57:299–309. doi: 10.1055/a-2451-3071
13. Kamada T, Watanabe H, Furuta T, Terao S, Maruyama Y, Kawachi H, et al. Diagnostic criteria and endoscopic and histological findings of autoimmune gastritis in Japan. J Gastroenterol. (2023) 58:185–95. doi: 10.1007/s00535-022-01954-9
14. Sharma P, Dent J, Armstrong D, Bergman JJGHM, Gossner L, Hoshihara Y, Jankowski JAJ, et al. The development and validation of an endoscopic grading system for Barrett’s esophagus: The Prague C & M criteria. Gastroenterology. (2006) 131:1392 9. doi: 10.1053/j.gastro.2006.08.032
15. Doyama H, Yoshida N, Tsuyama S, Ota R, Takeda Y, Nakanishi H, et al. The ‘White Globe Appearance’ (WGA): A novel marker for a correct diagnosis of early gastric cancer by magnifying endoscopy with narrow-band imaging (M-NBI). Endoscopy Int Open. (2015) 3:E120–4. doi: 10.1055/s-0034-1391026
16. Maruyama Y, Yoshii S, Kageoka M. Features of magnifying endoscopic findings in type A gastritis. Stomach Intestine. (2018) 53:1516–21. [in Japanese].
17. Goldenring JR, Mills JC. Cellular plasticity, reprogramming, and regeneration: Metaplasia in the stomach and beyond. Gastroenterology. (2022) 162:415–30. doi: 10.1053/j.gastro.2021.10.036
18. Jeong S, Choi E, Petersen CP, Roland JT, Federico A, Ippolito R, et al. Distinct metaplastic and inflammatory phenotypes in autoimmune and adenocarcinoma associated chronic atrophic gastritis. United Eur Gastroenterol J. (2017) 5:37–44. doi: 10.1177/2050640616644142
19. Kishino M, Yao K, Hashimoto H, Nitta H, Kure R, Yamamoto A, et al. A case of early autoimmune gastritis with characteristic endoscopic findings. Clin J Gastroenterol. (2021) 14:718–24. doi: 10.1007/s12328-021-01351-4
20. Kotera T, Ayaki M, Sumi N, Aoki R, Mabe K, Inoue K, et al. Characteristic endoscopic findings in early-stage autoimmune gastritis. Endoscopy Int Open. (2024) 12:E332–8. doi: 10.1055/a-2215-3284
21. Saha B, Vantanasiri K, Mohan BP, Goyal R, Garg N, Gerberi D, et al. Prevalence of Barrett’s esophagus and esophageal adenocarcinoma with and without gastroesopha geal reflux: A systematic review and meta-analysis. Clin Gastroenterol Hepatol. (2024) 22:1381–1394.e7. doi: 10.1016/j.cgh.2023.10.006
22. Shaheen NJ, Richter JE. Barrett’s oesophagus. Lancet. (2009) 373:850–61.
23. Attwood SE, Harrison LA, Preston SL, Jankowski JAJ. Esophageal adenocarcinoma in ‘mice and men’: Back to basics! Am J Gastroenterol. (2008) 103:2367–72. doi: 10.1016/j.ajg.2008.02.091
24. Lee Y, Urbanska AM, Hayakawa Y, Wang H, Au AS, Luna AM, et al. Gastrin stimulates a cholecystokinin-2-receptor-expressing cardia progenitor cell and promotes progression of Barrett’s-like esophagus. Oncotarget. (2016) 7:203–14. doi: 10.18632/ oncotarget.10667
25. Zagari RM, Rabitti S, Greenwood DC, Eusebi LH, Vestito A, Bazzoli F. Systematic review with meta-analysis: Diagnostic performance of the combination of pepsinogen, gastrin-17, and anti–Helicobacter pylori antibodies serum assays for the diagnosis of atrophic gastritis. Alimentary Pharmacol Ther. (2017) 46:657–67. doi: 10.1111/ apt.14248
26. Li D, Yu H, Jin B, Dong D, Cheng L, Dong W. Machine learning models using serum gastric biomarkers for the non-invasive prediction of atrophic gastritis: A comparative study. Front Med (Lausanne). (2026) 13:1757004. doi: 10.3389/ fmed.2026.1757004
27. Rugge M,Savarino E, Sbaraglia M, Bricca L, Malfertheiner P. Gastritis: The clinico pathological spectrum. Digestive Liver Dis. (2021) 53:1237–46. doi: 10.1016/ j.dld.2021.03.007
28. Castellana C, Eusebi LH, Dajti E, Iascone V, Vestito A, Fusaroli P, et al. Autoimmune atrophic gastritis: A clinical review. Cancers. (2024) 16:1310. doi: 10.3390/cancers16071310
Tao J, Meng L, Li T, Wang J, Zhang L, Zhang X, Li Z.
Front Immunol. 2026 Jul 29;17:1883686. doi: 10.3389/fimmu.2026.1883686.
Introduction
자가면역성 위염(autoimmune gastritis, AIG)은 T세포 매개성 위벽세포 파괴, 무산증 및 진행성 위체부·위저부 위축을 특징으로 하는 만성 장기 특이적 자가면역질환이다[1–3]. 주로 중년 및 고령 여성에서 발생하며, 자가면역성 갑상선질환과 제1형 당뇨병을 비롯한 다른 자가면역질환이 흔히 동반된다[1]. 임상 양상이 서서히 나타나기 때문에 상당수의 환자는 질환이 이미 진행된 단계에 이른 후에야 진단된다. AIG는 초기의 염증세포 침윤 단계에서 시작하여, 위산분비샘이 가성유문샘화생으로 대체되는 활동기 단계를 거쳐, 장상피화생이 주를 이루는 진행된 선 구조 재형성 단계에 이르기까지 연속적으로 진행하며, 각 단계에 따라 내시경적·혈청학적 소견과 임상적 위험 양상이 다르게 나타난다[2]. 진행된 질환에서는 지속적인 고가스트린혈증과 장크롬친화세포 유사세포(enterochromaffin-like cell) 증식으로 제1형 위 신경내분비종양의 발생 위험이 현저히 증가하므로 체계적인 내시경 감시가 필요하다. 반면, 초기 단계에서는 자가면역성 손상이 여전히 활발하게 진행되므로 원칙적으로 이를 조절할 가능성이 있다[4]. 따라서 AIG의 질환 내 단계를 정확하게 평가하는 것은 환자별 감시 전략과 위험도 층화를 위해 반드시 필요하다.
이러한 임상적 중요성에도 불구하고 현재 AIG에 대한 통일된 병기 분류 체계는 확립되어 있지 않다. Kimura–Takemoto 분류[5]는 Helicobacter pylori 연관 위축성 위염에서 위축이 전정부에서 위체부 방향으로 진행하는 양상을 평가하기 위해 개발되었으므로, AIG에서 나타나는 이른바 ‘역위축(reverse atrophy)’ 양상에는 적합하지 않다[2]. 조직학적 3단계 분류[6]는 질환의 진행 과정을 포괄적으로 반영하지만, 표적 생검에 의존한다는 한계가 있다. AIG의 위축은 공간적으로 균일하지 않기 때문에 특정 지점에서 시행한 생검만으로는 위점막 전체의 상태를 제대로 반영하기 어렵고, 광범위하게 얇아진 위벽에서는 여러 부위의 생검으로 인한 출혈 위험도 증가한다. 한 조직학적 확진 환자군 연구에서는 모든 환자가 활동기 또는 말기 단계로 분류되었는데, 이는 초기 질환을 놓칠 수 있는 상당한 사각지대가 존재함을 시사한다[7]. 따라서 전체 위점막의 전반적인 특징을 바탕으로 위축의 진행 정도를 평가할 수 있는 객관적인 ‘전체 영역(whole-field)’ 내시경 평가법을 마련하는 것이 중요한 미충족 과제이다.
Maruyama 등은 최근 잔존 위산분비점막(remnant oxyntic mucosa, ROM)이 차지하는 면적의 비율을 기준으로 자가면역성 위염 위축 단계(AIG-atrophic stage, AIG-AS) 분류를 제안하였다. 이 분류는 1단계(50%<ROM≤100%), 2단계(10%<ROM≤50%), 3단계(ROM≤10%)로 구성된다[8]. ROM은 위점막 전체를 대상으로 잔존 위산분비샘의 정도를 역동적으로 추정할 수 있는 지표이다[2]. 그러나 ROM 면적은 주관적으로 판정되며, 특히 단계의 경계값 부근에서는 관찰자 간 의견이 자주 일치하지 않는다. 다기관 검증 연구에서 보고된 관찰자 간 카파값도 약 0.50으로 중등도 수준에 그쳤다[9]. 따라서 AIG-AS를 기반으로 객관적이고 정량적이며 다차원적인 예측 인자를 구축하는 것은 여전히 해결되지 않은 과제로 남아 있다.
머신러닝은 H. pylori 연관 위축성 위염의 OLGA/OLGIM 병기 평가[10]와 영상 기반 AIG 진단[11,12]에 성공적으로 적용되어 왔으며, 다기관 딥러닝 시스템은 0.97을 초과하는 곡선하면적(area under the curve, AUC)을 보였다. 그러나 저자들이 아는 한, AIG 환자 내에서 질환 단계를 예측하는 데 머신러닝을 적용한 연구는 아직 없다. 이에 본 연구에서는 통합 진단 기준에 따라 AIG로 진단된 환자를 등록하고, 백색광 내시경(white-light endoscopy, WLE) 소견, 확대 협대역 영상 내시경(magnifying endoscopy with narrow-band imaging, ME-NBI) 소견 및 혈청학적 검사 패널을 수집하였다. 또한 AIG-AS를 병기 분류 체계로 채택하고, 단계 예측 모델을 구축하며 각 특징이 예측에 기여하는 정도를 정량화하기 위해 여러 알고리즘으로 구성된 분석 파이프라인을 구축하였다. 본 연구의 목적은 AIG의 정밀한 병기 평가와 환자별 맞춤형 감시 전략을 위한 근거를 마련하는 것이었다.
Methods
Study design and patients
본 단일기관 단면연구는 2023년 12월부터 2025년 12월까지 베이징중의약대학교 동직문병원 소화기내과에서 자가면역성 위염(AIG)으로 진단받은 환자를 대상으로 하였다. 모든 환자는 일반적인 백색광 내시경(white-light endoscopy, WLE)을 이용한 표준 상부위장관 내시경검사를 받았으며, 일부 환자에서는 동일한 검사 중 확대 협대역 영상 내시경(magnifying endoscopy with narrow-band imaging, ME-NBI)을 추가로 시행하였다. 혈청학적 검사는 내시경검사 시점을 전후하여 시행하였다. 최초 연구 대상에 해당한 환자 235명 가운데 32명을 제외하였으며, 최종적으로 환자 203명과 내시경 영상 11,557장을 분석에 포함하였다. 내시경검사는 최소 5년 이상의 경험을 갖춘 전문의급 이상의 소화기내과 의사가 시행하였다. 본 연구는 동직문병원 연구윤리위원회의 승인을 받았으며(승인번호 DZM-EC-2025-540), 헬싱키선언에 따라 수행되었다. 본 연구는 비식별화된 임상자료와 보관된 내시경 영상을 이용한 후향적 단면연구였으므로, 연구윤리위원회는 서면동의 취득 요건을 면제하였다.
Diagnostic and staging criteria
AIG는 2023년 일본 A형 위염 진단기준[13]과 2024년 『Stomach and Intestine』 단행본[2,3,8]에 따라 내시경적·조직학적·혈청학적 기준을 통합하여 확진하였다. 연구의 포함 기준은 다음과 같았다. 첫째, 내시경검사 및/또는 조직검사에서 위체부·위저부 위축이 확인된 경우, 둘째, 벽세포 항체(parietal cell antibody, PCA) 및/또는 내인자 항체가 양성인 경우, 셋째, 13C/14C 요소호기검사 또는 신속요소분해효소검사 결과가 음성인 경우, 넷째, 연령이 18–85세인 경우, 다섯째, 내시경 영상 기록이 완전하게 보존된 경우였다. 제외 기준은 위 수술의 과거력, 위 신경내분비종양을 제외한 조직학적 악성종양, 자가면역 이외의 원인에 의한 위축, 중증 동반질환, 임신 또는 수유 중인 경우 및 불완전한 의무기록이었다.
AIG의 단계는 AIG-AS 분류체계에 따라 결정하였다[8]. 이분형 분류에서는 AIG-AS 1단계와 2단계를 초기–중간 단계 AIG로 통합하고, 3단계는 진행된 AIG로 구분하였다. 이는 종양 발생에 대한 강화된 감시를 언제 시작할 것인가라는 임상적 질문을 반영한 것이다.
Feature collection
백색광 내시경(WLE)에서는 위체부, 위저부, 전정부, 위각부 및 식도의 소견을 기록하였다. 평가 항목에는 점막의 얇아짐, 점막하 혈관의 투영, 위 주름의 소실, 위소구(areae gastricae)의 종창, 점막 부종, 발적 양상(점상형, 지도상형, 미만형), 끈적하게 부착된 농후한 점액, 과형성 용종, 잔존 위산분비점막(ROM)의 형태학적 아형, 보존된 전정부 점막의 범위(0–3등급), 그리고 Prague C&M 기준[14]에 따른 바렛식도(Barrett esophagus, BE)의 등급[없음, 단분절(<3 cm), 장분절(≥3 cm)]이 포함되었다.
확대 협대역 영상 내시경(ME-NBI) 평가 항목에는 가성유문샘화생, 벗겨진 피부 모양(cast-off skin appearance, CSA), 백색 구상 외관(white globe appearance, WGA)[15], 변연 음와상피(marginal crypt epithelium, MCE)의 종창, 백색 불투명 물질(white opaque substance), 연청색 융기(light blue crest), 경계선(demarcation line), 불규칙한 미세혈관·미세표면 양상 및 음와 개구부(crypt opening, CO)의 등급이 포함되었다. CO 등급은 1등급이 점상 형태, 2등급이 불분명한 형태, 3등급이 짧은 막대 모양, 4등급이 개구부가 관찰되지 않는 경우로 정의하였다[16].
혈청학적 지표에는 펩시노겐 I(pepsinogen I, PGI), 펩시노겐 II(PGII), PGI/PGII 비율, 가스트린-17(gastrin-17, G-17), 벽세포 항체(PCA) 역가(1:40–1:3200, 로그 변환 후 순서형 변수로 처리), 엽산, 비타민 B12, 혈색소 및 갑상선 자가항체인 갑상선과산화효소 항체(TPOAb), 갑상선글로불린 항체(TgAb), 갑상선자극호르몬 수용체 항체(TRAb)가 포함되었다. 결측률이 50%를 초과한 지표인 항-H. pylori I형·II형 항체, 내인자 항체 및 갑상선기능검사는 모델링에서 제외하였다.
내시경 영상은 두 명의 숙련된 내시경 전문의가 서로 독립적으로 판독하였으며, 판독 결과가 일치하지 않는 경우 세 번째 전문의가 최종 판정하였다.
조직학적 소견은 두 명의 병리의사가 서로 독립적으로 검토하였다.
Statistical analysis
연속형 변수는 평균±표준편차 또는 중앙값(제1사분위수–제3사분위수)으로 제시하였고, 범주형 변수는 빈도와 백분율[n(%)]로 제시하였다. 세 군 간 비교에서는 연속형 변수에 대해 일원배치 분산분석 또는 Kruskal–Wallis 검정을 사용하였으며, 범주형 변수에는 카이제곱검정 또는 G-검정을 적용하였다. 이분형 비교에서는 연속형 변수에 대해 독립표본 t-검정 또는 Mann–Whitney U 검정을 사용하였고, 범주형 변수에는 카이제곱검정 또는 Fisher의 정확검정을 적용하였다. 전체 군 간 차이가 유의한 경우에는 Bonferroni 보정을 적용한 사후 쌍별 비교를 시행하였다.
효과크기는 세 군의 연속형 변수 비교에서 η² 또는 ε², 범주형 변수 비교에서 Cramér의 V, 이분형 연속형 변수 비교에서 Cohen의 d 또는 순위양분상관계수(rank-biserial r)로 산출하였다. 모든 검정은 양측검정으로 시행하였으며, 유의수준 α는 0.05로 설정하였다. 통계분석에는 SPSS version 30.0(IBM, Armonk, NY, USA)을 사용하였다.
Machine-learning modeling
다섯 가지 특징 변수 세트를 구성하였다. 첫째는 백색광 내시경(WLE) 세트(n=203), 둘째는 WLE와 확대 협대역 영상 내시경(ME-NBI)을 결합한 세트(n=160), 셋째는 결측률이 50% 미만인 7개 지표, 즉 PGI, PGII, PGI/PGII 비율, PCA 역가, G-17, 엽산 및 비타민 B12로 구성된 핵심 혈청학적 세트, 넷째는 여기에 TPOAb, TgAb, TRAb 및 혈색소를 추가한 11개 지표의 확장 혈청학적 세트, 다섯째는 WLE와 핵심 혈청학적 지표를 통합한 내시경·혈청학적 결합 세트(31개 변수)였다.
각 특징 변수 세트에는 LASSO 로지스틱 회귀, 엘라스틱 넷(elastic net), 랜덤 포레스트(random forest), XGBoost, 서포트 벡터 머신(support vector machine, SVM), 그래디언트 부스팅(gradient boosting) 및 스태킹 앙상블(stacking ensemble)의 7가지 알고리즘을 적용하였다. 스태킹 앙상블에서는 랜덤 포레스트, XGBoost 및 SVM을 기본 학습기로 사용하고, 로지스틱 회귀를 메타 학습기로 사용하였다.
층화 5겹 교차검증을 시행하였으며, 각 훈련 폴드 내에서 하이퍼파라미터를 조정하기 위해 중첩 3겹 무작위 탐색을 적용하여 모델별로 10개의 후보 조합을 평가하였다. 특징 변수별 중앙값 대치, 분산이 0인 변수의 제거 및 Z-점수 표준화로 구성된 전처리 과정과 2단계 환자 수가 36명인 클래스 불균형을 보정하기 위한 합성 소수 클래스 과표본추출 기법(synthetic minority oversampling technique, SMOTE)은 정보 누출을 방지하기 위해 훈련 폴드 내에서만 적용하였다. 검사 폴드에서는 원래의 클래스 분포를 그대로 유지하였다.
주요 평가 지표는 세 범주 분류 과제에서는 매크로 평균 곡선하면적(macro-averaged area under the curve, macro-averaged AUC)이었고, 이분형 분류 과제에서는 AUC였다. 특징 중요도는 트리 기반 모델에서는 지니 중요도(Gini importance), 선형 모델에서는 표준화 회귀계수, SVM과 스태킹 앙상블에서는 순열 중요도(permutation importance)를 이용하여 산출하였다. 각 특징 변수 세트에서 가장 우수한 성능을 보인 트리 기반 모델은 SHAP을 이용하여 추가로 분석하였다. 결합 세트의 다중공선성은 Pearson 상관계수(|r|>0.7)와 분산팽창계수(variance inflation factor, VIF>10)를 이용하여 평가하였다. 분석은 Python 3.13 환경에서 scikit-learn, XGBoost, imbalanced-learn 및 SHAP 라이브러리를 사용하여 수행하였다.
Results
Patient characteristics
전체 환자 203명 중 여성은 131명(64.5%), 남성은 72명(35.5%)으로 남녀 비는 1:1.8이었으며, 연령의 중앙값은 62세였다(제1–제3사분위수, 54–67세). AIG-AS에 따른 분포는 1단계 87명(42.9%), 2단계 36명(17.7%), 3단계 80명(39.4%)이었다. 이분형으로 분류하였을 때는 초기–중간 단계가 123명(60.6%), 진행 단계가 80명(39.4%)이었다. 연령과 성별은 단계에 따라 유의한 차이를 보이지 않았다(P>0.05)(표 1, 그림 1A). 이 가운데 160명은 ME-NBI 검사를 추가로 받았으며, AIG-AS 1단계가 68명, 2단계가 26명, 3단계가 66명이었다.
FIGURE 1 Stage distribution and frequency of endoscopic features across AIG-AS stages.
(A) Distribution of patients across the three-class and binary schemes.
Endoscopic features across stages
백색광 내시경(WLE)에서는 서로 반대 방향으로 변화하는 두 가지 소견군이 병기 진행의 연속적인 양상을 형성하였다(그림 1B, C).
FIGURE 1. (B) Heat map of WLE feature frequency across stages — corpus and fundus. (C) Heat map of WLE feature frequency —antrum and incisura angularis.
위축 관련 소견은 병기가 진행할수록 일관되게 증가하였다. 점막의 얇아짐은 1단계의 34.5%에서 3단계의 90.0%로 증가하였고, 점막하 혈관의 투영은 20.7%에서 75.0%로, 위 주름의 소실은 14.9%에서 85.0%로 증가하였다(모두 P<0.001). 집합세정맥의 규칙적 배열 소실은 2–3단계에서 100%에 이르렀다(P<0.001). 끈적하게 부착된 농후한 점액은 1단계(34.5%)보다 2단계(69.4%)와 3단계(67.5%)에서 더 흔하게 관찰되었다(P<0.001).
반대로 염증 및 부종과 관련된 소견은 병기가 진행할수록 감소하였다. 점막 부종은 74.7%에서 32.5%로 감소하였고(P<0.001), 위소구(areae gastricae)의 종창은 71.3%에서 35.0%로(P<0.001), 위 주름의 비대는 29.9%에서 12.5%로 감소하였다(P<0.01). 점상형, 지도상형 및 미만형 발적은 1단계에서 가장 흔했으며, 이후 단계에서는 대부분 관찰되지 않았다(모두 P<0.05). Bonferroni 보정을 적용한 사후 쌍별 비교에서 위 주름의 소실은 모든 병기 전환을 유의하게 구별하였다(1단계 대 2단계, P=0.003; 2단계 대 3단계, P<0.001).
ME-NBI를 시행한 160명에서는(그림 1D) 벗겨진 피부 모양(cast-off skin appearance, CSA)이 1단계의 32.4%에서 2단계의 88.5%로 급격히 증가하였으며, 3단계에서는 77.3%로 나타났다(P<0.001). 백색 구상 외관(white globe appearance, WGA)도 이와 유사한 양상을 보였다(각각 17.6%, 46.2%, 42.4%; P=0.002). 변연 음와상피(marginal crypt epithelium, MCE)의 종창은 병기가 진행함에 따라 감소하였으며(각각 72.1%, 61.5%, 33.3%; P<0.001), 이는 WLE에서 관찰된 위소구 종창의 변화 양상과 일치하였다. 음와 개구부가 관찰되지 않는 CO 4등급은 1단계의 25.4%에 비해 2단계와 3단계에서 각각 73.1%와 87.3%로 우세하게 나타났다(P<0.001).
FIGURE 1. (D) Heat map of ME-NBI feature frequency across stages.
바렛식도는 전체 환자의 66.8%에서 관찰될 정도로 매우 높은 유병률을 보였으며, 단분절 바렛식도는 41.3%, 장분절 바렛식도는 25.5%였다. 장분절 바렛식도의 유병률은 1단계의 13.4%에서 3단계의 43.0%로 증가한 반면(P<0.001), 단분절 바렛식도는 1단계에서 가장 흔하게 관찰되었다(54.9%).
Serological features
PGI는 병기가 진행됨에 따라 점진적으로 감소하였다(중앙값 67.6→30.2→23.7 μg/L, P<0.001). PGI/PGII 비율도 이와 유사하게 감소하였다(4.21→1.89→2.10, P<0.001). PGII는 소폭 감소하였다(P=0.002). G-17은 비선형적 변화 양상을 보였으며, 2단계에서 중앙값 34.8 pmol/L로 가장 높았고 1단계에서 7.4 pmol/L로 가장 낮았다(P<0.001). 비타민 B12는 병기가 진행됨에 따라 점진적으로 감소하였다(581.5→411.0→375.0 pg/mL, P=0.010).
벽세포 항체(PCA) 양성률은 1단계의 61.7%에서 2단계의 85.3%와 3단계의 81.8%로 증가하였으나(P=0.005), PCA 역가는 병기 간 유의한 차이를 보이지 않았다. 갑상선글로불린 항체(TgAb)는 3단계에서 가장 높았다(P<0.05). 반면, 갑상선과산화효소 항체(TPOAb), 갑상선자극호르몬 수용체 항체(TRAb), 엽산 및 혈색소는 병기 간 유의한 차이를 보이지 않았다.
사후 쌍별 비교 결과, PGI와 PGI/PGII 비율은 1단계와 2단계 및 1단계와 3단계를 구별할 수 있었으나, 2단계와 3단계는 구별하지 못하였다. 이는 진행된 질환에서 혈청학적 병기 평가가 지니는 내재적 한계를 보여준다.
Machine-learning performance
각 특징 변수 세트에서 가장 우수한 모델의 성능은 표 2에 제시하였다.
세 범주 분류 과제에서는 내시경·혈청학적 결합 세트에 랜덤 포레스트를 적용한 모델이 가장 높은 매크로 평균 AUC(0.878±0.051)와 정확도(74.9%)를 보였다. 그다음으로 WLE 스태킹 앙상블 모델(0.853±0.056)과 WLE+ME-NBI 엘라스틱 넷 모델(0.841±0.038)이 높은 성능을 나타냈다. 반면, 혈청학적 지표만 사용한 모델의 성능은 상당히 낮았으며, 핵심 혈청학적 세트의 스태킹 앙상블 모델은 0.693±0.075, 확장 혈청학적 세트의 랜덤 포레스트 모델은 0.659±0.051의 매크로 평균 AUC를 보였다.
이분형 분류 과제에서는 WLE+ME-NBI 랜덤 포레스트 모델이 0.913±0.046으로 가장 높은 AUC를 나타냈으며, 민감도는 0.816±0.089, 특이도는 0.827±0.134였다. 내시경·혈청학적 결합 랜덤 포레스트 모델의 AUC는 0.907±0.065였고, 가장 높은 특이도(0.886±0.033)와 정확도(85.2%)를 보였다. WLE 단독 랜덤 포레스트 모델의 AUC는 0.887±0.068이었다. 두 혈청학적 지표 기반 이분형 모델의 AUC는 모두 0.693 이하에 머물렀다.
중첩하여 제시한 ROC 곡선(그림 2)에서는 결합 모델과 내시경 기반 모델의 곡선이 혈청학적 지표 기반 모델의 곡선보다 일관되게 위쪽에 위치하였다. 혼동행렬 분석 결과, 가장 우수한 모델들은 1단계와 3단계를 각각 80% 이상의 환자에서 정확하게 분류한 반면, 2단계는 인접한 단계로 가장 빈번하게 오분류되었다.
FIGURE 2. ROC curves comparing the best models across the five feature sets.
(A) Three - class task (macro-averaged). (B) Binary task (early-to-intermediate vs advanced).
Feature importance and SHAP interpretability
위 주름의 소실은 모든 내시경 기반 모델에서 가장 중요한 특징 변수로 평가되었다. 점막의 얇아짐과 점막하 혈관의 투영도 일관되게 중요도 상위 5개 변수에 포함되었으며, 끈적하게 부착된 농후한 점액과 위소구(areae gastricae)의 종창도 예측에 기여하였다. WLE+ME-NBI 이분형 모델에서는 음와 개구부(CO) 등급과 바렛식도 등급이 각각 두 번째와 세 번째로 중요한 변수였다.
혈청학적 지표 가운데 G-17과 PGI는 세 범주 분류 모델에서 번갈아 중요도 1위와 2위를 차지하였다. 이분형 혈청학적 모델에서는 PGI가 가장 중요한 변수로 평가되었으며, 내시경·혈청학적 결합 모델에서는 PGI/PGII 비율이 높은 예측 기여도를 보였다. PCA 역가, 엽산 및 비타민 B12의 판별력은 상대적으로 제한적이었다.
SHAP 분석(그림 3)에서는 위 주름의 소실, 점막의 얇아짐, 점막하 혈관의 투영, 벗겨진 피부 모양(CSA), 음와 개구부의 소실, 낮은 PGI 및 PGI/PGII 비율, 그리고 장분절 바렛식도가 예측 결과를 진행된 질환 쪽으로 이동시키는 것으로 나타났다. 반면, 점막 부종, 위소구의 종창, 변연 음와상피(MCE)의 종창, 높은 PGI 및 낮은 G-17은 예측 결과를 초기 질환 쪽으로 이동시켰다.
각 단계별 벌떼그림(beeswarm plot)에서는 1단계가 염증성 소견 및 위축성 소견의 부재와 강하게 연관되었고, 3단계는 위축성 소견 및 장분절 바렛식도와 강하게 연관되었다. 반면, 2단계에서는 양방향으로 기여도가 작은 특징들이 넓게 분산된 SHAP 분포가 나타났다. 이는 2단계의 분류 정확도가 상대적으로 낮았던 이유를 모델 해석의 관점에서 설명해 주는 결과이다.
FIGURE 3. SHAP analyses for serology-based and combined feature sets.
(A) Core serum panel. (B)Extended serum panel.
(C) Combined endoscopy + serology — the best three-class model overall. Each sub-panel contains the three-class beeswarm plot, the binary beeswarm plot, and the corresponding mean (|SHAP|) bar plots. Atrophy-related features and low pepsinogen I push predictions toward advanced disease; inflammation related features push toward early disease.
Multicollinearity
31개 변수로 구성된 결합 세트에서 분산팽창계수(VIF)는 PGI가 8.89, PGI/PGII 비율이 6.89였다. 이러한 관련성은 PGI/PGII 비율이 PGI로부터 산출된다는 점에서 기전적으로 설명할 수 있었다. 그 밖의 모든 변수의 VIF는 5.0 미만이었다. Pearson 상관계수의 절댓값이 0.7을 초과한 경우는 PGI와 PGI/PGII 비율 사이에서만 관찰되었다. 결합 세트에서 가장 우수한 성능을 보인 랜덤 포레스트 모델은 공선성을 가진 입력 변수에 비교적 강건하므로, 모든 특징 변수를 최종 모델에 유지하였다.
Discussion
저자들이 아는 한, 본 연구는 AIG 환자 내에서 질환의 단계를 예측하기 위해 머신러닝을 적용한 최초의 연구이다. 통합 진단 기준에 따라 진단된 환자 203명을 대상으로 다섯 가지 특징 변수 세트와 일곱 가지 알고리즘을 평가한 결과, 내시경 소견이 혈청학적 지표보다 현저히 우수한 예측 성능을 보였다. 두 가지 양식의 정보를 결합했을 때 세 범주 분류에서 가장 우수한 성능을 나타냈으며, 결합 모델의 매크로 평균 AUC는 0.878이었다. 또한 ‘진행 단계 대 이전 단계’의 이분형 구분은 내시경 소견만으로도 가능했으며, WLE+ME-NBI 모델의 AUC는 0.913이었다.
본 연구의 환자군은 지금까지 보고된 중국 AIG 환자군 가운데 비교적 규모가 큰 편에 속한다. 또한 정보 누출을 통제한 SMOTE와 중첩 교차검증을 적용함으로써 모델의 일반화 성능을 보수적으로 추정하였다. 이하에서는 본 연구의 주요 결과를 기존 연구의 맥락에서 고찰하고자 한다.
Stage 2 as a transitional, intervention-relevant window
2단계는 모든 분석에서 일관되게 가장 구별하기 어려운 단계였으며, 이는 방법론적 인공물이 아니라 생물학적 특성에 따른 결과로 해석된다. 2단계의 표현형에는 점막 부종과 위소구(areae gastricae)의 종창과 같은 초기 염증성 소견이 일부 남아 있는 동시에, 끈적하게 부착된 농후한 점액, 벗겨진 피부 모양(CSA) 및 위 주름의 부분적 소실과 같은 위축성 변화가 새롭게 나타난다. 2단계의 SHAP 분포는 양방향으로 기여도가 작은 특징들이 넓게 분산된 양상을 보였다.
기전적으로 2단계는 G-17이 가장 높게 상승하고(중앙값 34.8 pmol/L) G세포의 보상 반응이 최대에 이르는 시점이자, 위샘의 화생성 변화가 가장 활발하게 일어나는 단계에 해당한다[17]. 이 단계에서는 가성유문샘화생과 장상피화생이 여전히 진행 중이며, 위벽세포 손상도 지속된다[18]. 따라서 2단계는 자가면역성 손상을 차단함으로써 질환의 진행을 지연시킬 가능성이 있는 치료적 시기에 해당하며, 향후 면역조절 치료의 임상시험에서는 2단계 환자를 우선적인 대상으로 고려해야 한다.
Loss of gastric folds: a near-linear surrogate of ROM
모든 내시경 기반 모델에서 위 주름의 소실이 가장 중요한 예측 인자였으며, 점막의 얇아짐과 점막하 혈관의 투영도 일관되게 중요도 상위 5개 변수에 포함되었다. 이러한 결과는 기전적으로도 타당하다. 위산분비샘이 소실되면 위체부 주름은 팽창성과 탄력을 잃게 되며, 잔존 위산분비점막(ROM)이 약 10% 미만으로 감소하면 위 주름이 완전히 소실되기 때문이다. 따라서 이 세 가지 소견은 진행된 AIG를 평가할 수 있는 간결하고 재현성 높은 내시경적 대리지표를 구성하며, 육안으로 ROM을 추정하는 방법보다 표준화하기가 용이하다.
끈적하게 부착된 농후한 점액은 3단계 환자의 67.5%에서 관찰되었으며, 무산증 상태의 위에서 H. pylori 이외의 요소분해효소 생성 세균이 과증식하여 발생하는 것으로 알려져 있다[9]. 따라서 이 소견 역시 진행된 AIG를 시사하는 추가적인 시각적 단서가 될 수 있다. 반면, 전형적인 염증성 소견인 위소구(areae gastricae)의 종창과 변연 음와상피(MCE)의 종창은 병기가 진행될수록 감소하였으며, SHAP 분석에서도 예측 결과를 초기 질환 방향으로 이동시켰다. 이는 초기 AIG에서 특징적으로 관찰되는 고유판 심부의 림프구 침윤과 일치하는 결과이다[19,20].
Barrett esophagus link
본 연구에서 가장 새롭게 주목할 만한 결과는 환자군에서 바렛식도의 유병률이 66.8%에 달했다는 점이다. 이는 선택되지 않은 일반 위식도역류질환 환자에서 보고된 약 7%보다 거의 10배 높은 수치이다[21]. 또한 AIG의 병기가 진행됨에 따라 단분절 바렛식도에서 장분절 바렛식도로 뚜렷하게 전환되는 양상이 관찰되었으며, 장분절 바렛식도의 유병률은 1단계에서 13.4%였으나 3단계에서는 43.0%로 증가하였다. AIG가 진행될수록 위산 분비가 점차 소실되므로, 이러한 결과는 고전적인 위산 역류 모형만으로는 쉽게 설명하기 어렵다[22].
이를 설명할 수 있는 위산 비의존적 기전으로 두 가지를 생각해 볼 수 있다. 첫째, 위축된 위점막의 장벽 기능이 약화되면서 십이지장 담즙이 식도로 역류하고, 이로 인해 식도점막에 직접적인 화학적 손상이 발생할 수 있다[23]. 둘째, 지속적인 고가스트린혈증이 CCK2 수용체(CCK2R) 양성 분문부 전구세포를 자극하여 바렛 유사 원주상피로 분화하도록 유도할 수 있다[24]. AIG는 무산증과 고가스트린혈증이 함께 나타나는 질환이므로, 바렛식도의 진행에 특히 유리한 환경을 제공할 가능성이 있다. 이러한 결과의 실질적인 임상적 의미는 AIG 환자의 내시경 추적관찰에서 식도에 대한 명확하고 체계적인 평가를 일상적인 검사 항목으로 포함해야 한다는 것이다.
Endoscopy versus serology
혈청학적 지표만을 사용한 모델은 두 분류 과제 모두에서 약 0.69의 AUC에 그쳤다[26]. PGI와 G-17은 2단계와 3단계 사이에서 유의한 차이를 보이지 않았으며, 이는 혈청학적 지표만을 이용한 병기 평가에 내재적인 성능 한계가 있음을 보여준다[25]. 갑상선 자가항체와 혈색소를 추가해도 모델의 성능은 향상되지 않았으며, 오히려 예측에 불필요한 잡음을 더했을 가능성이 있다.
내시경 소견에 핵심 혈청학적 지표 패널을 결합하면 세 범주 분류 과제의 성능은 0.853에서 0.878로 향상되었다. 그러나 이분형 분류에서는 내시경 단독 모델보다 성능이 더 향상되지 않았다. 이는 세부적인 병기 평가에서는 혈청학적 검사가 보조 수단으로서 제한적이나마 도움이 될 수 있지만, 진행된 질환과 그 이전 단계를 구분하는 이분형 평가에는 내시경 소견만으로도 충분할 수 있음을 시사한다.
Comparison with prior work
CorpusNet-AIG[11]와 다기관 융합 모델[12] 등 영상 기반 AIG 딥러닝 시스템은 0.97을 초과하는 진단 AUC를 보이지만, 이러한 모델은 AIG 환자와 비AIG 환자를 구분하는 데 초점을 두며 AIG 환자 내에서 병기를 평가하는 것은 아니다. 따라서 본 연구는 기존 연구와 경쟁하는 것이 아니라 이를 보완하는 연구라고 할 수 있다.
본 연구에서 사용한 SHAP 기반 해석은 각 임상적 특징이 예측에 기여하는 방향과 크기를 정량화함으로써, 영상 기반 인공지능에서 사용하는 픽셀 수준의 Grad-CAM 중요 영역 시각화를 보완한다. 본 연구의 결과는 자가면역성 위염과 만성 위염이 나타내는 보다 광범위한 임상적·병리학적 스펙트럼 안에서 해석되어야 한다[27,28].
Limitations
본 연구는 단일기관에서 시행된 후향적 연구이므로, 향후 다기관 외부 검증이 필요하다. ROM 면적은 여전히 관찰자가 육안으로 판정하며, 특히 병기 경계값 부근에서는 판단의 주관성이 개입될 수 있다. 따라서 ROM 면적을 객관적이고 자동화된 방식으로 정량화하는 것이 자연스러운 다음 연구 단계가 될 것이다.
또한 본 연구에서는 각 특징과 조직학적 소견 사이의 개별적인 연관성을 분석하지 않았다. 향후 생검 결과를 기준으로 삼는 전향적 코호트 연구를 통해 병리학적 해석을 강화할 필요가 있다. 아울러 2단계 환자를 더 많이 포함한 연구는 세부적인 병기 판별 성능을 향상하는 데 도움이 될 수 있다.
Conclusions
통합 진단 기준에 따라 진단된 AIG 환자 203명을 대상으로 한 본 연구에서 머신러닝은 질환 내 중증도를 병기화할 수 있는 실현 가능하고 해석 가능한 분석 체계를 제공하였다. 백색광 내시경(WLE)에서는 위 주름의 소실, 점막의 얇아짐 및 점막하 혈관의 투영이, 확대 협대역 영상 내시경(ME-NBI)에서는 음와 개구부 등급과 벗겨진 피부 모양(cast-off skin appearance)이 주요 예측 인자로 나타났으며, 이러한 내시경 소견은 혈청학적 지표보다 우수한 예측 성능을 보였다.
내시경 소견과 핵심 혈청학적 지표를 결합한 모델은 세 범주 병기 분류에서 가장 높은 성능을 나타냈으며, 매크로 평균 AUC는 0.878이었다. 반면, 진행된 질환을 구분하는 이분형 분류에는 내시경 소견만으로도 충분한 성능을 보였으며, WLE+ME-NBI 모델의 AUC는 0.913, 민감도는 0.80을 초과하였다.
2단계는 자가면역성 손상이 여전히 활발하게 진행되는 동시에 위샘의 화생성 변화가 가장 두드러지는 과도기적 단계로 확인되었으며, 치료적 개입과 관련하여 중요한 시기에 해당할 가능성이 있다. 또한 전체 환자의 66.8%에서 바렛식도가 관찰되었고, 장분절 바렛식도는 진행된 AIG에서 3.3배 더 흔하게 나타났다. 이러한 결과는 AIG 환자의 추적관찰 과정에서 식도에 대한 명확하고 체계적인 평가를 일상적으로 시행할 필요성을 뒷받침한다.
향후 다기관 외부 검증을 거친다면, 본 연구에서 제시한 다중 특징 지표 체계와 머신러닝 분석 과정은 AIG 환자의 정밀한 감시 전략과 개별화된 임상 관리에 활용될 수 있을 것이다. 특히 진행된 질환에서 종양 감시를 적절한 시점에 시작하는 데 유용한 근거를 제공할 수 있다.
<Abstract>
Objectives: Autoimmune gastritis (AIG) lacks a unified, practical staging system. The AIG-atrophic stage (AIG-AS) scheme, based on the proportional area of remnant oxyntic mucosa (ROM), is promising but observer-dependent. We developed machine-learning models to stage AIG using endoscopic and serological features.
Methods: This single-center cross-sectional study enrolled 203 patients with AIG confirmed by integrated endoscopic, histological, and serological criteria between December 2023 and December 2025. White-light endoscopy (WLE), magnifying endoscopy with narrow-band imaging (ME-NBI), and a serum panel were collected. Patients were classified under AIG-AS as Stage 1 (50%<ROM ≤ 100%), Stage 2 (10%<ROM ≤ 50%), or Stage 3 (ROM ≤ 10%), and additionally as early-to-intermediate (Stages 1 + 2) versus advanced (Stage 3). Seven algorithms-LASSO logistic regression, elastic net, random forest, XGBoost, support vector machine, gradient boosting, and stacking-were trained on five feature sets using stratified 5-fold nested cross-validation, with SMOTE applied only within training folds. SHAP analysis provided interpretability.
Results: Stages 1, 2, and 3 included 87 (42.9%), 36 (17.7%), and 80 (39.4%) patients. The combined endoscopy+serology random forest achieved the highest three-class macro-AUC (0.878 ± 0.051; accuracy 74.9%), surpassing WLE stacking (0.853 ± 0.056) and serology-only models (≤0.693). For binary staging, the WLE+ME-NBI random forest reached an AUC of 0.913 ± 0.046. Loss of gastric folds, gastrin-17, pepsinogen I, crypt-opening grade, and cast-off skin appearance were the dominant predictors. Barrett esophagus prevalence was 66.8%, with long-segment Barrett esophagus 3.3-fold more common in advanced AIG than in earlier disease.
Conclusions: Multi-modal machine learning enables accurate, interpretable AIG staging. Endoscopic features outperform serology, and combined models offer the best three-class performance. The high prevalence of Barrett esophagus supports routine esophageal surveillance in AIG.
Keywords: Barrett esophagus; atrophic; autoantibodies; endoscopy; gastritis; gastrointestinal; machine learning.
References
1. Massironi S, Gallo C, Lahner E, Sciola V, Cavalcoli F, Lenti MV, et al. Occurrence and characteristics of endoscopic gastric polyps in patients with autoimmune gastritis (AGAPE study): A multicentric cross-sectional study. Digestive Liver Dis. (2025) 57:198–205. doi: 10.1016/j.dld.2024.07.024
2. Terao S, Suzuki S, Nishizawa A, Imai Y, Kushima R. Autoimmune gastritis: Stage classification and imaging findings—Comprehensive understanding of clinical, labo ratory, endoscopic, and pathological findings according to disease stage. Stomach Intestine. (2024) 59:10–21. [in Japanese].
3. Kushima R, Kotera T, Terao S. Histopathological findings of autoimmune gastritis. Stomach Intestine. (2024) 59:23–33. doi: 10.1186/s12876-022-02251-8. [in Japanese].
4. Kamada T, Maruyama Y, Monobe Y, Haruma K. Endoscopic features and clinical importance of autoimmune gastritis. Digestive Endoscopy. (2022) 34:700–13. doi: 10.1111/den.14175
5. Kimura K, Takemoto T. An endoscopic recognition of the atrophic border and its significance in chronic gastritis. Endoscopy. (1969) 1:87–97. doi: 10.1055/s-0028 1098086
6. Coati I, Fassan M, Farinati F, Graham DY, Genta RM, Rugge M. Autoimmune gastritis: Pathologist’s viewpoint.World J Gastroenterol. (2015) 21:12179–89. doi: 10.3748/wjg.v21.i42.12179
7. Kishino M, Nonaka K. Endoscopic features of autoimmune gastritis: Focus on typical images and early images. J Clin Med. (2022) 11:3523. doi: 10.3390/jcm11123523
8. Maruyama Y, Yasuda K, Baba S, Yoshii S, Kageoka M, Ohata A, et al. Endoscopic diagnosis of autoimmune gastritis—Endoscopic findings of early, middle, and end stage disease: A proposal of the AIG-atrophic stage (AIG-AS). Stomach Intestine. (2024) 59:34–46. [in Japanese].
9. Terao S, Suzuki S, Yaita H, Kurahara K, Shunto J, Furuta T, et al. Multicenter study of autoimmune gastritis in Japan: Clinical and endoscopic characteristics. Digestive Endoscopy. (2020) 32:364–72. doi: 10.1111/den.13500
10. Tao J, Zhang Z, Meng L, Zhang L, Wang J, Li Z. Risk prediction model for precancerous gastric lesions based on magnifying endoscopy combined with narrow band imaging features. Front Oncol. (2025) 15:1554523. doi: 10.3389/fonc.2025. 1554523
11. Song Y, Zhang X, Shi L, Lu J, Li Z, Wang R, et al. Artificial intelligence for single image diagnosis of autoimmune gastritis using gastric corpus atrophy images: A multicenter retrospective diagnostic study. J Gastroenterol Hepatol. (2026) 41 (4):1292–302. doi: 10.1111/jgh.70296. advance online publication.
12. Chen S, Xu L, Yan L, Zhang J, Zhou X, Wang J, et al. A novel endoscopic artificial intelligence system to assist in the diagnosis of autoimmune gastritis: A multicenter study. Endoscopy. (2025) 57:299–309. doi: 10.1055/a-2451-3071
13. Kamada T, Watanabe H, Furuta T, Terao S, Maruyama Y, Kawachi H, et al. Diagnostic criteria and endoscopic and histological findings of autoimmune gastritis in Japan. J Gastroenterol. (2023) 58:185–95. doi: 10.1007/s00535-022-01954-9
14. Sharma P, Dent J, Armstrong D, Bergman JJGHM, Gossner L, Hoshihara Y, Jankowski JAJ, et al. The development and validation of an endoscopic grading system for Barrett’s esophagus: The Prague C & M criteria. Gastroenterology. (2006) 131:1392 9. doi: 10.1053/j.gastro.2006.08.032
15. Doyama H, Yoshida N, Tsuyama S, Ota R, Takeda Y, Nakanishi H, et al. The ‘White Globe Appearance’ (WGA): A novel marker for a correct diagnosis of early gastric cancer by magnifying endoscopy with narrow-band imaging (M-NBI). Endoscopy Int Open. (2015) 3:E120–4. doi: 10.1055/s-0034-1391026
16. Maruyama Y, Yoshii S, Kageoka M. Features of magnifying endoscopic findings in type A gastritis. Stomach Intestine. (2018) 53:1516–21. [in Japanese].
17. Goldenring JR, Mills JC. Cellular plasticity, reprogramming, and regeneration: Metaplasia in the stomach and beyond. Gastroenterology. (2022) 162:415–30. doi: 10.1053/j.gastro.2021.10.036
18. Jeong S, Choi E, Petersen CP, Roland JT, Federico A, Ippolito R, et al. Distinct metaplastic and inflammatory phenotypes in autoimmune and adenocarcinoma associated chronic atrophic gastritis. United Eur Gastroenterol J. (2017) 5:37–44. doi: 10.1177/2050640616644142
19. Kishino M, Yao K, Hashimoto H, Nitta H, Kure R, Yamamoto A, et al. A case of early autoimmune gastritis with characteristic endoscopic findings. Clin J Gastroenterol. (2021) 14:718–24. doi: 10.1007/s12328-021-01351-4
20. Kotera T, Ayaki M, Sumi N, Aoki R, Mabe K, Inoue K, et al. Characteristic endoscopic findings in early-stage autoimmune gastritis. Endoscopy Int Open. (2024) 12:E332–8. doi: 10.1055/a-2215-3284
21. Saha B, Vantanasiri K, Mohan BP, Goyal R, Garg N, Gerberi D, et al. Prevalence of Barrett’s esophagus and esophageal adenocarcinoma with and without gastroesopha geal reflux: A systematic review and meta-analysis. Clin Gastroenterol Hepatol. (2024) 22:1381–1394.e7. doi: 10.1016/j.cgh.2023.10.006
22. Shaheen NJ, Richter JE. Barrett’s oesophagus. Lancet. (2009) 373:850–61.
23. Attwood SE, Harrison LA, Preston SL, Jankowski JAJ. Esophageal adenocarcinoma in ‘mice and men’: Back to basics! Am J Gastroenterol. (2008) 103:2367–72. doi: 10.1016/j.ajg.2008.02.091
24. Lee Y, Urbanska AM, Hayakawa Y, Wang H, Au AS, Luna AM, et al. Gastrin stimulates a cholecystokinin-2-receptor-expressing cardia progenitor cell and promotes progression of Barrett’s-like esophagus. Oncotarget. (2016) 7:203–14. doi: 10.18632/ oncotarget.10667
25. Zagari RM, Rabitti S, Greenwood DC, Eusebi LH, Vestito A, Bazzoli F. Systematic review with meta-analysis: Diagnostic performance of the combination of pepsinogen, gastrin-17, and anti–Helicobacter pylori antibodies serum assays for the diagnosis of atrophic gastritis. Alimentary Pharmacol Ther. (2017) 46:657–67. doi: 10.1111/ apt.14248
26. Li D, Yu H, Jin B, Dong D, Cheng L, Dong W. Machine learning models using serum gastric biomarkers for the non-invasive prediction of atrophic gastritis: A comparative study. Front Med (Lausanne). (2026) 13:1757004. doi: 10.3389/ fmed.2026.1757004
27. Rugge M,Savarino E, Sbaraglia M, Bricca L, Malfertheiner P. Gastritis: The clinico pathological spectrum. Digestive Liver Dis. (2021) 53:1237–46. doi: 10.1016/ j.dld.2021.03.007
28. Castellana C, Eusebi LH, Dajti E, Iascone V, Vestito A, Fusaroli P, et al. Autoimmune atrophic gastritis: A clinical review. Cancers. (2024) 16:1310. doi: 10.3390/cancers16071310