2026-09-28

Tıbbi Görüntülemede Devrim: NVIDIA’nın 3D Tomografi Yapay Zekası NV-Reason-CT Hakkında Bilmeniz Gereken 5 Şaşırtıcı Gerçek

Tıbbi Görüntülemede Devrim: NVIDIA’nın 3D Tomografi Yapay Zekası NV-Reason-CT Hakkında Bilmeniz Gereken 5 Şaşırtıcı Gerçek

1. Giriş: Tıbbın En Büyük Veri Çıkmazı ve 3D Görüntülemenin Geleceği

Klinik radyolojinin en zorlu ve yıpratıcı mücadelelerinden biri, bilgisayarlı tomografi (BT) incelemelerinin sunduğu devasa veri hacmini yönetmektir. Tek bir BT taraması, hastanın iç anatomisini gösteren yüzlerce enine kesit görüntüsünden oluşur. Yoğun bir hastane temposunda her gün onlarca hastanın binlerce kesiti arasında milimetrik lezyonları, karmaşık doku bozulmalarını ve akut anormallikleri arayan bir radyolog, ciddi bir "görsel ve bilişsel duyusal doygunluk" (cognitive fatigue) ile karşı karşıya kalır. Uzmanın doğru teşhis koyabilmesi için bu yüzlerce bağımsız 2D dilimi zihninde anlık olarak birleştirip üç boyutlu bir anatomi haritasına dönüştürmesi; lezyonların derinliğini, sağ-sol simetrisini ve teşhisteki belirsizlikleri tek tek değerlendirmesi gerekir.

Ne yazık ki bugüne kadar geliştirilen medikal yapay zekâ modelleri bu zihinsel yükü hafifletmekte yetersiz kaldı. Geleneksel üretken yapay zekâ sistemleri, hacimsel 3D tomografi verisini işlerken bellek kısıtları nedeniyle görüntüyü birkaç 2D kesite indirgedi, spatial pooling (uzamsal havuzlama) ile veriyi aşırı sıkıştırdı ya da görsel özellikleri tek boyutlu (1D) vektör dizilerine "düzleştirdi" (flattening). Sonuç olarak, teşhis için hayati önem taşıyan derinlik, hacim ve üç boyutlu uzamsal bağlam kaybolup gitti.

İşte bu teknolojik tıkanıklığı aşmak amacıyla NVIDIA, ABD Ulusal Sağlık Enstitüleri (NIH) ve önde gelen akademik kurumların araştırmacıları güçlerini birleştirerek NV-Reason-CT modelini geliştirdi. Toraks ve Batın tomografilerini analiz etmek üzere tasarlanan bu yeni nesil üretken görsel-dil modeli (VLM), 3D tomografi verisini hiç sıkıştırmadan ve uzamsal koordinatlarını koruyarak doğrudan dil modellerine aktarıyor. Bu hamle, tıbbi görüntülemede ezber bozan bir dönemin kapısını aralıyor.

2. Madde 1: 3D Boyutu "Ezmeden" İşlemek: 13.824 Görsel Token'ın Gücü

Geleneksel yapay zekâ mimarileri (örneğin LLaVA benzeri yapılar veya resampler sistemleri), 3D veriyi işlerken uzamsal ızgara bilgisini kaybeder. Görsel özellikleri tek boyutlu bir vektör dizisine dönüştürdüklerinde, Büyük Dil Modeli (LLM) öz-dikkat (self-attention) katmanında görselin derinlik, yükseklik ve genişlik ilişkilerini doğrudan takip edemez hale gelir.

NV-Reason-CT ise bu boyutsal sıkıştırma ve bilgi kaybı yaklaşımını tamamen reddediyor. Model, 2\text{ mm} izotropik çözünürlükte yeniden örneklenen 192 \times 192 \times 192 voksel boyutundaki bölgesel BT hacmini (384 \times 384 \times 384\text{ mm}'lik bir fiziksel görüş alanına / FOV denk gelir) 8 \times 8 \times 8 voksellik küçük yamalara böler. Böylece 24 \times 24 \times 24 matrisinde tam 13.824 görsel token elde edilir. Görsel kule (vision tower) tarafında COLIPRI Primus 3D ViT ağırlıklarıyla başlatılan ve dondurulmadan uçtan uca (end-to-end) eğitilen mimarinin en kritik yeniliği, bu 13.824 token'ın hiçbir uzamsal birleştirme veya havuzlama işlemine tabi tutulmadan doğrudan Büyük Dil Modeline (Qwen3.5-4B) aktarılmasıdır.

Görsel veriler dil modeline aktarılırken orijinal 3D ızgara boyutları eksiksiz biçimde korunur. Dil modelinin MRoPE (Multimodal Rotary Positional Encoding) mekanizması sayesinde her bir görsel token'a açık derinlik, yükseklik ve genişlik (d, h, w) koordinat indeksleri atanır. Geleneksel modeller 3D veriyi tek boyutta düzleştirip uzamsal bağlamı yok ederken, NV-Reason-CT dil modelinin öz-dikkat katmanlarında metin ve görsel token'ları birlikte işlenirken bu 3D matris yapısını muhafaza eder.

Bu kesintisiz mekânsal kesinlik; sol ve sağ böbrek lezyonlarını ya da böbrek üstü bezi kitlelerini kesin olarak ayırt etme, akciğerdeki milimetrik nodülleri doğru anatomik loba lokalize etme ve anormalliklerin kraniyokaudal (baştan kuyruğa) yayılımını hatasız tarif etme konusunda modele eşsiz bir klinik hassasiyet kazandırır.

"Derinlik, yükseklik ve genişlik indekslerinin korunması, metinle ortak işleme sırasında mekânsal ilişkileri temsil etmek için ek bir araç sağlar."

3. Madde 2: Yapay Zekaya Radyolog Gibi "Yüksek Sesle Düşünmeyi" Öğretmek

Tıbbi yapay zekâ uygulamalarında sadece "Akciğerde kitle var" şeklinde nihai bir teşhis sunmak klinik pratikte yeterli değildir. Bir hekimin yapay zekaya güvenebilmesi için modelin o karara varırken izlediği mantık yolunu ve klinik akıl yürütme sürecini adım adım görebilmesi gerekir.

NV-Reason-CT'nin eğitiminde, tıp literatüründe eşine az rastlanan yenilikçi bir veri toplama yöntemi izlendi. Kurul onaylı uzman radyologlar, BT incelemeleri yaparken sistemli organ taramalarını, olası ayırıcı tanıları, gözlemlerini ve teşhisteki belirsizlikleri "yüksek sesle düşünerek" ses kaydına aldılar. Metne dökülen bu uzman anlatıları, hem modele doğrudan denetim verisi sağladı hem de kaynak raporların anlatı tarzındaki sentetik analizlere dönüştürülmesine rehberlik etti.

NV-Reason-CT, kullanıcıya yanıt üretirken klinik analiz sürecini metin içerisinde <think>...</think> etiketlerinin arasına yerleştirir. Bu sayede yapay zekâ:

  • Anatomik yapıları bir radyolog sistematikliğiyle adım adım inceler,
  • Anormal bulguları ikincil gözlemlerle ve olası hastalıklarla ilişkilendirir,
  • Kesinleşmemiş durumları, teknik kısıtları ve tanısal belirsizlikleri açıkça ifade eder,
  • Tüm bu mantık zincirinin sonunda nihai raporunu (<answer> bloğu) sunar.

Yapay zekanın karar süreçlerini denetlenebilir (reviewable) ve şeffaf bir açıklama zinciriyle sunması, tıpta sıkça eleştirilen "kara kutu" (black box) problemini ortadan kaldırarak klinik güveni en üst seviyeye çıkarır.

4. Madde 3: Doğrulanabilir Ödüllerle Tıbbi Takviyeli Öğrenme (GRPO)

NV-Reason-CT'nin eğitimi iki aşamalı gelişmiş bir mimariye dayanır. İlk aşamadaki Uçtan Uca Süpervize İnce Ayar (SFT) sürecinde model, radyologların düşünce tarzını ve standart rapor formatlarını öğrenir. İkinci aşamada ise GRPO (Group Relative Policy Optimization) adı verilen takviyeli öğrenme (reinforcement learning) tekniği devreye girer.

GRPO'nun bu modeldeki en büyük stratejik avantajı, eğitilen her bir BT hacmi için insan eliyle yazılmış adım adım bir akıl yürütme izine (reasoning trace) ihtiyaç duymamasıdır. Sistem, SFT modelinden üretilen farklı yanıt gruplarını alan bazlı doğrulanabilir ödül fonksiyonları (verifiable rewards) ile puanlayarak modeli optimize eder:

  • Bulgu Doğruluğu Ödülü (r_{\text{set}}): Modelin çıktı sonundaki <answer> bloğunda sunduğu anormallik kümesi ile hekim tarafından doğrulanan referans etiketler arasındaki F1 skorunu hesaplar. Yanlış veya çelişkili bulgular sıfır puan alır.
  • Rapor Formatı Ödülü (r_{\text{struct}}): Raporun hedeflenen anatomik organ başlıklarına, bölüm sırasına ve maddelenmiş izlenim (impression) yapısına uyumunu değerlendirir.
  • Uzunluk Cezası (r_{\text{len}}): Eksik kalan veya gereksiz uzatılmış raporları engelleyerek ideal token uzunluğunu korur.

Bu iki aşamalı yapı (SFT + GRPO), yapay zekanın tıbbi metinlerde uydurma bulgu üretmesini (halüsinasyon) ve klinik formattan sapmasını kararlı bir şekilde engellerken, anormallik tespit F1 skorunu matematiksel olarak zirveye taşır.

5. Madde 4: Klinik Testlerde Şok Sonuç: Okuma ve Raporlama Süresinde %50 Düşüş

NV-Reason-CT'nin klinik pratik üzerindeki etkisini ölçmek amacıyla, 10 yılı aşkın mesleki kıdeme sahip ABD kurul onaylı (board-certified) uzman radyologların katılımıyla öncül bir okuyucu araştırması (preliminary reader study) gerçekleştirildi. Çalışmada uzmanlar, 10 karmaşık vakayı (5 göğüs, 5 karın BT) önce yapay zekâ desteği olmadan geleneksel yöntemlerle, ardından NV-Reason-CT'nin sunduğu düşünce zinciri ve taslak rapor desteğiyle incelediler.

Çalışmanın sonuçları çarpıcı bir verimlilik artışını ve güveni ortaya koydu:

  • İnceleme ve Raporlama Süresi: Yapay zekâ desteği olmadan vaka başına ortalama 26,25 dakika süren BT inceleme ve rapor hazırlama süresi, NV-Reason-CT desteğiyle 13,13 dakikaya düştü. Bu durum klinik iş yükünde net %50 zaman tasarrufu anlamına geliyor.
  • Doğruluk ve Düşünce Kalitesi: Radyologlar, modelin sunduğu düşünce adımlarının doğruluğunu ve mantık zincirini 4,75 / 5,0 Likert puanı ile derecelendirdi.
  • Klinik Karar Güveni: Uzmanlar, yapay zekâ analizini okuduktan sonra kararlarındaki güven düzeyinin belirgin şekilde arttığını (4,70 / 5,0) ve yapay zekanın kendileriyle çelişmesi durumunda vakayı mutlaka yeniden inceleyeceklerini (5,00 / 5,0) belirttiler.

Çalışmada ilgi çekici bir nüans da ortaya çıktı: Radyologların "Yapay zekâ başlangıçta gözden kaçırdığım önemli bir bulguyu tespit etti" ifadesine verdikleri puan 2,60 ± 1,23 gibi görece düşük bir seviyede kaldı. Araştırmacılar bunun sebebini, kontrollü deney koşullarında uzman radyologların yapay zekâ öncesinde vakaları son derece titizlikle manuel incelemelerine ve başlangıçta hiçbir ana bulguyu kaçırmamış olmalarına bağladı. Yine de modelin sunduğu hazır yapılandırılmış rapor ve doğru mantık dizilimi, günlük hastane temposunda devrim yaratacak bir hız sağladı.

6. Madde 5: Açık Kaynaklı Şeffaflık: Tıpta Yapay Zekanın Demokratikleşmesi

Kapalı ve ticari yapay zekâ modellerinin aksine NVIDIA, NV-Reason-CT modelini, SFT ve GRPO eğitim kodlarını GitHub (NVIDIA-Medtech/NV-Reason-CT) ve Hugging Face (nvidia/NV-Reason-CT) platformları üzerinden tamamen açık kaynak olarak tüm tıp ve araştırmacı dünyasının kullanımına sundu.

COLIPRI Primus 3D ViT görsel kulesi ve Qwen3.5-4B dil modeli temeline dayanan mimarinin başarısı, harici hiçbir özel sınıflandırma kafası (classification head) eklenmeksizin, kamuya açık devasa veri setleri üzerindeki objektif testlerle kanıtlandı:

  • CT-RATE (Göğüs BT): Göğüs tomografisi benchmark'ında direkt soru-cevap üzerinden 0,6140 Macro-F1 ve 0,8710 Macro-AUROC skorlarına ulaştı. Üretilen raporlardan RadBERT ile çıkarılan bulgularda ise 0,5923 Macro-F1 başarısı gösterdi.
  • Merlin (Karın BT Testi): Sadece doğal dil ve görsel entegrasyonuyla harici karın BT veri setinde 0,7655 Macro-F1 ve 0,8329 Macro-AUROC elde etti. Rapor üretiminde klinik varlık ve ilişki örtüşmesini ölçen RadGraph-F1 skoru 0,3216, GREEN skoru ise 0,3658 oldu.
  • RAD-ChestCT (Dış Göğüs BT Testi): Model hiç ayarlanmadan doğrudan yapılan dış testte 0,5311 Macro-F1 ve 0,7958 Macro-AUROC değerlerine ulaştı. Üretilen raporlardan elde edilen F1 skoru 0,4854 (yanıt bloğundan doğrudan ayrıştırma ile 0,5105) olarak ölçüldü.

7. Sonuç: Radyolojide İnsan-Yapay Zekâ Ortaklığının Geleceği

NV-Reason-CT, sunduğu etkileyici performansa rağmen bazı klinik kısıtlamalara sahip. Modelin mevcut versiyonu, tüm vücut taramaları yerine aynı anda tek bir bölgesel kesit (192 \times 192 \times 192 voksel, 2\text{ mm} izotropik çözünürlükte 384 \times 384 \times 384\text{ mm} görüş alanı) işleyebiliyor. Akciğer tabanını (-500 HU eşiği) baz alan otomatik anatomi odaklama mekanizması (anatomy-aware cropping), akciğer sınırlarının net görülemediği veya ameliyatlı vakalarda ideal odağı kaçırabiliyor. Ayrıca model, hastanın geçmiş tomografilerini, laboratuvar sonuçlarını veya klinik öyküsünü henüz tam anlamıyla analiz sürecine entegre edemiyor.

Ancak elde edilen veriler net bir gerçeğe işaret ediyor: Yapay zekâ doktorların yerini almaktan ziyade, onların üzerindeki zihinsel yükü hafifleten, inceleme sürelerini yarı yarıya indiren ve süper güçlerle donatılmış bir karar destek asistanı haline geliyor. Açıklanabilir ve adım adım denetlenebilir mantık zincirleri sunan modeller, tıpta yapay zekaya olan güven sorununu aşmadaki en kritik anahtar niteliğinde.

Gelecekte tomografi raporunuzu kaleme alan bir yapay zekanın "düşünce adımlarını" okumak, doktorunuza olan güveninizi nasıl etkilerdi?

https://developer.nvidia.com/blog/introducing-nv-reason-ct-open-3d-ct-vlm-for-radiologist-chain-of-thought-reasoning/

https://nevit.blogspot.com/2026/09/tbbi-goruntulemede-devrim-nvidiann-3d.html

https://arxiv.org/abs/2609.27511

https://github.com/NVIDIA-Medtech/NV-Reason-CT

https://huggingface.co/nvidia/NV-Reason-CT



Hiç yorum yok: