Pediatrik Çölyak Hastalığı Hakkında Bilgi Sağlamada Üç Yapay Zekâ Chatbotunun Karşılaştırmalı Değerlendirilmesi
Fırat Üniversitesi Sağlık Bilimleri Tıp Dergisi, cilt.40, sa.1, ss.98-104, 2026 (TRDizin)
- Yayın Türü: Makale / Tam Makale
- Cilt numarası: 40 Sayı: 1
- Basım Tarihi: 2026
- Dergi Adı: Fırat Üniversitesi Sağlık Bilimleri Tıp Dergisi
- Derginin Tarandığı İndeksler: TR DİZİN (ULAKBİM)
- Sayfa Sayıları: ss.98-104
- Gazi Üniversitesi Adresli: Evet
Özet
Amaç: Bu çalışmanın amacı, çocukluk çağı çölyak hastalığı (ÇH) ile ilgili sık sorulan sorulara (SSS) doğru ve güvenilir yanıt verme açısından yaygın olarak kullanılan üç sohbet motorunun— ChatGPT, Gemini ve Copilot—performanslarını değerlendirmek ve karşılaştırmaktır. Gereç ve Yöntem: Uluslararası kılavuzlar ve güncel derleme makaleler temel alınarak; tanım, tanı, klinik bulgular, laboratuvar testleri, komplikasyonlar, tedavi ve izlem başlıklarını kapsayan 40 maddelik bir SSS seti oluşturuldu. Her soru, bağlamsal yanlılığı en aza indirmek amacıyla Ağustos 2025’te yeni oturumlar kullanılarak Türkçe olarak ChatGPT, Gemini ve Copilot’a ayrı ayrı yöneltildi. Elde edilen yanıtlar, bir çocuk gastroenteroloğu, bir pediatrist ve çölyak hastalığı bulunan bir çocuk cerrahı tarafından körleme olarak değerlendirildi. Yanıtlar; (1) kapsamlı/doğru, (2) eksik/kısmen doğru, (3) karma/yanıltıcı ve (4) yanlış/ilgisiz olmak üzere dört kategoride sınıflandırıldı. Modeller arası uyum Cohen’s kappa katsayısı ile değerlendirildi ve yanıt doğruluğundaki farklar karşılaştırmalı istatistiksel analizlerle incelendi. Bulgular: ChatGPT, kapsamlı/doğru yanıt oranı en yüksek olan sohbet motoru idi (35/40; %87,5); bunu Gemini ve Copilot izledi (her biri 28/40; %70). ChatGPT’nin doğruluk oranı diğer sohbet motorlarına kıyasla istatistiksel olarak anlamlı derecede yüksekti (χ² testi, p<0,05). Yanıltıcı yanıt oranı en yüksek olan model Copilot’tu (6/40; %15). Alt grup analizlerinde ChatGPT, tedavi ve izlem sorularında en iyi performansı gösterirken (16/17; %94,1), Gemini temel bilgi ve klinik bulgular alanında görece daha iyi performans sergiledi ve yanıltıcı yanıt üretmedi. Modeller arası uyum düşüktü (ChatGPT–Copilot κ=0,32; Gemini–Copilot κ=0,35; ChatGPT–Gemini κ=0,11). Sonuç: ChatGPT, kılavuzlarla en uyumlu performansı sergilerken, Copilot daha yüksek yanıltıcı yanıt riski taşımaktadır. Bulgular, yapay zekâ tabanlı sohbet motorlarının hasta ve aile eğitimi için ilk temas aracı olarak potansiyelini ortaya koymakla birlikte, uzman denetimi, olası halüsinasyonların farkında olunması ve kılavuz temelli çerçevelerin gerekliliğini vurgulamaktadır.
Objective: This study aimed to evaluate and compare the performance of three widely used chatbots—ChatGPT, Gemini, and Copilot—in providing accurate and reliable answers to frequently asked questions (FAQs) related to pediatric celiac disease (CD). Materials and Methods: A 40-item FAQ set was developed based on international guidelines and recent review articles, covering definitions, diagnosis, clinical features, laboratory tests, complications, treatment, and follow-up. Each question was independently posed in Turkish to ChatGPT, Gemini, and Copilot in August 2025 using new sessions to minimize contextual bias. Responses were blindly evaluated by a pediatric gastroenterologist, a pediatrician, and a pediatric surgeon with celiac disease. Answers were classified as: (1) comprehensive/accurate, (2) incomplete/partially accurate, (3) mixed/misleading, or (4) incorrect/irrelevant. Inter-model agreement was assessed using Cohen’s kappa, and comparative statistical analyses were performed to evaluate differences in response accuracy. Results: ChatGPT provided the highest proportion of comprehensive/accurate responses (35/40; 87.5%), followed by Gemini and Copilot (28/40; 70% each). ChatGPT demonstrated significantly higher accuracy compared with the other chatbots (χ² test, p<0.05). Copilot generated the highest rate of misleading responses (6/40; 15%). In subgroup analyses, ChatGPT performed best in treatment and follow-up questions (16/17; 94.1%), while Gemini showed relatively better performance in basic knowledge and clinical features (5/8; 62.5%) without producing misleading answers. Inter-model agreement was limited (ChatGPT–Copilot κ=0.32; Gemini–Copilot κ=0.35; ChatGPT–Gemini κ=0.11). Conclusion: ChatGPT demonstrated the most guideline-concordant performance, whereas Copilot carried a higher risk of misleading outputs. These findings highlight both the potential and limitations of AI chatbots as first-contact tools for patient and family education, emphasizing the need for expert oversight, awareness of possible hallucinations, and guideline-based frameworks.