E. Can Özer
Yapay Zeka
25 Eylül 2026 19:14

Türkçe Raporlarda Yapay Zekanın İki Ayrı Sınavı

Araştırmacılar beş yapay zeka modeline uzun Türkçe raporlar hakkında sorular sordu. En yüksek puanı alan model, ilk raporda 100 sorunun 75’ini doğru yanıtladı. Çalışma, yanlış cevapların nerede başladığını da inceledi: İlgili bilgi modele ulaşmadığında, iyi bir yanıt üretmesi zaten güçleşiyor.

Türkçe Raporlarda Yapay Zekanın İki Ayrı Sınavı

Görsel: Alllex / gettyimages (Görsel yapa zeka ile düzenlenmiştir).

Bir sanayi kuruluşunun Ar-Ge raporunda projeler, mali tablolar ve patent kayıtları aynı PDF’de yer alıyor. Bu belge hakkında yapay zekaya soru sorulduğunda, sistem önce rapordan ilgili görünen bölümleri seçiyor. Model, yanıtını bu bölümlere bakarak yazıyor. Doğru tablo seçilmemişse hata, model cevap vermeye başlamadan önce ortaya çıkmış oluyor.


Araştırmacılar Imtiaz Ul Hassan, Öykü Akbulut, Onur Kaya, Ardhendu Behera, Swagat Kumar, Peter Matthew, Yonghuai Liu, 23 Eylül’de yayımladıkları çalışmada bu sürecin iki aşamasını ayrı ayrı ölçtü: Sistem gerekli bilgiyi PDF’den buluyor mu? Model, önüne gelen bilgiyi doğru kullanıyor mu?


Çalışma arXiv’de bir ön baskı olarak paylaşıldı. Bu, araştırma metninin bilimsel bir dergide bağımsız hakem değerlendirmesi tamamlanmadan erişime açıldığı anlamına geliyor.


İlk deney için 109 sayfalık Türkçe bir sanayi Ar-Ge raporundan 100 soru hazırlandı. Soruların bir bölümü tek bir bilgiyi bulmayı, bir bölümü tablolardaki rakamlarla hesap yapmayı, bir bölümü de raporun farklı yerlerindeki bilgileri birleştirmeyi gerektiriyordu. Yirmi sorunun cevabı belgede hiç bulunmuyordu. Araştırmacılar böylece modellerin ‘raporda yok’ demesi gereken durumları da sınayabildi.


Beş model aynı soruları, aynı talimatları ve PDF’den seçilmiş aynı metin parçalarını aldı. Modeller, altı gigabayt ekran kartı bulunan bir dizüstü bilgisayarda çalıştırıldı. Bu donanım seçimi önemli: Bir kurumun belgelerini dışarıdaki bir yapay zeka hizmetine göndermeden, kendi bilgisayarında işlemek istemesi halinde karşılaşacağı sınırlara yakın bir test ortamı kurulmuş oldu.


İlk raporda Trendyol’un modeli 100 sorunun 75’ini doğru yanıtladı. Qwen2.5 65, Cosmos 54, Mistral 51, KoçDigital ise 49 doğruya ulaştı. Trendyol’un farkı özellikle rapordaki sayılarla işlem yapmayı gerektiren sorularda açıldı: Bu gruptaki 30 sorunun 22’sini doğru cevapladı; Qwen2.5 15’ini. Araştırmacılar aynı testi, Kişisel Verileri Koruma Kurumunun 112 sayfalık 2024 faaliyet raporu için hazırladıkları ayrı bir 100 soruyla tekrarladı. Trendyol bu kez 82 doğruya ulaştı. Bunlar modellerin genel Türkçe başarı oranları değil, söz konusu iki belge ve test düzeniyle elde edilen sonuçlar.


Çalışmanın bir de hız tarafı var. En yüksek puan, en hızlı çalışma anlamına gelmiyor. Ayrı bir 20 soruluk zamanlama örnekleminde Trendyol’un modeli yanıt başına ortalama 23,86 saniye harcadı. Qwen2.5 için ortalama 1,69 saniyeydi. Araştırmacılara göre Trendyol modelinin yanıt öncesinde ürettiği ara düşünme adımları da bu süreyi artırıyor. Bu ölçüm, kullanılan dizüstü bilgisayar ve model ayarları için geçerli; başka bir donanımda süreler aynı olmayabilir.


Modellerin bilmediklerinde ne yaptığına bakıldığında ise sıralama yeniden değişiyor. Cevabı ilk raporda bulunmayan 20 sorunun 19’unda Qwen2.5, bilginin belgede olmadığını belirtti. Trendyol ve Cosmos bunu 18’er soruda, KoçDigital ise dokuz soruda yaptı. KoçDigital’in kolay bilgi bulma sorularının 30’da 19’unu doğru yanıtlaması, bu farkı özellikle görünür kılıyor. Bir rapordaki rakamı bulabilmek ile raporda bulunmayan rakamı üretmemek aynı beceri değil.


Araştırmanın en ayırt edici ölçümü ise modelden önce çalışan arama sistemine ilişkin. İlk raporda, yanıt için gereken bilgilerin tek tek izlenebildiği 54 sorunun 31’inde gerekli kanıt modele gönderildi. KVKK raporunda bu sayı 77 soruda 70’ti. Bu oranlar 100 soruluk genel doğruluk puanlarıyla karıştırılmamalı, bunlar yalnızca arama aşamasında gerekli bilginin seçilip seçilmediğini gösteriyor. Araştırmacıların denediği yedi arama yöntemi arasında daha karmaşık olanlar da vardı, ancak hiçbiri bu iki belgede kullanılan basit karakter eşleştirme yöntemine karşı istatistiksel olarak anlamlı bir üstünlük sağlayamadı.


Çalışma iki raporla sınırlıydı. Henüz hukuk, sağlık veya başka tür belgelerde ne tür sonuçların alınacağını söylemek için erken. Yine de kurumsal bir PDF asistanını değerlendirirken yalnızca doğru yanıt sayısına bakmanın neyi eksik bıraktığını gösteriyor. Yanlış cevapta önce ilgili sayfanın modele gönderilip gönderilmediğini kontrol etmek, sorunun arama sisteminde mi yoksa yanıtı yazan modelde mi olduğunu anlamayı sağlıyor.

Antikitenin kadim dillerinden dijitalin kodlarına uzanan disiplinlerarası bir köprüden geçmekte. WIRED Türkiye ile teknolojiyi sorunsallaştırırken, yedi sanatı yanına alarak öğrenmenin ve paylaşmanın peşinden gidiyor. 98 model, Boğaziçili.

E. Can Özer

DAHA FAZLASI

ChatGPT Ajanları Artık Kendi Başına Çalışabiliyor

OpenAI, 29 Eylül’de düzenlediği DevDay etkinliğinde 20’den fazla yenilik duyururken artık ‘dots’ ajanları kendi başına da görevini sürdürebiliyor.
Samet Kelebek

Bir OpenAI Ajanı Avustralya’nın Sağlık Hizmetlerini Ele Geçirdi

Ülkenin başbakanı, siber saldırıdan yalnızca e-posta yoluyla haberdar edilmesinden duyduğu hayal kırıklığını dile getirdi. Avustralya şu anda OpenAI’ın yasayı ihlal edip etmediğini araştırıyor.
Isabella Ward

Yapay Zeka Bu Hafta Ucuzluyor

Her geçen gün yeniliklerin duyurulduğu yapay zeka sektörü bu hafta da boş geçmiyor. Hem de artık maliyetlerin düşürülüyor.
Samet Kelebek

Yapay Zekalı Robotlar Ne Zaman ‘Hayır’ Diyeceğini Anlayabiliyor mu?

Gelişen yapay zeka teknolojisi her sektörde olduğu gibi robotlara da entegre ediliyor. Yapay zeka robotlara daha fazla yetenek getirirken robotlar, ne zaman ‘hayır’ demeleri gerektiğini gerçekten anlayabiliyor mu?
Samet Kelebek