Yapay Zeka Modelleri Bilimsel Araştırma Süreçlerinde Ne Kadar Özerk?
Princeton ve Birleşik Krallık AI Güvenlik Enstitüsü tarafından yapılan yeni bir çalışma, güncel yapay zeka modellerinin bilimsel araştırma yürütme konusundaki özerklik iddialarını sorguluyor.

Araştırma Sürecinde Model Performansı
Princeton Üniversitesi ve Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü (UK AI Safety Institute) tarafından gerçekleştirilen ortak bir çalışma, yapay zeka modellerinin bilimsel araştırma süreçlerini bağımsız olarak yürütme kapasitesini test etti. Claude Opus 4.8 ve GPT-5.6 Sol gibi gelişmiş modellerin kullanıldığı deneyde, yapay zeka ajanlarına altı günlük bir süre, 3.000 dolarlık API kredisi ve GPU erişimi sağlandı.
Yöntem ve Kısıtlamalar
Modellerden, bağımsız olarak akademik düzeyde yapay zeka araştırma makaleleri üretmeleri istendi. Elde edilen çıktılar, daha önce NeurIPS konferansına gönderilmiş ancak yayımlanmamış çalışmaların orijinal yazarları tarafından değerlendirildi. Değerlendirme sonucunda modellerin ürettiği çalışmaların büyük çoğunluğu "Red" (Reject) notu aldı.
Bulgular: Mühendislik Başarısı vs. Araştırma Yetkinliği
Çalışmanın verileri, güncel frontier (sınır) modellerin araştırma süreçlerinin mühendislik aşamalarını (kodlama, veri işleme gibi) başarıyla yönetebildiğini ancak şu temel alanlarda ciddi eksiklikler yaşadığını ortaya koyuyor:
- Araştırma Muhakemesi: Bilimsel bir hipotezin değerini ölçme ve literatüre katkısını anlama konusunda yetersizlik.
- Yaratıcı Problem Çözme: Beklenmedik engellerle karşılaşıldığında özgün çözüm yolları geliştirememe.
- Stratejik Esneklik: Başarısız olduğu kanıtlanmış yöntemleri terk ederek yeni bir yola girme konusunda direnç gösterme.
Sonuç ve Değerlendirme
Bu bulgular, bazı teknoloji şirketlerinin "yapay zeka destekli otonom araştırma" konusundaki iddialarının, mevcut modellerin sınırlılıkları göz önüne alındığında oldukça iyimser olduğunu gösteriyor. Modellerin teknik süreçleri otomatize etme becerisi yüksek olsa da, bilimsel metodolojinin gerektirdiği eleştirel düşünme ve stratejik karar alma yetileri henüz insan seviyesine ulaşmış görünmüyor.





