Tekillik.
LLM

Yapay Zekâ Benchmark Testinde Zorlandı

Yeni benchmark olan Humanity's Last Exam, yapay zekâ sistemlerinin matematikten antik dillere kadar uzanan uzmanlık gerektiren sorulardaki sınırlarını ortaya koyuyor. En gelişmiş modellerin performansı artsa da araştırmacılar, yapay zekâ ile insan uzmanlığı arasındaki farkın hâlâ geniş olduğunu belirtiyor.

· 2 dk okuma editör onaylı
Yapay Zekâ Benchmark Testinde Zorlandı
Görsel yapay zekâ ile üretilmiştir

Yapay zekâ sistemleri, uzun süredir kullanılan akademik testlerde çok yüksek puanlara ulaşınca bu ölçümlerin ayırt ediciliği azalmaya başladı. MMLU gibi daha önce zor kabul edilen değerlendirmeler, güncel modellerin yeteneklerini ve sınırlılıklarını yeterince gösteremez hâle geldi.

Bu soruna çözüm bulmak için yaklaşık 1.000 araştırmacı, Humanity's Last Exam (HLE) adlı yeni bir benchmark hazırladı. Nature'da yayımlanan çalışmaya göre 2.500 sorudan oluşan sınav; matematik, beşeri bilimler, doğa bilimleri, antik diller ve çok sayıda uzmanlık alanını kapsıyor. Texas A&M Üniversitesi'nden Tung Nguyen de projeye katkı veren araştırmacılar arasında yer aldı.

Benchmark, yapay zekânın uzmanlık sınırlarını ölçüyor

HLE soruları, dünya genelindeki uzmanlar tarafından yazılıp gözden geçirildi. Her sorunun tek ve doğrulanabilir bir yanıtı olacak şekilde tasarlanan testte, hızlı internet aramalarıyla çözülebilecek görevlerden kaçınıldı. Sorular arasında antik Palmira yazıtlarını çevirme, kuşlardaki küçük anatomik yapıları tanımlama ve İncil İbranicesindeki telaffuz özelliklerini analiz etme gibi görevler bulunuyor.

Araştırmacılar, soruları son hâline getirmeden önce önde gelen yapay zekâ sistemleriyle denedi. Bir model soruyu doğru yanıtlayabildiğinde ilgili soru sınavdan çıkarıldı. Böylece HLE'nin, mevcut sistemlerin güvenilir biçimde çözmekte zorlandığı bir değerlendirme olarak kalması amaçlandı.

İlk sonuçlar bu yaklaşımın etkili olduğunu gösterdi. GPT-4o yüzde 2,7, Claude 3.5 Sonnet yüzde 4,1 ve OpenAI'ın o1 modeli yüzde 8 doğruluk elde etti. Araştırma metninde, Gemini 3.1 Pro ve Claude Opus 4.6 gibi daha yeni sistemlerin ise yaklaşık yüzde 40 ila 50 aralığına ulaştığı bildirildi.

Projeye 73 soru katkısı sunan Nguyen'e göre yüksek benchmark puanları, tek başına gerçek bir anlayışın kanıtı değil. HLE'nin amacı insanları yapay zekâyla yarıştırmak değil; sistemlerin hangi alanlarda güçlü, hangi alanlarda yetersiz olduğunu daha doğru ölçmek. Araştırmacılar, soruların bir bölümünü kamuya açarken çoğunluğunu gizli tutarak modellerin yanıtları ezberlemesini önlemeye çalışıyor.

Çalışma ekibi, şeffaf ve uzun vadeli bir değerlendirme aracı olarak tasarlanan HLE'nin geliştiriciler, politika yapıcılar ve kullanıcılar için daha gerçekçi bir tablo sunabileceğini belirtiyor. Projenin kapsamı ise yalnızca bilgisayar bilimcilerinin değil, tarihçilerin, fizikçilerin, dilbilimcilerin ve tıp araştırmacılarının ortak çalışmasıyla oluşturuldu.

#yapay zekâ testleri #benchmark #Humanity's Last Exam #LLM #AI güvenliği

LLM başlığında