Ankara24.com
close
up
Menu

Karabük te 30 bin kişi aynı coşkuda buluştu: Hakan Peker ve Sefo sahneyi salladı Karabük Haberleri Habertürk Yerel Haberler

İran istihbaratından İsrail’e sosyal medya kancası: Sahte iş ilanlarıyla tuzağa çektiler

Mekke Anlaşması NATO nun 5. maddesiyle çelişmiyor Dış Haberler

Komşuda korkutan virüs alarmı: Vaka sayısı katlandı! Sivrisineklerden yayılıyor

Son dakika haberleri: Dev vinç gemisi Saipem 7000 , Marmara dan Çanakkale Boğazı ndan geçiyor Son dakika haberleri

Gizli kanser aort anevrizmasına kapalı yöntemle ameliyat Haberler

Stok Gözetim Programı ile 540 milyon liralık matrah artışı sağlandı

FIFA Başkanı Infantino nun başı bu kez fena dertte: Genç bir çalışanla ilişki kurduğu iddia ediliyor

Diş eti kanaması daha büyük bir sağlık sorununun erken habercisi olabilir

HÜDA PAR Genel Başkanı: Artık kan dökülmeyecek olması tek başına çok büyük bir kazanımdır

Trabzonspor kafilesi, İzmir e gitti! Salah ve Onana kadroda yok...

Denizde SUP’er bir moda

SON DAKİKA! Altın fiyatları için kritik veri açıklandı! ABD de istihdam verileri beklentileri karşılamadı

THY, temmuzda rekor kırdı!

Antalya’da 22 adet kaçak tarihi eser yakalandı

Çiftçilere 688 milyon lira tarımsal destek

Uzak Doğu nun acısından Avrupa nın klasik tatlarına: Dünyanın en iyi 30 sosu belli oldu! İşte yemeklerinize seviye atlatacak o tatlar

Benhur Keser, Kayserispor’da

471 uçağa çatlak kontrolü

Kolombiya nın yeni lideri yemin etti Dış Haberler

Yapay zekanın yetenekleri hatalı testler nedeniyle abartılıyor olabilir

Yapay zekanın yetenekleri hatalı testler nedeniyle abartılıyor olabilir

Trthaber sayfasından alınan bilgilere göre, Ankara24.com açıklama yapıyor.

Oxford ekibi, dünyanın önde gelen araştırma kurumlarından 30’dan fazla bilim insanıyla birlikte yürüttüğü çalışmada, YZ modellerinin performansını değerlendirmede yaygın olarak kullanılan 445 test ve ölçüm yöntemini (benchmark) inceledi.

Testlerin çoğu ne ölçtüğünü tanımlamıyor

Araştırmaya göre, birçok üst düzey test ne ölçmek istediğini açıkça tanımlamıyor, önceki testlerden veri ve yöntemleri kopyalıyor ve modeller arası karşılaştırmalarda güvenilir istatistiksel yöntemler kullanmıyor.

Çalışmanın başyazarlarından Oxford İnternet Enstitüsü kıdemli araştırmacısı Adam Mahdi, bu testlerin yanıltıcı olabileceğini vurguladı:

“Yapay zekaya belli görevler verdiğimizde, aslında ölçmek istediğimiz kavramdan tamamen farklı şeyleri ölçüyor olabiliriz” dedi.

Bir diğer yazar Andrew Bean de, “Bir modelin ‘doktora düzeyinde zekaya ulaştığı’ iddialarını duyduğunuzda bunu temkinle karşılamak gerekir. Çünkü bu ölçümler her zaman sağlıklı yapılmıyor” ifadelerini kullandı.

‘Matematikte iyi’ görünen model aslında ezber yapıyor olabilir

Araştırmada örnek olarak GSM8K adlı test ele alındı. Bu test, yapay zekaların temel matematik problemlerini çözme kabiliyetini ölçüyor ve genellikle “modelin matematiksel akıl yürütme becerisi yüksek” şeklinde yorumlanıyor.

Ancak Mahdi’ye göre doğru cevabı vermek, gerçek anlamda matematiksel muhakeme yapıldığı anlamına gelmiyor:

“Bir çocuğa iki artı beş kaç eder diye sorduğunuzda yedi cevabını vermesi doğru olabilir, ama bu onun aritmetik muhakemeyi kavradığı anlamına gelmez.”

Bilim insanlarından daha güvenilir test çağrısı

Araştırma, testlerin “yapı geçerliliği” (construct validity) sorununa dikkat çekiyor; yani testlerin gerçekten ölçmek istedikleri olguyu ölçüp ölçmedikleri belirsiz.

Yazarlar, yeni çalışmada testlerin daha güvenilir hale getirilmesi için sekiz öneri ve bir kontrol listesi sundu.

Bu öneriler arasında;

Ölçülen eylemin kapsamının açıkça tanımlanması,

Gerçek becerileri temsil edecek görev setleri hazırlanması,

Sonuçların istatistiksel yöntemlerle karşılaştırılması gibi adımlar yer alıyor.

METR AI araştırma merkezinden Nikola Jurkovic, çalışmayı “YZ testlerinin yorumlanabilirliği için önemli bir başlangıç noktası” olarak değerlendirdi.

Gerçek dünyaya dayalı yeni testler yolda

Son dönemde bazı araştırma grupları, YZ modellerinin ekonomik ve pratik görevlerdeki performansını ölçmek için yeni test dizileri geliştirmeye başladı.

Eylül sonunda OpenAI, yapay zekanın 44 farklı meslek için gerekli görevlerdeki başarısını ölçen bir test serisi yayımladı. Bu testler, örneğin sanal bir satış analisti için Excel faturalarındaki tutarsızlıkları düzeltme veya sanal bir video yapımcısı için 60 saniyelik bir çekim planı hazırlama gibi görevleri kapsıyor.

Benzer şekilde AI Safety Center direktörü Dan Hendrycks ve ekibi, uzaktan çalışmada gerekli becerileri test eden yeni bir ölçüm seti geliştirdi. Hendrycks, “YZ sistemleri bazen testlerde yüksek puan alıyor ama testin asıl amacını gerçekte yerine getiremiyor,” dedi.

‘Bilimsel ölçüm yolculuğunun başındayız’

Mahdi, mevcut testlerin yeniden değerlendirilmesi gerektiğini belirterek, “Yapay zeka sistemlerinin bilimsel olarak değerlendirilmesinde henüz yolun başındayız” ifadelerini kullandı.

Araştırma, mevcut yapay zeka değerlendirmelerinde “ölçüm güvenilirliği” konusunun göz ardı edilmesinin, sistemlerin gerçek yeteneklerini abartılı biçimde göstermesine yol açtığını ortaya koyuyor.

Durumu takip etmeye devam edin, Ankara24.com her zaman en yeni haberleri sunuyor.
seeGörüntülenme:77
embedKaynak:https://www.trthaber.com
archiveBu haber kaynaktan arşivlenmiştir 06 Kasım 2025 06:49 kaynağından arşivlendi
0 Yorum
Giriş yapın, yorum yapmak için...
Yayına ilk cevap veren siz olun...
topEn çok okunanlar
Şu anda en çok tartışılan olaylar

Karabük te 30 bin kişi aynı coşkuda buluştu: Hakan Peker ve Sefo sahneyi salladı Karabük Haberleri Habertürk Yerel Haberler

08 Ağustos 2026 02:15see173

İran istihbaratından İsrail’e sosyal medya kancası: Sahte iş ilanlarıyla tuzağa çektiler

07 Ağustos 2026 18:07see168

Mekke Anlaşması NATO nun 5. maddesiyle çelişmiyor Dış Haberler

07 Ağustos 2026 20:31see168

Komşuda korkutan virüs alarmı: Vaka sayısı katlandı! Sivrisineklerden yayılıyor

07 Ağustos 2026 18:53see165

Son dakika haberleri: Dev vinç gemisi Saipem 7000 , Marmara dan Çanakkale Boğazı ndan geçiyor Son dakika haberleri

07 Ağustos 2026 12:02see165

Gizli kanser aort anevrizmasına kapalı yöntemle ameliyat Haberler

07 Ağustos 2026 15:38see158

Stok Gözetim Programı ile 540 milyon liralık matrah artışı sağlandı

07 Ağustos 2026 15:17see157

FIFA Başkanı Infantino nun başı bu kez fena dertte: Genç bir çalışanla ilişki kurduğu iddia ediliyor

08 Ağustos 2026 01:46see156

Diş eti kanaması daha büyük bir sağlık sorununun erken habercisi olabilir

07 Ağustos 2026 07:26see156

HÜDA PAR Genel Başkanı: Artık kan dökülmeyecek olması tek başına çok büyük bir kazanımdır

07 Ağustos 2026 16:57see156

Trabzonspor kafilesi, İzmir e gitti! Salah ve Onana kadroda yok...

07 Ağustos 2026 17:20see154

Denizde SUP’er bir moda

08 Ağustos 2026 07:40see153

SON DAKİKA! Altın fiyatları için kritik veri açıklandı! ABD de istihdam verileri beklentileri karşılamadı

07 Ağustos 2026 15:43see150

THY, temmuzda rekor kırdı!

07 Ağustos 2026 16:10see147

Antalya’da 22 adet kaçak tarihi eser yakalandı

07 Ağustos 2026 16:58see145

Çiftçilere 688 milyon lira tarımsal destek

07 Ağustos 2026 18:54see145

Uzak Doğu nun acısından Avrupa nın klasik tatlarına: Dünyanın en iyi 30 sosu belli oldu! İşte yemeklerinize seviye atlatacak o tatlar

07 Ağustos 2026 13:48see144

Benhur Keser, Kayserispor’da

07 Ağustos 2026 21:02see142

471 uçağa çatlak kontrolü

08 Ağustos 2026 07:09see142

Kolombiya nın yeni lideri yemin etti Dış Haberler

08 Ağustos 2026 04:30see141
newsSon haberler
Günün en taze ve güncel olayları