Sevgili Turkhacks okurları, yapay zeka dünyasında artık yalnızca “hangi model daha iyi?” sorusunu sormak yeterli olmuyor. Çünkü yeni nesil frontier modeller sadece daha fazla metin üretmiyor, kod yazıyor, araştırma yapıyor, bilgisayar kullanıyor ve hatta kendilerinden sonraki yapay zeka sistemlerinin geliştirilmesinde aktif olarak görev almaya başlıyor.
Tam da bu noktada Anthropic önemli bir öneri ortaya koydu.
Şirket, frontier AI laboratuvarlarında yapay zeka gelişiminin hızını dışarıdan takip edebilmek için yeni ölçüm sistemleri geliştirdi. Amaç yalnızca Claude'un veya başka bir modelin benchmark puanlarını açıklamak değil.
Asıl soru şu:
Yapay zeka sistemleri kendilerini geliştirme sürecinde ne kadar daha fazla rol almaya başladı?
Anthropic bunun için üç temel ölçüm alanı öneriyor:
Frontier model, yapay zeka teknolojisinin mevcut sınırlarını zorlayan, yüksek kapasiteye sahip en gelişmiş modeller için kullanılan bir ifade.
Bugün bu kategoriye girebilecek sistemler yalnızca klasik sohbet botlarından oluşmuyor.
Yeni nesil modeller;
Anthropic'in yeni yaklaşımı tam olarak burada devreye giriyor.
Bence sistemin en dikkat çekici tarafı da burada.
Claude, yeni yapay zeka modellerinin geliştirilmesinde ne kadar görev alıyor?
Çünkü AI sistemleri gelecekte kendi haleflerinin geliştirilmesine giderek daha fazla katkıda bulunabilir.
Bu durum literatürde “recursive self-improvement” yani yinelemeli/kendini geliştiren yapay zeka fikriyle ilişkilendiriliyor.
Ancak Anthropic'in açıkladığı mevcut ölçümlerde Claude'un tamamen otonom şekilde AI Ar-Ge'si yürüttüğü bir alan bulunmuyor.
Buna rağmen şirketin Ağustos 2026 verilerine göre Claude, Anthropic'in ölçülen AI Ar-Ge çalışmalarının %26'sında “lead” seviyesinde, yani insanın sürekli olarak sürece müdahale etmesine gerek kalmadan işin büyük bölümünü gerçekleştirebilecek seviyede kullanılıyor.
Daha da dikkat çekici nokta ise şu:
Şubat 2026'da bu oran %1'in altındaydı.
Yani birkaç ay içerisinde ciddi bir değişim görülmüş durumda.
Basitleştirirsek:
Örneğin bir yazılım geliştiricisinin bozulan bir veri işleme sistemini düzeltmesi gerektiğini düşünelim.
AL3 seviyesinde geliştirici Claude'a logları verir, problemi birlikte inceler ve yapılan değişiklikleri yakından kontrol eder.
AL4 seviyesinde ise geliştirici sadece problemi tanımlar. Claude logları analiz eder, problemi bulur, kodu değiştirir, testleri gerçekleştirir ve sonuçları raporlar. İnsan son kontrolden sonra kararı verir.
AL5 ise çok daha farklı.
Bu seviyede AI problemi kendisi fark eder, çözümü geliştirir, test eder ve üretim sistemine uygular.
Anthropic'in açıklamasına göre bu seviyeye henüz ulaşılmış değil.
Çünkü gelecekte yapay zekanın en büyük değişimlerinden biri yalnızca daha zeki modeller değil, uzun süre çalışan AI ajanları olabilir.
Bir chatbot'a soru sorarsınız ve cevap verir.
Bir AI ajanına ise:
Ajan arka planda onlarca veya yüzlerce işlem gerçekleştirebilir.
Bu sistemler daha da geliştiğinde bir ajan başka ajanlara görev verebilir, araştırma yapabilir, kod yazabilir ve sonuçları değerlendirebilir.
Dolayısıyla burada yeni bir soru ortaya çıkıyor:
AI bu kadar fazla işlem yaparken kim kontrol ediyor?
Anthropic bunun için üç farklı ölçüm kullanıyor:
Bu üç değer birlikte düşünüldüğünde AI ajanlarının ne kadar gözetim altında çalıştığı hakkında daha anlamlı bir tablo ortaya çıkıyor.
Şirketin en çok kullanılan dahili platformlarından birinde aynı anda yaklaşık 30 bin AI ajanının araştırma ve mühendislik çalışmalarında görev yaptığı belirtiliyor.
Bu ajanların işlemleri hem gerçek zamanlı hem de işlem sonrasında izleniyor.
Şirket, Ağustos 2026 boyunca araştırma ve mühendislik ajanlarının gerçekleştirdiği 1 milyardan fazla kararı analiz ettiğini ve bunların yaklaşık %0,002'sinin online izleme sistemi tarafından engellendiğini açıkladı.
Bu yaklaşık olarak her 47 bin karardan birinin engellenmesi anlamına geliyor.
Burada önemli bir ayrıntı var.
Bu oranı doğrudan “AI ajanlarının tehlike oranı” şeklinde yorumlamak doğru olmaz.
Çünkü sistem yalnızca belirli Anthropic iç platformlarını ve belirli izleme mekanizmalarını kapsıyor.
Compute allocation.
Yani şirketin sahip olduğu hesaplama kaynaklarının nereye harcandığı.
Bunun önemli olmasının nedeni basit:
AI modelleri geliştikçe çok büyük miktarlarda GPU ve benzeri hesaplama kaynaklarına ihtiyaç duyuluyor.
Bu kaynaklar;
Dolayısıyla şirketin hesaplama kaynaklarını nereye ayırdığı, AI geliştirme stratejisi hakkında önemli bilgiler sağlayabilir.
Şirketin açıklamasına göre bu dönemde AI Ar-Ge çalışmalarına ayrılan hesaplama gücünün yaklaşık %6'sı güvenlik çalışmalarına ayrıldı.
AI tarafından yürütülen AI Ar-Ge çalışmalarında ise bu oran yaklaşık %12 olarak hesaplandı.
Ancak Anthropic burada önemli bir uyarı yapıyor.
Compute miktarı, güvenlik çalışmalarının tamamını tek başına ölçmek için kusursuz bir yöntem değil.
Çünkü bazı güvenlik araştırmaları çok fazla hesaplama gücü kullanmazken araştırmacıların ciddi miktarda zamanını alabilir.
Dolayısıyla %6 oranını doğrudan “AI güvenliğinin sadece %6'sı yapılıyor” şeklinde yorumlamak doğru olmaz.
Bugün bir AI modeli tanıtıldığında genellikle şu rakamlara bakıyoruz:
Bu modeller geliştirilirken AI'nın kendisi ne kadar kullanılıyor?
Bu oldukça önemli.
Çünkü iki şirket aynı seviyede bir model geliştiriyor olabilir.
Fakat birinci şirket modelin geliştirilmesinde yoğun şekilde AI ajanları kullanırken ikinci şirket büyük ölçüde insan mühendislerle çalışıyor olabilir.
Modelin son benchmark puanı bunu bize göstermez.
Yeni ölçüm sistemi ise geliştirme sürecinin kendisine bakmayı amaçlıyor.
Şirket, farklı frontier AI laboratuvarlarının benzer ölçümleri düzenli olarak yayınlamasının karşılaştırma yapılmasına yardımcı olabileceğini belirtiyor.
Ancak bunun önünde bazı problemler var.
Örneğin:
Ortak bir metodoloji nasıl belirlenecek?
Bir şirket “AI bu görevin %80'ini yapıyor” diyebilir.
Başka bir şirket aynı görevi farklı şekilde ölçebilir.
Sonuç olarak iki şirketin rakamlarını doğrudan karşılaştırmak mümkün olmayabilir.
Anthropic bu nedenle üçüncü taraf değerlendirmelerinin kullanılmasını da öneriyor.
Şu anda yapay zeka modelleri tamamen kendi başlarına yeni nesil modeller tasarlayıp üretmiyor.
Fakat AI'nın yazılım geliştirme, araştırma, test, hata ayıklama ve değerlendirme gibi görevlerde daha fazla kullanılması, geliştirme sürecindeki insan emeğinin yapısını değiştirebilir.
Anthropic'in verileri de bu değişimin ölçülebilir hale geldiğini gösteriyor.
Şubat 2026'da AI'nın “lead” seviyesinde olduğu AI Ar-Ge çalışmaları %1'in altındayken, Ağustos 2026'da %26 seviyesine ulaşmış durumda.
Bu tek başına “AI kendini geliştiriyor” anlamına gelmez.
Fakat AI'nın AI geliştirme döngüsünde daha fazla sorumluluk üstlenmeye başladığını gösteren önemli bir ölçüm olarak değerlendirilebilir.
Böyle bir sistem yaygınlaşırsa gelecekte bir AI modeli tanıtıldığında yalnızca:
Belki de bunun yanında:
Anthropic'in önerdiği ölçümlerin önemli taraflarından biri, yalnızca Anthropic'e özel kalmaması.
OpenAI, Google, Meta, xAI, DeepSeek, Alibaba, Tencent ve diğer frontier AI geliştiricileri benzer ölçümleri aynı metodolojiyle yayınlarsa, AI gelişiminin hızı konusunda çok daha karşılaştırılabilir bir tablo ortaya çıkabilir.
Ancak burada şirketlerin ticari sırları da devreye giriyor.
Bir AI şirketinin;
Bu nedenle gelecekte şeffaflık ile ticari gizlilik arasında bir denge kurulması gerekecek.
Benchmarklar hâlâ önemli.
Bir modelin matematik, kodlama, bilim, görsel anlama veya ajan görevlerindeki performansını ölçmek için benchmarklar gerekli.
Fakat Anthropic'in yaklaşımı bize başka bir şeyi hatırlatıyor:
Modelin ne yaptığı kadar nasıl geliştirildiği de önemli.
Özellikle AI ajanlarının giderek daha fazla kullanıldığı bir dönemde model performansını tek başına değerlendirmek yeterli olmayabilir.
Modelin yetenekleri yükselirken insan denetiminin de aynı hızda gelişmesi gerekiyor.
Çünkü önümüzdeki yıllarda yapay zeka modellerinin gelişim hızını sadece daha büyük GPU kümeleri veya daha fazla parametre belirlemeyebilir.
AI'nın kendisi;
Bu nedenle geleceğin AI yarışında sadece model benchmarklarını değil, AI'nın AI geliştirme sürecindeki payını da takip etmek gerekebilir.
Anthropic'in Ağustos 2026 verilerinde Claude'un ölçülen AI Ar-Ge çalışmalarının %26'sında “lead” seviyesine ulaşması, bu değişimin artık teorik bir tartışmanın ötesine geçtiğini gösteren dikkat çekici bir veri noktası. Ancak bu oran yalnızca Anthropic'in kendi metodolojisi ve iç süreçleri üzerinden hesaplandığı için diğer şirketlerle doğrudan kıyaslama yapmak şu aşamada doğru olmaz.
Önümüzdeki dönemde OpenAI, Google, Meta ve diğer frontier AI laboratuvarlarının da benzer ölçümleri paylaşması halinde çok daha ilginç bir tablo ortaya çıkabilir.
Belki birkaç yıl sonra yeni bir AI modeli tanıtıldığında ilk sorumuz “kaç milyar parametre?” veya “benchmark puanı kaç?” olmayacak.
Asıl soru şu olabilir:
“Bu modeli artık ne kadar insan, ne kadar yapay zeka geliştirdi?”
Ve işte yapay zeka yarışının belki de en önemli aşaması tam burada başlayacak.
Bir dahaki makalemizde görüşene kadar mavi ekransız ve sorunsuz sistemlerle çalışmanız dileği ile.
Tam da bu noktada Anthropic önemli bir öneri ortaya koydu.
Şirket, frontier AI laboratuvarlarında yapay zeka gelişiminin hızını dışarıdan takip edebilmek için yeni ölçüm sistemleri geliştirdi. Amaç yalnızca Claude'un veya başka bir modelin benchmark puanlarını açıklamak değil.
Asıl soru şu:
Yapay zeka sistemleri kendilerini geliştirme sürecinde ne kadar daha fazla rol almaya başladı?
Anthropic bunun için üç temel ölçüm alanı öneriyor:
- Yapay zekanın AI Ar-Ge çalışmalarında ne kadar görev aldığı
- AI ajanlarının ne kadar etkili şekilde denetlendiği
- Kullanılan hesaplama gücünün ne kadarının hangi alanlara ayrıldığı
Frontier Model Nedir?
Öncelikle “frontier model” kavramını biraz açalım.Frontier model, yapay zeka teknolojisinin mevcut sınırlarını zorlayan, yüksek kapasiteye sahip en gelişmiş modeller için kullanılan bir ifade.
Bugün bu kategoriye girebilecek sistemler yalnızca klasik sohbet botlarından oluşmuyor.
Yeni nesil modeller;
- Kod yazabiliyor
- Yazılım projelerini analiz edebiliyor
- Web üzerinde araştırma yapabiliyor
- Bilgisayar kullanabiliyor
- Uzun süre çalışan AI ajanlarına güç verebiliyor
- Bilimsel ve teknik araştırmalara destek olabiliyor
- Başka AI sistemlerinin geliştirilmesinde kullanılabiliyor
Anthropic'in yeni yaklaşımı tam olarak burada devreye giriyor.
Anthropic: AI Gelişimini Nasıl Ölçeceğiz?
Anthropic'in önerdiği sistem üç ana başlıktan oluşuyor.
Bence sistemin en dikkat çekici tarafı da burada.
1. Yapay Zeka Kendi Geliştirilmesinde Ne Kadar Kullanılıyor?
Anthropic'in üzerinde durduğu ilk konu oldukça dikkat çekici:Claude, yeni yapay zeka modellerinin geliştirilmesinde ne kadar görev alıyor?
Çünkü AI sistemleri gelecekte kendi haleflerinin geliştirilmesine giderek daha fazla katkıda bulunabilir.
Bu durum literatürde “recursive self-improvement” yani yinelemeli/kendini geliştiren yapay zeka fikriyle ilişkilendiriliyor.
Ancak Anthropic'in açıkladığı mevcut ölçümlerde Claude'un tamamen otonom şekilde AI Ar-Ge'si yürüttüğü bir alan bulunmuyor.
Buna rağmen şirketin Ağustos 2026 verilerine göre Claude, Anthropic'in ölçülen AI Ar-Ge çalışmalarının %26'sında “lead” seviyesinde, yani insanın sürekli olarak sürece müdahale etmesine gerek kalmadan işin büyük bölümünü gerçekleştirebilecek seviyede kullanılıyor.
Daha da dikkat çekici nokta ise şu:
Şubat 2026'da bu oran %1'in altındaydı.
Yani birkaç ay içerisinde ciddi bir değişim görülmüş durumda.
AI'nın Rolü Nasıl Sınıflandırılıyor?
Anthropic burada Epoch AI tarafından geliştirilen otomasyon seviyelerine dayanan bir yaklaşım kullanıyor.Basitleştirirsek:
| Seviye | Açıklama |
|---|---|
| AL0 | AI kullanılmıyor |
| AL1 | AI sınırlı şekilde yardımcı oluyor |
| AL2 | AI destek sağlıyor |
| AL3 | AI insanla birlikte çalışıyor |
| AL4 | AI işin büyük bölümünü yönetiyor |
| AL5 | AI tamamen otonom çalışıyor |
Örneğin bir yazılım geliştiricisinin bozulan bir veri işleme sistemini düzeltmesi gerektiğini düşünelim.
AL3 seviyesinde geliştirici Claude'a logları verir, problemi birlikte inceler ve yapılan değişiklikleri yakından kontrol eder.
AL4 seviyesinde ise geliştirici sadece problemi tanımlar. Claude logları analiz eder, problemi bulur, kodu değiştirir, testleri gerçekleştirir ve sonuçları raporlar. İnsan son kontrolden sonra kararı verir.
AL5 ise çok daha farklı.
Bu seviyede AI problemi kendisi fark eder, çözümü geliştirir, test eder ve üretim sistemine uygular.
Anthropic'in açıklamasına göre bu seviyeye henüz ulaşılmış değil.
2. AI Ajanları Ne Kadar Denetleniyor?
İkinci ölçüm alanı ise AI ajanları.Çünkü gelecekte yapay zekanın en büyük değişimlerinden biri yalnızca daha zeki modeller değil, uzun süre çalışan AI ajanları olabilir.
Bir chatbot'a soru sorarsınız ve cevap verir.
Bir AI ajanına ise:
dersiniz.“Bu araştırmayı yap, sonuçları karşılaştır ve rapor hazırla.”
Ajan arka planda onlarca veya yüzlerce işlem gerçekleştirebilir.
Bu sistemler daha da geliştiğinde bir ajan başka ajanlara görev verebilir, araştırma yapabilir, kod yazabilir ve sonuçları değerlendirebilir.
Dolayısıyla burada yeni bir soru ortaya çıkıyor:
AI bu kadar fazla işlem yaparken kim kontrol ediyor?
Anthropic bunun için üç farklı ölçüm kullanıyor:
Coverage
Ajanın gerçekleştirdiği işlemlerin ne kadarının bir güvenlik sistemi tarafından kontrol edildiğini gösteriyor.Review Latency
Bir işlem gerçekleştirildikten sonra ne kadar sürede incelendiğini ölçüyor.Escalation Rate
Şüpheli veya tehlikeli görülen işlemlerin ne kadarının engellendiğini veya insan incelemesine gönderildiğini gösteriyor.Bu üç değer birlikte düşünüldüğünde AI ajanlarının ne kadar gözetim altında çalıştığı hakkında daha anlamlı bir tablo ortaya çıkıyor.
Anthropic'te Kaç AI Ajanı Çalışıyor?
Anthropic'in Ağustos 2026 verileri burada da oldukça ilginç.Şirketin en çok kullanılan dahili platformlarından birinde aynı anda yaklaşık 30 bin AI ajanının araştırma ve mühendislik çalışmalarında görev yaptığı belirtiliyor.
Bu ajanların işlemleri hem gerçek zamanlı hem de işlem sonrasında izleniyor.
Şirket, Ağustos 2026 boyunca araştırma ve mühendislik ajanlarının gerçekleştirdiği 1 milyardan fazla kararı analiz ettiğini ve bunların yaklaşık %0,002'sinin online izleme sistemi tarafından engellendiğini açıkladı.
Bu yaklaşık olarak her 47 bin karardan birinin engellenmesi anlamına geliyor.
Burada önemli bir ayrıntı var.
Bu oranı doğrudan “AI ajanlarının tehlike oranı” şeklinde yorumlamak doğru olmaz.
Çünkü sistem yalnızca belirli Anthropic iç platformlarını ve belirli izleme mekanizmalarını kapsıyor.
3. Hesaplama Gücü Nereye Harcanıyor?
Üçüncü ölçüm ise biraz daha donanımsal.Compute allocation.
Yani şirketin sahip olduğu hesaplama kaynaklarının nereye harcandığı.
Bunun önemli olmasının nedeni basit:
AI modelleri geliştikçe çok büyük miktarlarda GPU ve benzeri hesaplama kaynaklarına ihtiyaç duyuluyor.
Bu kaynaklar;
- Yeni model eğitimi
- Model araştırması
- AI ajanları
- Ürün hizmetleri
- Güvenlik araştırmaları
- Alignment çalışmaları
- Model değerlendirmeleri
Dolayısıyla şirketin hesaplama kaynaklarını nereye ayırdığı, AI geliştirme stratejisi hakkında önemli bilgiler sağlayabilir.
Anthropic Compute Kaynaklarının Ne Kadarını Güvenliğe Ayırıyor?
Anthropic, 13-20 Temmuz 2026 arasındaki bir haftalık dönemi inceleyerek bir örnekleme yaptı.Şirketin açıklamasına göre bu dönemde AI Ar-Ge çalışmalarına ayrılan hesaplama gücünün yaklaşık %6'sı güvenlik çalışmalarına ayrıldı.
AI tarafından yürütülen AI Ar-Ge çalışmalarında ise bu oran yaklaşık %12 olarak hesaplandı.
Ancak Anthropic burada önemli bir uyarı yapıyor.
Compute miktarı, güvenlik çalışmalarının tamamını tek başına ölçmek için kusursuz bir yöntem değil.
Çünkü bazı güvenlik araştırmaları çok fazla hesaplama gücü kullanmazken araştırmacıların ciddi miktarda zamanını alabilir.
Dolayısıyla %6 oranını doğrudan “AI güvenliğinin sadece %6'sı yapılıyor” şeklinde yorumlamak doğru olmaz.
Peki Bu Sistem Neden Önemli?
Burada asıl mesele benchmark sonuçlarının ötesine geçmek.Bugün bir AI modeli tanıtıldığında genellikle şu rakamlara bakıyoruz:
- Matematik benchmarkları
- Kodlama testleri
- Genel bilgi testleri
- Görsel anlama
- Uzun bağlam
- Ajan performansı
Bu modeller geliştirilirken AI'nın kendisi ne kadar kullanılıyor?
Bu oldukça önemli.
Çünkü iki şirket aynı seviyede bir model geliştiriyor olabilir.
Fakat birinci şirket modelin geliştirilmesinde yoğun şekilde AI ajanları kullanırken ikinci şirket büyük ölçüde insan mühendislerle çalışıyor olabilir.
Modelin son benchmark puanı bunu bize göstermez.
Yeni ölçüm sistemi ise geliştirme sürecinin kendisine bakmayı amaçlıyor.
Şeffaflık Meselesi Burada Devreye Giriyor
Anthropic'in önerisinin önemli bölümlerinden biri de verilerin yalnızca şirketlerin kendi açıklamalarına bırakılmaması.Şirket, farklı frontier AI laboratuvarlarının benzer ölçümleri düzenli olarak yayınlamasının karşılaştırma yapılmasına yardımcı olabileceğini belirtiyor.
Ancak bunun önünde bazı problemler var.
Örneğin:
Ortak bir metodoloji nasıl belirlenecek?
Bir şirket “AI bu görevin %80'ini yapıyor” diyebilir.
Başka bir şirket aynı görevi farklı şekilde ölçebilir.
Sonuç olarak iki şirketin rakamlarını doğrudan karşılaştırmak mümkün olmayabilir.
Anthropic bu nedenle üçüncü taraf değerlendirmelerinin kullanılmasını da öneriyor.
AI'nın Kendi Kendini Geliştirmesi Nereye Gidiyor?
Konunun belki de en dikkat çekici tarafı burası.Şu anda yapay zeka modelleri tamamen kendi başlarına yeni nesil modeller tasarlayıp üretmiyor.
Fakat AI'nın yazılım geliştirme, araştırma, test, hata ayıklama ve değerlendirme gibi görevlerde daha fazla kullanılması, geliştirme sürecindeki insan emeğinin yapısını değiştirebilir.
Anthropic'in verileri de bu değişimin ölçülebilir hale geldiğini gösteriyor.
Şubat 2026'da AI'nın “lead” seviyesinde olduğu AI Ar-Ge çalışmaları %1'in altındayken, Ağustos 2026'da %26 seviyesine ulaşmış durumda.
Bu tek başına “AI kendini geliştiriyor” anlamına gelmez.
Fakat AI'nın AI geliştirme döngüsünde daha fazla sorumluluk üstlenmeye başladığını gösteren önemli bir ölçüm olarak değerlendirilebilir.
Gelecekte AI Modellerini Böyle Takip Edebiliriz
Böyle bir sistem yaygınlaşırsa gelecekte bir AI modeli tanıtıldığında yalnızca:
demeyeceğiz.“Model şu benchmarkta şu puanı aldı.”
Belki de bunun yanında:
“Bu modelin geliştirilmesinde AI ne kadar görev aldı?”
“Kaç AI ajanı kullanıldı?”
“Bu ajanlar ne kadar denetlendi?”
gibi sorular da soracağız.“Hesaplama kaynaklarının ne kadarı güvenliğe ayrıldı?”
Diğer AI Şirketleri İçin de Uygulanabilir mi?
Teorik olarak evet.Anthropic'in önerdiği ölçümlerin önemli taraflarından biri, yalnızca Anthropic'e özel kalmaması.
OpenAI, Google, Meta, xAI, DeepSeek, Alibaba, Tencent ve diğer frontier AI geliştiricileri benzer ölçümleri aynı metodolojiyle yayınlarsa, AI gelişiminin hızı konusunda çok daha karşılaştırılabilir bir tablo ortaya çıkabilir.
Ancak burada şirketlerin ticari sırları da devreye giriyor.
Bir AI şirketinin;
- GPU kapasitesi
- model eğitim süreci
- Ar-Ge iş akışı
- kullanılan ajan altyapısı
- güvenlik sistemleri
Bu nedenle gelecekte şeffaflık ile ticari gizlilik arasında bir denge kurulması gerekecek.
Benchmarkların Sonu mu Geliyor?
Hayır.Benchmarklar hâlâ önemli.
Bir modelin matematik, kodlama, bilim, görsel anlama veya ajan görevlerindeki performansını ölçmek için benchmarklar gerekli.
Fakat Anthropic'in yaklaşımı bize başka bir şeyi hatırlatıyor:
Modelin ne yaptığı kadar nasıl geliştirildiği de önemli.
Özellikle AI ajanlarının giderek daha fazla kullanıldığı bir dönemde model performansını tek başına değerlendirmek yeterli olmayabilir.
Modelin yetenekleri yükselirken insan denetiminin de aynı hızda gelişmesi gerekiyor.
Turkhacks Yorumu: AI Yarışında Yeni Bir Ölçüm Dönemi Başlayabilir
Sevgili Turkhacks okurları, bana göre Anthropic'in burada ortaya koyduğu en önemli fikir “AI ne kadar akıllı?” sorusundan ziyade “AI geliştirme sürecinin ne kadarı artık AI tarafından gerçekleştiriliyor?” sorusunu gündeme getirmesi.Çünkü önümüzdeki yıllarda yapay zeka modellerinin gelişim hızını sadece daha büyük GPU kümeleri veya daha fazla parametre belirlemeyebilir.
AI'nın kendisi;
- kod yazarsa,
- deney tasarlarsa,
- test yaparsa,
- hataları bulursa,
- araştırma yaparsa,
- başka AI ajanlarını yönetirse,
Bu nedenle geleceğin AI yarışında sadece model benchmarklarını değil, AI'nın AI geliştirme sürecindeki payını da takip etmek gerekebilir.
Anthropic'in Ağustos 2026 verilerinde Claude'un ölçülen AI Ar-Ge çalışmalarının %26'sında “lead” seviyesine ulaşması, bu değişimin artık teorik bir tartışmanın ötesine geçtiğini gösteren dikkat çekici bir veri noktası. Ancak bu oran yalnızca Anthropic'in kendi metodolojisi ve iç süreçleri üzerinden hesaplandığı için diğer şirketlerle doğrudan kıyaslama yapmak şu aşamada doğru olmaz.
Önümüzdeki dönemde OpenAI, Google, Meta ve diğer frontier AI laboratuvarlarının da benzer ölçümleri paylaşması halinde çok daha ilginç bir tablo ortaya çıkabilir.
Belki birkaç yıl sonra yeni bir AI modeli tanıtıldığında ilk sorumuz “kaç milyar parametre?” veya “benchmark puanı kaç?” olmayacak.
Asıl soru şu olabilir:
“Bu modeli artık ne kadar insan, ne kadar yapay zeka geliştirdi?”
Ve işte yapay zeka yarışının belki de en önemli aşaması tam burada başlayacak.
Bir dahaki makalemizde görüşene kadar mavi ekransız ve sorunsuz sistemlerle çalışmanız dileği ile.



