NEAR AI, matematiksel 'biçimsel ispat' karşılaştırma ölçütü PutnamBench'teki Lean 4 formatındaki 672 problemin tamamını toplam 111 dolara çözdüğünü öne sürdü. Rakamlar aynı koşullarda doğrulanırsa bu sonuç, yapay zeka ajanlarının maliyet verimliliği açısından dikkat çekici bir örnek olabilir.
CryptoBriefing, NEAR AI'nin Lean ajanının PutnamBench'teki tüm soruları çözdüğünü ve rakip sistemlere kıyasla 250 kat daha düşük maliyetle sonuca ulaştığını duyurdu. Ancak haberde, karşılaştırmada hangi modelin, hangi çalıştırma bütçesinin, hangi arama yönteminin ve hangi yeniden deneme yapısının aynı koşullarda tutulduğu net biçimde ortaya konmuyor.
Şu an doğrulanabilen temel bilgi, NEAR AI'nin 672 problemi tamamladığını ve toplam maliyetin 111 dolar olduğunu öne sürdüğü. PutnamBench'in herkese açık lider tablosunda aynı sonucun bağımsız biçimde henüz yansımadığı belirtiliyor.
PutnamBench'in resmi deposu, Lean 4 için problem sayısını 672 olarak veriyor. Bu karşılaştırma ölçütü, ABD ve Kanada'daki üniversiteler arası matematik yarışması Putnam'ın sorularını Lean 4, Isabelle ve Coq gibi biçimsel dillere çevirerek yapay zekanın otomatik teorem ispatlama becerisini ölçüyor.
'Biçimsel ispat', yapay zekanın yalnızca doğru cevabı bulmasının ötesinde, makinenin doğrulayabileceği bir ispat süreci ortaya koyup koymadığını test ediyor. Deponun, yayımlanan ispat kodunun tek başına doğrulama kanıtı olarak kullanılmaması yönündeki uyarısı da, sonuç rakamı kadar yeniden üretim sürecinin ve doğrulama yönteminin önemli olduğunu gösteriyor.
NEAR AI'nin bu iddiası, NEAR Protokol(NEAR) ekosisteminde ayrı bir anlam taşıyor; çünkü şirket uzun süredir 'doğrulanabilir yapay zeka' anlatısını öne çıkarıyor. NEAR'ın resmi yapay zeka sayfası, kullanıcı sahipliğinde yapay zeka, güvenilir yürütme ortamı (TEE) ve gerçek zamanlı doğrulamayı temel yapı taşları olarak tanımlıyor.
Güvenilir yürütme ortamı, verileri dış erişime kapalı, izole bir donanım katmanında işleyen bir teknoloji. Bu yapı blok zinciriyle birleştiğinde, yapay zeka çıkarım sürecinin, ödemelerin ve ajan işlemlerinin ne ölçüde doğrulanabilir hale getirilebileceği tartışmanın merkezinde yer alıyor.
NEAR AI, şubat ayında IronClaw, Confidential GPU Marketplace ve çok modlu gizli çıkarım altyapısını duyurarak ajanların hesaplama yapıp işlem gerçekleştirebildiği ve iş birliği kurabildiği bir altyapıyı öne çıkarmıştı. Şirketin PutnamBench iddiası, bu teknoloji anlatısına bir maliyet verimliliği rakamı ekliyor.
TokenPost daha önce NEAR AI'nin NEAR stake'ini yapay zeka hesaplama erişim hakkıyla ilişkilendiren yapısını haberleştirmişti. O dönemki odak noktası klasik stake getirisinden çok yapay zeka hizmeti ödemeleri ve gizlilikti; bu yeni iddia da aynı çizgide, doğrulanabilir yapay zeka altyapısının performans-maliyet tarafını öne çıkarıyor.
Biçimsel ispat alanındaki rekabet de sürüyor. Mistral AI, 2 Temmuz'da yaptığı resmi açıklamada Leanstral 1.5 modelinin PutnamBench'te 672 sorudan 587'sini çözdüğünü duyurdu.
Mistral AI aynı açıklamada problem başına yaklaşık 4 dolarlık bir maliyet belirtti. Logical Intelligence ise Aleph Prover modelinin 6 Ocak itibarıyla PutnamBench'te 672 sorudan 668'ini çözdüğünü, çözülen problem başına ortalama maliyetin yaklaşık 68 dolar olduğunu açıkladı.
Yalnızca bu tabloya bakıldığında NEAR AI'nin 111 dolarlık toplam maliyet iddiası göze çarpıyor. Ancak her sistemin model yapısı, arama yöntemi, çalıştırma bütçesi ve problem yeniden deneme koşulları farklı olduğundan, maliyet karşılaştırmasını doğrudan bir üstünlük sıralamasına dönüştürmek güç.
PutnamBench lider tablosunun da yaklaşıma göre hesaplama bütçesini daha iyi gösterecek bir format üzerinde çalıştığı belirtiliyor. Maliyet verimliliği değerlendirmesinin, resmi lider tablosu ile araştırma notlarının aynı ölçütle düzenlenmesinden sonra daha net hale gelebileceği ifade ediliyor.
NEAR AI'nin bu sonucunun NEAR fiyatına ya da ekosistem talebine nasıl bir etki yapacağı, bu haberin kapsamının dışında. Şu an tartışılan konu fiyat beklentisi değil, doğrulanabilir yapay zeka altyapısının gerçek bir karşılaştırma ölçütünde ne düzeyde maliyet verimliliği sağladığı ve bu sonucun bağımsız biçimde yeniden üretilip üretilemeyeceği.
Yorum 0