Microsoft($MSFT), önceden belirlenen seçenekleri puanlayarak sınıflandırma, önceliklendirme ve AI ajanlarını yönetme amacıyla tasarlanan Microsoft-Decision-1 modelini tanıttı. Uzun yanıtlar yerine karar sonucu ve olasılık puanı sunan model, tekrarlayan iş kararlarını otomatikleştirmeyi hedefliyor.
Microsoft, modeli 9 Ekim 2026'da geliştirici yayını üzerinden tanıttı. Model Microsoft Foundry üzerinden kullanılabiliyor; şirket, OpenRouter'da da sunulmasının planlandığını bildirdi. Kullanıcılar seçenekleri önceden belirleyip puanlara göre sonraki adıma geçme, görevi yeniden deneme veya insan incelemesi isteme kararı verebiliyor.
Şirket; talep sınıflandırma, iş önceliklendirme, AI yanıtlarını doğrulama, model seçimi ve ajan davranışlarını yönetmeyi olası kullanım alanları arasında saydı. Örneğin model, AI tarafından üretilen bir yanıtı belirli ölçütlere göre değerlendirip kabul, düzeltme veya reddetme seçeneklerinden birini seçebiliyor. Olay raporlarını aciliyet düzeyine göre ilgili ekiplere yönlendirmek de örnekler arasında yer aldı.
Microsoft-Decision-1, Alibaba'nın Qwen3.5-9B modeli temel alınarak ek eğitimle geliştirildi. Tek bir çıkarım adımında karar puanı vermek üzere tasarlandı. Microsoft, ileride Microsoft AI ve OpenAI'nin diğer modellerini temel alan güncellemeler yapmayı planladığını açıkladı.
Microsoft'un paylaştığı performans verileri şirketin kendi değerlendirmelerine dayanıyor. Şirket, yaklaşık 150 bin soru içeren 36 kıyaslama testinde modelin en yüksek doğruluğu elde ettiğini; Quyet-1.0-Large'dan 4,5 kat, GPT-6 Sol'dan ise 35 kat daha hızlı ölçüldüğünü bildirdi. Girdi değişikliklerinin kararlara yansıma oranı ortalama yüzde 1,3 oldu. Microsoft ayrıca zararlı talepler, jailbreak girişimleri ve prompt enjeksiyonlarını kapsayan 11 kıyaslama testindeki 5.250 isteği değerlendirdiğini belirtti.
Şirketin paylaştığı kurum içi denemelerden biri, Xbox Research'ün oyunlarla ilgili görüşleri sınıflandırmasıydı. Anketlerin yanı sıra Steam ve X'te yayımlanan 10 binden fazla oyun yorumunu konularına göre sınıflandıran Microsoft, GPT-6 Sol'a benzer kaliteye 14 kattan fazla hızla ve maliyetin 200'de biri düzeyinde ulaşıldığını açıkladı.
Copilot ekibinin yanıt kalitesi değerlendirmesinde de Microsoft, GPT-5.6 Luna ile rekabet edebilecek sonuçları 100 kat daha hızlı elde ettiğini bildirdi. Şirket, olay müdahalesi için bilgi arama ve bilimsel araştırma iş akışlarına ilişkin denemelerin sonuçlarını da paylaştı. Bu sonuçların tamamı Microsoft'un kendi değerlendirmelerine dayanıyor.
Olasılık puanları, işlemlerin otomatik yürütülmesiyle insan incelemesi arasında seçim yapmak için kullanılabilir. Ancak puanlar tek başına kararların doğruluğunu garanti etmiyor. Gerçek iş süreçlerinde yanlış kararların yol açabileceği yeniden çalışma, inceleme yükü ve işletme maliyetlerinin de değerlendirilmesi gerekiyor. Şimdiye kadar açıklanan kullanım örnekleri Microsoft'un kurum içi denemeleriyle sınırlı.
Yorum 0