HizmetlerIYapay Zekâ Mimarisi ve Model Mühendisliği

MetrikOdaklıDeğerlendirme

(Evaluation) ve Karşılaştırmalı Model Test Altyapıları

Teknik Problem

Modellerin performansının yüzeysel gözlemlerle ölçülmeye çalışılması, canlı ortama alınan sistemlerde doğruluk ve güvenlik oranlarının analitik olarak takip edilememesi.

Mimari Çözüm

Kod geliştirme aşamasına geçmeden önce projeye özel sentetik ve gerçek veri test setleri hazırlıyoruz. Modelleri; bağlam sadakati (context precision/recall), yanıt doğruluğu (faithfulness), zehirlilik (toxicity), latency (yanıt süresi) ve token/maliyet oranı gibi teknik metriklerle otomatik değerlendirme hatlarına (Ragas, DeepEval vb.) tabi tutuyoruz.

Operasyonel Çıktı

Kişisel tahminlere değil, tamamıyla matematiksel verilere dayanan model seçim süreçleri; güncelleme öncesi ve sonrası sistem başarısını kesin olarak kanıtlayan izlenebilirlik.

Başlangıç Koşulları

Canlıda bir model ya da prompt varsa ve 'yeni sürüm daha iyi mi' sorusu izlenimle cevaplanıyorsa bu hizmet gerekir. Sizde olması gereken tek şey bir uzmanın zamanı: doğru ile yanlışı ayırabilen birinin haftada birkaç saati. Bu olmadan hiçbir metrik anlam taşımaz — ölçüm, kimin neyi doğru saydığını bilmeden yapılamaz.

Çalışma Biçimi

Önce sistemin cevaplaması gereken sorular ve beklenen cevaplar yazılıyor; ölçüt yoksa ölçüm de yoktur. Sentetik örnekler gerçek örneklerin yerine değil yanına konuyor. Mevcut durum ölçülüp başlangıç sabitleniyor. Metrikler karara göre seçiliyor: doğruluk mu, gecikme mi, maliyet mi — üçünü birden iyileştiren bir değişiklik nadirdir. Koşum takımı CI'a bağlanıyor, böylece her değişiklik kendiliğinden yeniden ölçülüyor.

Kapsam Dışı

Bu hizmet hangi modeli alacağınıza karar vermez; karşılaştırmayı üretir, karar sizde kalır. Tanımlayamadığınız şeyi de ölçmez — 'daha iyi bir üslup' isteği önce sınanabilir bir ölçüte dönüşmek zorunda. Tek seferlik bir rapor değildir: kimse çalıştırmazsa koşum takımı birkaç ay içinde gerçeği söylemeyi bırakır, o yüzden CI'a bağlanması işin parçası.

Diğer hizmetler

OpenAIGeminiAnthropicQwenGrokKimiGoogleAmazon S3Windows 365MetaHugging FaceAmazonAppleAndroidVisual StudioLLM