LLM Gateway ve model gözlemlenebilirliği: tek modele bağımlı kalmadan, her çağrıyı ölçerek
Kurumsal yapay zeka projelerinde en pahalı karar, farkında olmadan verilen karardır: ajanların, istemlerin (prompt) ve entegrasyonların tek bir modele ve tek bir sağlayıcıya sıkı sıkıya bağlanması. Model fiyatı değiştiğinde, daha iyi bir açık ağırlıklı model çıktığında ya da veri yerleşimi kuralı sıkılaştığında, bu bağ her şeyi yeniden yazmak anlamına gelir.
İki kavram bu bağımlılığı çözer. LLM Gateway, ajanlar ile modeller arasına giren tek bir katmandır: hangi modelin cevap vereceği bir politika kararı haline gelir. Model gözlemlenebilirliği ise her çağrının izini, maliyetini ve kalitesini ölçer; neyin işe yaradığını tahmin değil, veri söyler. Bu yazı ikisini de Zzeti Zeka Platformu'ndaki karşılıklarıyla anlatır.
Tek modele bağımlılığın maliyeti
Bağımlılık üç yerde ortaya çıkar. Teknik bağımlılık: istemler ve araç çağrıları belirli bir modelin davranışına göre ayarlanmıştır; model değişince ajan bozulur. Ticari bağımlılık: fiyat, kota ve hizmet koşullarını tek sağlayıcı belirler. Uyumluluk bağımlılığı: verinin nereye gittiği sağlayıcının altyapısına bağlıdır ve bu, KVKK açısından her değişiklikte yeniden değerlendirme demektir.
Model-agnostik mimari bu üç bağı aynı anda gevşetir: ajan gateway'e bağlanır, gateway modeli seçer, veri yerel modelde kalır — bulut modeli yalnızca izin verilen işler için ve maskelemenin arkasından kullanılır.
- Teknik: istemler ve araçlar modele değil gateway sözleşmesine bağlanır.
- Ticari: sağlayıcı değişikliği bir yönlendirme kuralıdır.
- Uyumluluk: hassas veri yerel modelde; bulut yalnızca politika izin verirse.
LLM Gateway nedir, ne yapar?
LLM Gateway (Zzeti'de AI Gateway), uygulamaların ve ajanların model çağırdığı tek API'dir. Arkasında vLLM veya Ollama ile sunulan yerel açık ağırlıklı modeller ve — izin verilirse — 30'dan fazla bulut sağlayıcı durur. Gateway kimlik doğrulamayı, yönlendirmeyi, yük dengelemeyi, semantik önbelleği, hız ve bütçe limitlerini ve kaydı üstlenir; önünde PII maskeleme çalışır.
Yönlendirme politikaya göre yapılır: varsayılan yerel model; göreve göre semantik yönlendirme (kısa sınıflandırma küçük modele, uzun analiz büyük modele); semantik önbellekte eşleşme varsa hiçbir modele gidilmez; bir model yanıt vermezse tanımlı yedek devreye girer. Kapalı devre kurulumda bulut rotası tamamen kapalıdır.
- Tek API: ajanlar ve uygulamalar gateway'i çağırır, modeli bilmek zorunda değildir.
- Yönlendirme: yerel öncelikli, göreve göre semantik, yedekli.
- Yük dengeleme: birden fazla model kopyası tek uç noktada.
- Semantik önbellek: tekrar eden sorular modele gitmeden cevaplanır.
- Limitler: LLM başına bütçe, aylık limit, hız sınırlama.
- Güvenlik: PII maskeleme ve politika kontrolleri gateway'in önünde.
Model-agnostik mimari pratikte: model değişince ne değişir?
Cevap, iyi kurulmuş bir mimaride “neredeyse hiçbir şey”dir. Ajanlar, iş akışları, guardrails ve değerlendirme senaryoları gateway'in sözleşmesine bağlıdır. Yeni bir açık ağırlıklı model çıktığında Model Hub'dan indirilir, GPU sunucusunda sunulur ve Playground'da aynı test senaryolarıyla mevcut modelle karşılaştırılır. AI Judge geçme eşiğini aşarsa tek bir yönlendirme kuralıyla devreye alınır; aşmazsa hiçbir şey değişmez.
Aynı mekanizma ince ayar için de geçerlidir: Fine-tune Studio'da kurumun verisiyle LoRA uyarlaması yapılan model, gateway'de başka bir seçenektir — ajanların haberi olmaz.
- Değişen: Model Hub'daki model dosyası ve bir yönlendirme kuralı.
- Değişmeyen: ajanlar, istemler, araç çağrıları, guardrails, test senaryoları.
- Karar mekanizması: Playground karşılaştırması + AI Judge eşiği.
- Geri alma: kuralı eski haline getirmek.
Model gözlemlenebilirliği: neyi, nerede ölçüyoruz?
Gözlemlenebilirlik, klasik uygulama izlemenin LLM'e uyarlanmış halidir ama ölçülen şeyler farklıdır. Bir oturum, ajan adımlarına; her adım, model ve MCP çağrılarına ayrılır. Her çağrı için token sayısı, gecikme, kullanılan kaynaklar (hangi koleksiyon, hangi fonksiyon), çalışan SQL ve ajanın verdiği karar kaydedilir. Maliyet ekip, ajan ve model bazında hesaplanır; yerel modellerde token maliyeti sıfırdır ama GPU zamanı yine görünürdür.
Bütün bunlar Zzeti'de Monitor altında toplanır: gateway trafiği, ajan filosu, LLM/MCP/ajan bazında gecikme, başarı oranı, uyarılar ve canlı topoloji haritası. Kayıtlar kurumun kendi kurulumunda tutulur; dışarıya telemetri gitmez. Bu, aynı zamanda bir KVKK incelemesinin “kim, neye, ne zaman erişti” sorusunun cevabıdır.

- İz: oturum → ajan adımı → model/MCP çağrısı; debug görünümü.
- Token ve gecikme: model, ajan ve konektör bazında.
- Maliyet: ekip/ajan/model; bütçe ve limitlerle.
- Sağlık: başarı oranı, ajan filosu, uyarılar, topoloji.
- Denetim: kim ne sordu, hangi veri okundu, hangi aksiyon alındı.
Kalite ölçümü: AI Judge, test senaryoları, geri bildirim
Gecikme ve maliyet ölçmek kolaydır; kalite ölçmek disiplin ister. Yöntem, her ajan için bir test senaryosu seti tutmaktır: gerçek sorular, beklenen davranış ve geçme eşikleri. AI Judge bu senaryoları bir değerlendirici modelle puanlar; kullanıcı geri bildirimi (beğeni/düzeltme) ve bütünlük kontrolleri puanı tamamlar. Yeni model, yeni istem ya da yeni konektör canlıya alınmadan önce aynı setten geçer.
Bu disiplin olmadan “model-agnostik” bir slogan olarak kalır: değiştirebilirsiniz ama daha iyi olup olmadığını bilemezsiniz.
- Test seti: gerçek sorular + beklenen davranış + eşik.
- AI Judge: değerlendirici modelle puanlama; geçme eşiği.
- Geri bildirim döngüsü: kullanıcı düzeltmeleri test setine girer.
- Kural: canlıya çıkan her değişiklik aynı setten geçer.
Maliyet yönetişimi: bütçe, limit, önbellek
Gateway maliyeti yalnızca ölçmez, yönetir. LLM başına bütçe ve aylık limit, bir ajanın ya da ekibin beklenmedik bir yükle bütçeyi tüketmesini önler; hız sınırlama tepe saatte sistemi korur; semantik önbellek tekrar eden soruları modele götürmeden cevaplar. Yerel modeller token maliyeti üretmediği için gateway'in yerel öncelikli yönlendirmesi en etkili tasarruf kuralıdır.
İyi bir uygulama, maliyeti iş birimine göre raporlamaktır: hangi ekip, hangi senaryo, hangi model. Bu rapor olmadan yapay zeka maliyeti “BT gideri” olarak kalır; raporla birlikte, her senaryonun kapattığı sızıntıyla karşılaştırılabilir bir kaleme dönüşür.
- Bütçe ve limit: LLM başına, aylık; aşımda uyarı veya durdurma.
- Hız sınırlama: tepe saatte koruma.
- Semantik önbellek: tekrar eden sorularda sıfır model maliyeti.
- Yerel öncelikli yönlendirme: token maliyetinin kendisini ortadan kaldırır.
- Raporlama: ekip, senaryo ve model bazında.
LLM Gateway ajanları modelden ayırır; gözlemlenebilirlik her çağrıyı ölçülebilir kılar. İkisi birlikte LLMOps'un temelidir: model değişince ajanlar değişmez, maliyet iş birimine göre görünür, kalite tahminle değil test setiyle kanıtlanır — ve bütün kayıtlar kurumun kendi kurulumunda kalır.
Sık sorulan sorular
LLM Gateway ile AI Gateway aynı şey mi?
Evet. Zzeti'deki AI Gateway bir LLM Gateway'dir: yerel ve bulut modellerin önünde kimlik doğrulama, yönlendirme, yük dengeleme, semantik önbellek, limitler ve kayıt işlerini üstlenen tek API. Uygulamalar ve ajanlar gateway'i çağırır; hangi modelin cevap vereceği kurulumun içinde verilen bir politika kararıdır.
Gözlemlenebilirlik verisi dışarıya gider mi?
Hayır. İzler, token ve maliyet sayımları, kalite puanları ve denetim kaydı kurumun kendi kurulumunda tutulur. Telemetri ve dışarıya veri akışı yoktur; kapalı devre kurulumda hiç dış bağlantı yoktur.
Mevcut bulut LLM aboneliğimizi gateway'in arkasına alabilir miyiz?
Evet, izin verirseniz. Gateway hassas olmayan işleri bulut sağlayıcıya yönlendirirken hassas veri yerel modelde kalır; aynı maskeleme, erişim kuralları ve maliyet limitleri uygulanır. Birçok kurum tamamen yerel başlar, bulut modellerini sonra ekler — ya da hiç eklemez.
Model kalitesini kim değerlendiriyor — başka bir model mi?
AI Judge, test senaryolarını bir değerlendirici modelle puanlar; ama eşiği, test setini ve kabul kararını kurum verir. Kullanıcı geri bildirimi ve bütünlük kontrolleri puanı tamamlar. Değerlendirici model de yerel çalışabilir.
Aynı mimari, kapsamı belirli bir proje olarak kurulur
Zzeti Zeka gateway'i, RAG'ı, MCP konektörlerini, ajanları ve gözlemlenebilirliği hazır getirir; Skyloop bunu — on-premise, kapalı devre veya özel bulut — kapsamı ve ölçütü baştan tanımlı bir proje olarak altyapınıza kurar, saat bazlı danışmanlık olarak değil.