Teknik genel bakış • LLM Gateway • RAG • MCP • Gözlemlenebilirlik

Zzeti Zeka Platform mimarisi: model-agnostik LLM Gateway, RAG, ajanlar ve gözlemlenebilirlik — kendi altyapınızda

Bu sayfa, Skyloop'un yapay zeka spin-off'u Zzeti tarafından geliştirilen Zzeti Zeka Platformu'nun katmanlarını teknik ekipler için özetler: bir istek kanaldan girdikten sonra hangi kontrollerden geçer, model nasıl seçilir, veri nereden gelir, ne ölçülür ve platform on-premise, kapalı devre (air-gapped), özel bulut ya da hibrit topolojide nasıl kurulur. Türkiye'deki yetkili bayi ve uygulama ortağı Skyloop Cloud kurulumu kapsamı belirli bir proje olarak yapar ve işletir.

Zzeti Zeka Platform sayfası →On-premise yerel LLM rehberi →
6
Katman, tek platform
30+
LLM sağlayıcı, tek gateway
50+
MCP konektörü
0
Kapalı devre kurulumda dış çağrı
Mimari

Altı katman, tek platform: kanaldan modele giden yol.

Her katman tek başına incelenebilir; birlikte, yerel bir modeli kurumsal bir sisteme dönüştüren şey tam olarak budur.

1

Kanallar ve arayüzler

Zeka Chat konsolu, WhatsApp, sesli asistan, Board'lar ve webhook'larıyla REST API. Her kanal aynı kimlik, erişim ve guardrail katmanından geçer; kendi uygulamanız API üzerinden aynı ajanları çağırır.

2

Ajan katmanı

Uzman ve işçi ajanlar; yetenekler (skills), hedefler ve personalar; koşullu mantıklı görsel iş akışı tasarımcısı; insan onayı için Actions Inbox (human-in-the-loop); her adımın debug izi. Ajanlar modele değil gateway'e bağlanır — model değişince ajan değişmez.

3

Bilgi katmanı: Context Lake ve RAG

Context Lake dokümanları, tabloları ve sorgu sonuçlarını koleksiyonlara alır; RAG bu koleksiyonlardan ilgili parçaları getirip modele bağlam olarak verir. Query Bench veri ambarı ve ERP sorgularını MCP üzerinden çalıştırır; sonuçlar yeniden kullanılabilir bağlam olur. Gömme (embedding) modelleri ve vektör deposu da kurulumun içinde çalışır.

4

Model katmanı: LLM Gateway

Model-agnostik LLM Gateway (Zzeti'de AI Gateway): vLLM, Ollama veya Llama.cpp ile sunulan yerel açık ağırlıklı modeller ve — yalnızca izin verirseniz — 30+ bulut sağlayıcı tek uç noktanın arkasında. Model Hub ve GPU Sunucuları modelleri indirir ve çalıştırır; Fine-tune Studio LoRA ile kendi verinize uyarlar; yük dengeleme, semantik yönlendirme ve semantik önbellek gateway'de uygulanır.

5

Entegrasyon katmanı: MCP konektörleri

Ajanlar ERP, CRM, veri ambarı ve ofis araçlarına yönetişimli MCP (Model Context Protocol) konektörleriyle ulaşır — Nebim V3, Logo, SAP, Microsoft 365, Google Workspace ve özel sistemler; doğrudan veritabanı bağlantısı yoktur. MCP Inspector ve Functions IDE yeni konektör ve fonksiyonların test edilip yayınlanmasını sağlar; entegrasyon proxy'si dışa giden hangi bağlantıların var olacağına karar verir.

6

Yönetişim ve gözlemlenebilirlik

Security Hub ve Access Wizard (rol bazlı erişim, IAM politikaları), guardrails ve PII maskeleme, AI Judge ile kalite değerlendirmesi, Monitor'da oturumlar, izler, gateway trafiği ve gecikme, LLM başına bütçe ve hız limitleri, her erişim için denetim kaydı — hepsi sizin kurulumunuzda.

İstek yaşam döngüsü

LLM Gateway bir isteği nasıl işler.

1

Kimlik ve kapsam

İstek kullanıcı ve ajan kimliğiyle gelir; rol hiyerarşisi (ör. Mağaza → Bölge → Merkez) hangi veriye, hangi konektöre ve hangi modele erişilebileceğini belirler.

2

Guardrails

Girdi politikaları, PII maskeleme ve gizli anahtar tespiti modelden önce çalışır; çıktı politikaları cevaptan sonra. Kurallar gateway'in arkasındaki modelden bağımsızdır.

3

Yönlendirme

Gateway isteği politikaya göre yönlendirir: varsayılan yerel model; göreve göre semantik yönlendirme; semantik önbellekte eşleşme varsa modele hiç gidilmez; bulut sağlayıcı yalnızca açıkça izin verildiyse ve maliyet/hız limitleri içinde.

4

Çıkarım ve bağlam

RAG koleksiyonlarından gelen parçalar ve MCP araç çağrılarının sonuçları bağlama eklenir; çıkarım sizin GPU'nuzda vLLM veya Ollama ile yapılır. Yük dengeleme birden fazla model kopyasını tek uç noktada toplar.

5

İz ve maliyet

Her adım izlenir — token sayısı, gecikme, kullanılan kaynaklar, çalışan SQL, ajan kararları; maliyet ekip, ajan ve model bazında hesaplanır; AI Judge örneklem üzerinde kaliteyi puanlar. Kayıtlar kurulumunuzda kalır.

Model-agnostik olmanın pratik anlamı: ajanlar, iş akışları ve guardrails gateway'in arkasındaki modele bağlı değildir. Yeni bir açık ağırlıklı model çıktığında Model Hub'dan indirilir, Playground'da aynı test senaryolarıyla karşılaştırılır ve tek bir yönlendirme kuralıyla devreye alınır — hiçbir ajan yeniden yazılmaz.

Platformdan ekranlar

İçgörü panosu, MCP konektörü ve gateway topolojisi.

Temsili ekranlar, örnek veriler — tam boyut için tıklayın.

Zzeti İçgörü Panosu: Cube Analist ajanının OLAP küplerinden ürettiği bulgular ve aksiyona dönüşen kritik sorun (temsili ekran, örnek veriler)
Ajan → içgörü → atanmış aksiyon. Cube Analist ajanı OLAP küplerini tarar, bulguları çıkarır ve kritik olanı bölge müdürüne görev olarak atar.
Zzeti Nebim V3 MCP konektörü: ajanlar Nebim V3 verisine standart MCP araçlarıyla ulaşır; her çağrı kayıt altında (temsili ekran, örnek veriler)
MCP konektörü. Ajanlar Nebim V3 (MS SQL Server) verisine adlandırılmış araçlarla — query, list_tables, describe_table — bağlantı havuzu üzerinden ve salt okunur modda ulaşır; hangi ajanın hangi aracı çağırdığı izlenir ve loglanır.
Zzeti AI Gateway topolojisi: ajanlar, MCP sunucuları ve yerel GPU'larda açık ağırlıklı LLM'ler, çağrı başına gecikme ölçümü (temsili ekran, örnek veriler)
Kendi veri merkezinizde gateway topolojisi. Açık ağırlıklı LLM'ler yerel GPU'larda çalışır; AI Gateway ajanlar, MCP sunucuları ve modeller arasındaki merkezdir — her ajan, model ve MCP çağrısı tek noktadan izlenir, gecikmesi ölçülür.
Model gözlemlenebilirliği & LLMOps

Neyi ölçüyoruz: her çağrı, her ajan adımı, her kuruş.

Monitor, AI Judge ve denetim kaydı kendi kurulumunuzda çalışır. Gözlemlenebilirlik, bir pilotu işletilen bir sisteme dönüştüren — ve bir KVKK incelemesinin görmek istediği — şeydir.

İzler (traces)
Oturum → ajan adımı → model veya MCP çağrısı; her adım için debug görünümü.
Token ve gecikme
Model, ajan ve konektör bazında; yerel modellerde token maliyeti sıfır.
Maliyet
LLM başına bütçe, aylık limitler, istek başına maliyet, hız sınırlama.
Kalite
AI Judge test senaryoları ve geçme eşikleri, kullanıcı geri bildirimi, bütünlük kontrolleri.
Sağlık
Ajan filosu, başarı oranı, canlı topoloji haritası, uyarılar.
Denetim
Kim ne sordu, hangi veri okundu, hangi aksiyon alındı — her kayıt kurulumunuzda.
Modeller, sunum & donanım

Hangi modeller, hangi motorlar, hangi donanım?

BileşenSeçeneklerNot
Açık ağırlıklı modellerQwen, Llama, Mistral, Gemma ve Hugging Face'teki diğer açık ağırlıklı modeller; Türkçe için uyarlanmış türevler dahilModel Hub'dan indirilir; Fine-tune Studio'da LoRA ile kendi verinize uyarlanır
Çıkarım motorlarıvLLM, Ollama, Llama.cppGPU Sunucuları: yerel, uzak veya Kubernetes GPU'ları tek uç noktanın arkasında
Bulut modelleri (isteğe bağlı)OpenAI, Anthropic, Google, AWS Bedrock, Azure ve 30+ sağlayıcıYalnızca gateway'de izin verilirse ve önünde PII maskelemeyle; kapalı devre kurulumda hiç
Gömme ve vektör deposuGömme (embedding) modelleri ve vektör deposu kurulumun içinde çalışırRAG koleksiyonları Context Lake'te tutulur
DonanımNVIDIA DGX Spark, veri merkezinizdeki GPU sunucuları, Kubernetes GPU havuzu, edge düğümü olarak Apple SiliconSkyloop keşif aşamasında boyutlandırır ve DGX Spark'ı tedarik edebilir
Platform çalışma zamanıKubernetes veya Docker; Terraform IaC ile kurulumGüvenlik ekipleri tüm kurulumu kod olarak inceler
Kurulum topolojileri

On-premise, kapalı devre, özel bulut ya da hibrit — aynı platform.

Topolojiler arasındaki fark platformda değil, ağ sınırında ve bakım sürecindedir. KVKK kontrolleri hepsinde varsayılan olarak açıktır.

On-premise

Platform veri merkezinizdeki Kubernetes veya Docker üzerinde, modeller yerel GPU'larınızda çalışır; dış bağlantılar entegrasyon proxy'sinin izin verdikleriyle sınırlıdır.

Kapalı devre (air-gapped)

Sıfır dış çağrı. Model dosyaları, güncellemeler ve konektörler sizin onayladığınız bakım süreciyle içeri alınır; lisans veya telemetri için internet gerekmez.

Türkiye'de özel bulut

Verinin ülke içinde kalması gerektiği ama binanızda kalması şart olmadığı durumlar: AWS İstanbul Local Zone veya Türkiye'deki özel bulut alanı — aynı platform, aynı kontroller.

Hibrit, yerel öncelikli

Hassas veri yerel modellerde kalır; hassas olmayan işler gateway üzerinden izin verdiğiniz bulut sağlayıcılara gider — aynı maskeleme, erişim kuralları ve maliyet limitleriyle.

Adım adım veri akışı, kurulum modeli karşılaştırması ve KVKK kontrolleri: on-premise yerel LLM rehberi →

SSS

Teknik ekiplerin mimariyle ilgili sorduğu sorular

Zzeti'de 'model-agnostik' (LLM-agnostik) ne demek?

Ajanlar, iş akışları, guardrails ve değerlendirmeler belirli bir modele değil gateway'e bağlıdır. vLLM veya Ollama ile sunulan yerel açık ağırlıklı modeller ve — izin verirseniz — bulut sağlayıcılar aynı uç noktanın arkasında birbirinin yerine geçebilir; model, ajanları yeniden yazarak değil, bir yönlendirme kuralıyla değiştirilir. Playground ve AI Judge'daki aynı test senaryoları yeni modelin daha iyi olup olmadığını canlıya almadan önce gösterir.

LLM Gateway ile AI Gateway aynı şey mi?

Evet. Zzeti'deki AI Gateway bir LLM Gateway'dir: yerel ve bulut modellerin önünde kimlik doğrulama, yönlendirme, yük dengeleme, semantik önbellek, hız limitleri, bütçe ve kayıt işlerini üstlenen tek bir API. Uygulamalar ve ajanlar gateway'i çağırır; hangi modelin cevap vereceği kurulumunuzun içinde verilen bir politika kararıdır.

Model gözlemlenebilirliği neleri kapsar?

Her oturum, ajan adımı ve model/MCP çağrısı için izler; model, ajan ve konektör bazında token sayısı ve gecikme; bütçe ve limitlerle ekip, ajan ve model bazında maliyet; AI Judge test senaryoları ve kullanıcı geri bildiriminden kalite puanları; Monitor'da filo sağlığı, başarı oranları ve uyarılar; kimin ne sorduğunun ve hangi verinin okunduğunun denetim kaydı. Hepsi kendi kurulumunuzda tutulur — dışarıya hiçbir şey gönderilmez.

Kapalı devre (air-gapped) kurulumda hangi bileşenler çalışır, güncelleme nasıl yapılır?

Her şey: gateway, yerel modeller, gömme modelleri ve vektör deposu, ajanlar, ağınızın içindeki MCP konektörleri, guardrails ve izleme yığını. Model dosyaları, platform güncellemeleri ve yeni konektörler paketlenir, kontrol edilir ve sizin onayladığınız bakım süreciyle içeri alınır — canlı bir bağlantı üzerinden değil. Lisans ve telemetri için internet gerekmez.

Ajanlar ERP verisine nasıl ulaşır — MCP nedir?

MCP (Model Context Protocol), bir ajanın araçları ve veri kaynaklarını yönetişimli biçimde çağırdığı açık standarttır. Zzeti'de her ERP, CRM veya veri ambarı sistemi adlandırılmış fonksiyonları ve şemasıyla bir MCP konektörü olarak sunulur — Nebim V3, Logo, SAP, Microsoft 365, Google Workspace ya da özel bir sistem. Ajan hiçbir zaman veritabanı bağlantısı açmaz; her çağrı role göre kapsamlanır, iziyle birlikte kaydedilir ve yazma işlemleri Actions Inbox'ta onay gerektirebilir.

RAG dokümanları nerede tutulur, hangi kaynaklar beslenebilir?

Context Lake'te — gömme modelleri ve vektör deposuyla birlikte kurulumunuzun içinde tutulan koleksiyonlar olarak. Koleksiyonlar dosya paylaşımları ve doküman sistemlerinden, MCP üzerinden Microsoft 365 veya Google Workspace'ten ve ERP/veri ambarı sorguları üzerinde çalışan Query Bench sonuçlarından beslenebilir. Bir koleksiyona erişim, diğer her şeyle aynı rol hiyerarşisini izler.

Zzeti ile Skyloop arasındaki ilişki nedir?

Zzeti Zeka Platformu, Skyloop'un yapay zeka spin-off'u Zzeti (Zzeti FZCO, Dubai) tarafından geliştirilir ve bağımsız bir platformdur; global pazarda 'Zzeti', Türkiye'de 'Zzeti Zeka' adıyla anılır. Skyloop Cloud Türkiye'deki yetkili bayi ve uygulama ortağıdır: donanımı boyutlandırır, platformu müşterinin altyapısına kurar, entegrasyonları yapar ve işletir — saat bazlı danışmanlık olarak değil, kapsamı belirli projeler olarak.

Kubernetes zorunlu mu? Kendi ekibimiz işletebilir mi?

Hayır — platform Kubernetes veya Docker üzerine Terraform ile kurulur; güvenlik ekibiniz kurulumu kod olarak inceleyebilir. Kapsamı belirli kurulum projesinden sonra platformu kendi ekibiniz işletebilir; Skyloop güncellemeleri, model yükseltmelerini ve desteği sizin verdiğiniz erişimle, ağ sınırlarınızın içinde, siz istediğiniz sürece sağlar.

Mimariyi kendi ortamınızda görün.

Hangi sistemlerin bağlanacağını, hangi verinin asla dışarı çıkmaması gerektiğini ve beklenen kullanıcı sayısını söyleyin. Skyloop referans mimariyi sizin topolojinize uyarlar; bir boyutlandırma ve kapsamı belirli bir kurulum projesiyle geri döner — saat bazlı danışmanlık teklifiyle değil.

Zzeti Zeka Platform →