İnternetsiz ortamda güvenli yapay zeka: kapalı devre (air-gapped) kurumsal LLM mimarisi nasıl kurulur?
Regüle sektörlerde, gizlilik sözleşmesiyle bağlı üreticilerde ve müşteri verisi tutan perakendecilerde aynı cümle duyuluyor: “Yapay zeka istiyoruz ama veri dışarı çıkmayacak.” Bu cümlenin teknik karşılığı tek bir API anahtarı değil, bir mimaridir: modelin, bağlamın, konektörlerin ve kayıtların tamamı kurumun kendi ağ sınırı içinde çalışır; gerekirse o ağın internetle hiç bağlantısı olmaz.
Bu yazı, kapalı devre (air-gapped) bir kurumsal LLM kurulumunun bileşenlerini, bir sorunun içeride nasıl cevaplandığını, internet olmadan güncellemenin nasıl yapıldığını ve bir KVKK incelemesinin hangi kanıtları istediğini anlatır. Ürün adı geçen yerlerde Zzeti Zeka Platformu'nu referans alıyoruz; mimari ilkeler ise her yerel LLM kurulumu için geçerlidir.
Kapalı devre, on-premise ve özel bulut: üç farklı ağ sınırı
Üç kavram sık sık birbirinin yerine kullanılır ama ağ sınırı her birinde farklıdır. On-premise kurulumda platform sizin donanımınızda çalışır; ağ, sizin izin verdiğiniz dış bağlantılara açık olabilir — örneğin model indirmek ya da hassas olmayan bir işi bulut sağlayıcıya yönlendirmek için. Türkiye içindeki özel bulutta donanım bir veri merkezindedir, veri ülke dışına çıkmaz ama binanızda da değildir. Kapalı devre kurulumda ise hiç dış bağlantı yoktur: platform, modeller, bağlam ve kayıtlar tamamen izole bir ağda yaşar.
Hangisinin doğru olduğu veri sınıfına bağlıdır. Çoğu kurumda üç sınıf aynı anda bulunur: dışarı çıkabilen genel içerik, ülke içinde kalması gereken kişisel veri ve binadan çıkmaması gereken ticari sır. İyi bir mimari bu sınıfları birbirinin rakibi gibi değil, yan yana çalışan katmanlar gibi ele alır — ve en hassas sınıf için kapalı devre modu her zaman açık kalır.
- On-premise: sizin donanımınız, sizin izin verdiğiniz dış bağlantılar.
- Özel bulut (Türkiye): sizin alanınız, ülke içinde; veri yurt dışına çıkmaz.
- Kapalı devre (air-gapped): sıfır dış bağlantı; güncelleme ve model dosyaları bakım süreciyle içeri alınır.
- Karar ölçütü: hangi veri sınıfı hangi sınırı gerektiriyor — teknoloji tercihi değil, veri envanteri.
Referans mimari: altı bileşen
Yerel bir model tek başına bir kurumsal sistem değildir; çıkarım motoru ve model dosyası birkaç günde ayağa kalkar. Zaman alan ve güvenliği belirleyen kısım modelin etrafındaki katmanlardır. Kapalı devre bir kurulumda bu katmanların her biri ağın içinde çalışmak zorundadır — bulut tarafında “sonra ekleriz” denebilecek hiçbir parça yoktur.
Aşağıdaki altı bileşen, Zzeti Zeka Platformu'nun katmanlarıyla birebir örtüşür; farklı bir yığın kuruyorsanız da aynı listeyi kontrol listesi olarak kullanabilirsiniz.

- Model sunumu: vLLM, Ollama veya Llama.cpp ile sunulan açık ağırlıklı modeller (Qwen, Llama, Mistral, Gemma ve Türkçe için uyarlanmış türevleri); model dosyaları yerel bir model kaydında tutulur.
- LLM Gateway: ajanların ve uygulamaların tek bir uç nokta üzerinden model çağırdığı katman — yük dengeleme, semantik yönlendirme, önbellek, hız ve bütçe limitleri; kapalı devre modunda bulut sağlayıcı rotası kapalıdır.
- RAG: gömme (embedding) modeli, vektör deposu ve doküman koleksiyonları — hepsi içeride. Bir soru geldiğinde ilgili parçalar bu koleksiyonlardan getirilip modele bağlam olarak verilir.
- MCP konektörleri: ERP, CRM ve veri ambarına yönetişimli araç çağrılarıyla erişim; doğrudan veritabanı bağlantısı yok. Hangi dış bağlantının var olacağına entegrasyon proxy'si karar verir — kapalı devrede hiçbiri.
- Guardrails ve erişim kontrolü: PII maskeleme, gizli anahtar tespiti, girdi/çıktı politikaları ve rol hiyerarşisi (ör. Mağaza → Bölge → Merkez) modelden önce çalışır.
- Gözlemlenebilirlik: izler, token ve gecikme sayımı, maliyet, kalite puanları ve denetim kaydı — yine içeride. Telemetri dışarı gitmez.
Veri akışı: bir soru içeride nasıl cevaplanır?
Mimariyi en iyi anlatan şey tek bir isteğin izlediği yoldur. Kullanıcı konsoldan, WhatsApp üzerinden ya da kurumun kendi uygulamasından bir soru sorar; istek kullanıcı ve ajan kimliğiyle gateway'e ulaşır. Rol hiyerarşisi bu kimliğin hangi koleksiyonlara, hangi konektörlere ve hangi modele erişebileceğini belirler.
Sonra guardrails çalışır: kişisel veri maskelenir, gizli anahtarlar yakalanır, politika kuralları uygulanır. Ajan gerekirse MCP üzerinden ERP'den veri çeker ve RAG koleksiyonlarından ilgili parçaları alır; çıkarım yerel GPU'da yapılır. Cevap çıktı politikalarından geçer, kullanıcıya döner ve tüm adımlar — hangi kaynak kullanıldı, hangi SQL çalıştı, kaç token harcandı — denetim kaydına yazılır. Bu zincirin hiçbir halkası ağ sınırının dışına çıkmaz.
- Kimlik → kapsam: kullanıcı ve ajan rolü erişilebilir veri ve modeli belirler.
- Guardrails: PII maskeleme ve politika kontrolü modelden önce.
- Bağlam: MCP araç çağrıları + RAG parçaları.
- Çıkarım: yerel model, yerel GPU.
- Kayıt: iz, token, kaynak ve aksiyon denetim kaydında — kurulumun içinde.
İnternet olmadan güncelleme: model dosyaları, konektörler, yamalar
Kapalı devre kurulumların en çok sorulan sorusu şudur: “Yeni model çıktığında ne olacak?” Cevap, canlı bir bağlantı değil, tanımlı bir bakım sürecidir. Model dosyaları, platform güncellemeleri ve yeni konektörler dışarıda paketlenir, sağlama değeri (checksum) ile doğrulanır ve kurumun onayladığı bir süreçle — fiziksel ortam ya da tek yönlü bir aktarım noktası üzerinden — içeri alınır. İçeride yerel model kaydına yazılır ve gateway'de bir yönlendirme kuralıyla devreye girer.
Bu sürecin iyi tasarlanması, kapalı devrenin “eski kalma” korkusunu ortadan kaldırır. Yeni modeli canlıya almadan önce aynı test senaryolarıyla karşılaştırmak (Playground ve AI Judge) ve geri alma planını hazır tutmak, bulutta olduğu kadar içeride de mümkündür.
- Paketleme: model dosyaları + platform sürümü + konektörler, sürüm numarası ve sağlama değeriyle.
- Onay: güvenlik ekibi paketi inceler; içeri alma kurumun değişiklik yönetimi sürecine bağlıdır.
- Doğrulama: yeni model Playground'da aynı test senaryolarıyla eski modelle karşılaştırılır.
- Devreye alma: tek bir yönlendirme kuralı; ajanlar değişmez; geri alma bir kural değişikliğidir.
- Lisans ve telemetri için internet gerekmez.
Donanım boyutlandırma: kaç kullanıcı, hangi model, ne kadar bellek?
Boyutlandırmayı üç soru belirler: hangi modeller çalışacak, aynı anda kaç kullanıcı ve ajan istek üretecek, RAG koleksiyonları ne kadar büyük. Modelin parametre sayısı ve nicemleme (quantization) düzeyi GPU belleğini, eşzamanlı istek sayısı ise çıkarım motorunun kopya sayısını ve yük dengelemeyi belirler. Gömme modeli ve vektör deposu da bellek ister; bunlar sıklıkla unutulur.
Masaüstünde tek bir NVIDIA DGX Spark başlamak ve birçok orta ölçekli kurulum için yeterlidir; daha büyük yükler veri merkezindeki GPU sunucularında ya da Kubernetes GPU havuzunda çalışır; Apple Silicon edge düğümü olarak kullanılabilir. Doğru yaklaşım keşif aşamasında ölçmek, pilotta doğrulamak ve kademeli büyütmektir — ilk günden “en büyük sunucu” almak değil.
- Model seçimi: görev için yeterli en küçük model; büyük model her zaman daha iyi cevap vermez, her zaman daha pahalıdır.
- Eşzamanlılık: tepe saatte beklenen istek sayısı; yük dengeleme ve önbellek eşzamanlılığı düşürür.
- RAG: koleksiyon boyutu gömme ve vektör deposu belleğini belirler.
- Büyüme yolu: DGX Spark → GPU sunucusu → Kubernetes GPU havuzu; platform aynı kalır.
KVKK incelemesi için kanıtlar
Verinin Türkiye'de ve kurumun kontrolünde kalması, yurt dışına aktarım sorusunu ortadan kaldırır; ama bir inceleme bununla yetinmez. Kişisel verinin modele ulaşmadan önce maskelendiğini, kimin hangi veriye eriştiğini, hangi sorguların çalıştığını ve bunların kayıt altında olduğunu görmek ister. Kapalı devre mimarinin avantajı, bu kanıtların tamamının zaten içeride üretiliyor olmasıdır.
Pratikte kurulumun yanına iki doküman eklemek işi tamamlar: hangi veri sınıfının hangi koleksiyonda ve hangi rolde erişilebilir olduğunu gösteren bir veri envanteri ve ajanların neyi yapıp neyi yapamayacağını tanımlayan bir yapay zeka kullanım politikası.
- PII maskeleme kayıtları: hangi alanlar, hangi kurallarla maskelendi.
- Erişim matrisi: rol → koleksiyon → konektör → model.
- Denetim kaydı: oturum, iz, fonksiyon çağrısı, çalışan SQL.
- Veri envanteri ve yapay zeka kullanım politikası: kurulumla birlikte teslim.
Kapalı devre kurumsal LLM, bir modelin internetten koparılması değil, altı katmanın — model sunumu, gateway, RAG, MCP konektörleri, guardrails ve gözlemlenebilirlik — tamamının kurumun ağ sınırı içinde çalışmasıdır. İyi tasarlanmış bir bakım süreci, kapalı devrenin “eski kalma” korkusunu ortadan kaldırır; kanıt üreten bir mimari ise KVKK incelemesini bir hazırlık projesi olmaktan çıkarır.
Sık sorulan sorular
Kapalı devre kurulumda hangi açık kaynak modeller çalışır?
Hugging Face'teki her açık ağırlıklı model — Qwen, Llama, Mistral, Gemma ve Türkçe için uyarlanmış türevler — vLLM, Ollama veya Llama.cpp ile sunulabilir. Model dosyaları bakım süreciyle içeri alınır ve yerel model kaydında tutulur; birden fazla model tek gateway'in arkasında yük dengelemeyle çalışabilir.
Kapalı devre ile on-premise kurulum arasındaki fark nedir?
On-premise kurulumda platform sizin donanımınızda çalışır ama izin verdiğiniz dış bağlantılar olabilir; kapalı devrede hiç yoktur. Fark platformda değil, ağ sınırında ve bakım sürecindedir: aynı platform, aynı kontroller, farklı dış bağlantı politikası.
RAG için dokümanlar nerede tutulur?
Kurulumun içindeki koleksiyonlarda — gömme modeli ve vektör deposuyla birlikte. Dosya paylaşımları, doküman sistemleri ve MCP üzerinden ERP ya da veri ambarı sorguları koleksiyonları besler; koleksiyona erişim rol hiyerarşisini izler.
Kapalı devre kurulum daha pahalı mıdır?
Donanım ve kurulum maliyeti ağ sınırına değil model ve kullanıcı sayısına bağlıdır; kapalı devre ek bir lisans gerektirmez. Farklı olan işletim modelidir: güncellemeler bakım penceresinde içeri alınır. Yerel modellerde token maliyeti olmadığı için yoğun kullanımda toplam maliyet çoğu zaman API faturasının altında kalır.
Aynı mimari, kapsamı belirli bir proje olarak kurulur
Zzeti Zeka gateway'i, RAG'ı, MCP konektörlerini, ajanları ve gözlemlenebilirliği hazır getirir; Skyloop bunu — on-premise, kapalı devre veya özel bulut — kapsamı ve ölçütü baştan tanımlı bir proje olarak altyapınıza kurar, saat bazlı danışmanlık olarak değil.