Yapay zekâ sektöründe “küçük model”, “lokal AI” ve “daha ucuz inference” ifadeleri giderek daha güçlü pazarlama argümanlarına dönüşüyor. Fakat gerçek bir üretim sunucusunda yapılan kurulum, broşürde küçük görünen bir AI modelinin altyapıda hiç de küçük olmayabileceğini gösteriyor.
SEOİlan altyapısında Strands Decider üzerinde yaptığımız gerçek kurulum incelemesinde tam olarak bununla karşılaştık. Python paketi başarıyla kuruldu, import testi geçti ve modelin çalışma kodu incelendi. Ancak tam modeli üretim sunucusuna yüklemeden önce ortaya çıkan tablo, “küçük ve hızlı AI” söylemini ciddi biçimde sorgulamamıza neden oldu.
Strands Decider ne vaat ediyor?
Strands Decider uzun içerik üretmek için geliştirilmiş klasik bir sohbet modeli değil. Temel amacı AI agent sistemlerinde daha basit kararları büyük ve pahalı modellere göndermeden çözmek.
Bir kullanıcının isteğinin WordPress’e mi, SEO analizine mi, Telegram’a mı, sosyal medya otomasyonuna mı, sunucu işlemlerine mi yoksa genel amaçlı bir LLM’ye mi yönlendirileceği buna örnek verilebilir.
Teoride yaklaşım son derece cazip: Büyük modeli her küçük karar için çalıştırma, daha küçük bir karar modeli kullan ve API maliyetini azalt.
Ancak teori ile gerçek üretim maliyeti aynı şey değil.
Küçük görünen checkpoint bütün model değil
İlk dikkat edilmesi gereken nokta burada başlıyor. Bir model deposunda görülen checkpoint veya adapter dosyasının boyutu, sistemin gerçek çalışma boyutunu göstermeyebilir.
Strands Decider’ın çalışma yapısını incelediğimizde karar katmanının tek başına yeterli olmadığını gördük. Sistem yaklaşık 2 milyar parametre sınıfındaki Qwen tabanlı temel model ağırlıklarına da ihtiyaç duyuyor.
Başka bir ifadeyle geliştirici yalnızca küçük görünen Decider katmanını çalıştırmıyor. Arkada birkaç gigabayt büyüklüğünde temel model, PyTorch çalışma ortamı ve kullanılan donanıma göre ek bağımlılıklar bulunuyor.
Kurulum sırasında yüzlerce megabaytlık bağımlılıklar
Testimiz henüz temel modeli yükleme aşamasına gelmeden önemli bir işaret verdi. Python kurulumu sırasında yalnızca bazı CUDA ve matematik kütüphaneleri yüzlerce megabaytlık indirmeler oluşturdu.
Örneğin kurulum zincirinde yaklaşık 423 MB büyüklüğünde NVIDIA cuBLAS paketiyle karşılaştık. Bunun öncesinde de 500 MB sınıfında başka çalışma zamanı bağımlılıkları indirilmişti.
Bunlar tek başına bir problem değil. Modern AI yazılımları ağır bağımlılıklar kullanabilir. Problem, “küçük model” ifadesinin geliştiricide oluşturabileceği beklenti ile gerçek deployment footprint arasındaki fark.
CPU desteği var diye CPU için ideal sayılmaz
İkinci önemli konu CPU çalıştırma desteği. Strands Decider CPU üzerinde çalıştırılabiliyor. Ancak “çalışıyor” ile “üretimde ekonomik ve hızlı çalışıyor” ifadeleri birbirinden ayrılmalı.
Kurulu paketin kaynak kodunu incelediğimizde CPU yolu açıkça bulunuyordu. Aynı kod, CPU kullanımında yarım hassasiyetli model katmanlarının belirli durumda FP32’ye yükseltildiğini de gösteriyordu.
Bu ayrıntı önemlidir. Diskte birkaç gigabayt yer kaplayan bir modelin RAM tüketiminin de aynı büyüklükte kalacağı varsayılamaz.
Üstelik canlı bir VDS yalnızca AI modelinden oluşmuyor. Aynı makinede MariaDB, Apache veya Nginx, PHP-FPM, Docker, WordPress, agent servisleri, cron görevleri ve başka otomasyonlar da çalışıyor.
16 GB üretim VDS’inde neden frene bastık?
SEOİlan testinin en önemli tarafı laboratuvar ortamında değil, gerçek üretim altyapısında yapılmasıydı. Sunucumuz 16 GB RAM sınıfında ve aynı anda birden fazla canlı web servisini taşıyor.
Strands Decider paketi başarıyla kuruldu. DECIDER_IMPORT=OK sonucu alındı. Ardından model yüklenmeden önce sunucunun RAM durumu kontrol edildi.
İlk kontrolde kullanılabilir bellek yaklaşık 2.5 GB seviyesindeydi. Daha sonraki kontrolde sistem yükünün değişmesiyle yaklaşık 6.1 GB kullanılabilir RAM görüldü. Bu dalgalanma bile canlı üretim ortamında sürekli bellekte tutulacak ek bir AI modelinin neden dikkatli değerlendirilmesi gerektiğini gösteriyor.
Burada modeli zorla çalıştırıp “bakın açıldı” demek kolay olurdu. Ancak bu gerçek bir başarı ölçütü değildir.
Bir üretim sisteminde önemli olan modelin bir kez açılması değil; web sitelerini, veritabanını ve diğer servisleri bozmadan 7 gün 24 saat güvenilir biçimde çalışabilmesidir.
API parasından kaçarken sunucu faturasını büyütmek
Lokal AI tartışmalarındaki en büyük ekonomik hata burada yapılıyor. API çağrısı görünür bir maliyettir. Her kullanımın fiyatını görürsünüz. Lokal modelin maliyeti ise çoğu zaman farklı kalemlere dağıldığı için ücretsizmiş gibi algılanır.
Gerçekte lokal model için daha fazla RAM, daha güçlü CPU veya GPU, NVMe alanı, sunucu kirası, bakım zamanı ve sürekli ayrılmış sistem kaynağı gerekir.
Ayda birkaç dolarlık API maliyetini ortadan kaldırmak için çok daha pahalı GPU sunucusuna geçiliyorsa yapılan şey maliyet azaltmak değil, maliyetin adresini değiştirmektir.
Bu nedenle SEOİlan Pro SEO Analizi gibi gerçek üretim servislerinde yalnızca “lokal model kullanıyor muyuz?” sorusuna değil, her iş için hangi yöntemin daha ekonomik ve güvenilir olduğuna bakmak gerekir.
Strands Decider kötü bir proje mi?
Hayır. Eleştirimizin hedefi projenin temel fikri değil; “küçük AI” kavramının altyapı maliyetini açıklamak için tek başına yetersiz olması.
Strands Decider’ın yaklaşımı yüksek hacimli agent sistemlerinde oldukça mantıklı olabilir. Özellikle halihazırda NVIDIA GPU bulunan bir sunucuda binlerce basit yönlendirme kararını büyük LLM’lere göndermemek ciddi tasarruf sağlayabilir.
Fakat küçük bir işletmenin CPU tabanlı VDS’inde durum aynı değildir. Birkaç düşük maliyetli API çağrısından tasarruf etmek uğruna sürekli gigabaytlarca RAM ayırmak ve daha pahalı donanıma geçmek ekonomik olmayabilir.
Asıl ölçülmesi gereken toplam sahip olma maliyeti
Bir AI çözümünü değerlendirirken yalnızca parametre sayısına bakmak artık yeterli değil. Model ağırlıkları, runtime bağımlılıkları, RAM ve VRAM tüketimi, inference süresi, trafik hacmi, bakım maliyeti ve sunucu fiyatı birlikte değerlendirilmelidir.
Bu hesap yapıldığında bazen ücretli API en ucuz çözümdür. Bazen lokal model kazanır. Yoğun sistemlerde ise hibrit mimari en mantıklı seçenek olabilir.
Bizim kararımız: GPU gelmeden üretime alınmayacak
SEOİlan testinde Strands Decider’ı mevcut 16 GB üretim VDS’inde zorla çalıştırmama kararı aldık. Tam temel modeli indirmeden testi durdurduk.
Bu bir başarısızlık değil; doğru altyapı kararının kendisidir.
Yeterli VRAM’e sahip NVIDIA GPU sunucuya geçildiğinde Decider yeniden değerlendirilecek. O zaman gerçek routing doğruluğu, gecikme süresi, RAM/VRAM tüketimi ve kaç ücretli LLM çağrısını ortadan kaldırdığı ölçülebilecek.
Sonuç olarak AI sektöründe “küçük” kelimesine artık biraz daha şüpheyle yaklaşmak gerekiyor.
Bir model parametre sayısı açısından küçük olabilir. Fakat onu 7/24 çalıştırmak için gereken altyapı küçük olmak zorunda değildir.
İşletmeler açısından doğru soru “Bu modeli kendi sunucuma kurabilir miyim?” değil, “Bu modelin toplam sahip olma maliyeti, yerine geçeceği API çağrılarından gerçekten daha düşük mü?” olmalıdır.
