Hiç Pazar gecesi LLaMA.cpp'yi derlemeye çalışıp da sohbet robotu yerine yanlışlıkla bir ısıtıcı yarattığınızı fark ettiniz mi? Ben yaşadım. Dizüstü bilgisayarımın fanları bir keresinde o kadar hızlı dönmüştü ki, Top Gun için seçmelere katıldıklarını düşünmüştüm. İyi haber: Harika yerel yapay zeka çalıştırmak için LLaMA.cpp ile evlenmek zorunda değilsiniz. Kurulumu daha kolay, GPU dostu ve sinirlerinizi daha az yıpratan keskin, iyi desteklenen LLaMA.cpp alternatifleri var.
Bu kılavuz, en iyi LLaMA.cpp alternatiflerine giden yol haritanızdır; zehirinizi seçin, pardon, platformunuzu seçin. Kimin neyi kullanması gerektiğini, kurulumların gerçekten ne kadar zor olduğunu, tipik donanımda (yani bir NASA laboratuvarı değil) ne tür bir performans göreceğinizi ve araçların günlük ince ayarları (nicemleme, model değiştirme, gömme) tatil ışıklarını dizmeye benzetmek yerine bir anahtarı çevirmeye daha çok benzettiği yerleri ayrıntılarıyla anlatacağım.
Niyet konusunda uyarı: Muhtemelen "LLaMA.cpp alternatifleri" diye arattınız çünkü üç şeyden birini istiyorsunuz: daha basit kurulum, donanımınızda daha iyi hız veya daha iyi bir geliştirici deneyimi. Sizi 40 sekmeli bir tavşan deliğine düşürmeden oraya ulaştıralım.
Hızlı şifre çözücü: LLaMA.cpp yerine aslında ne istiyorsunuz
- Kullanıcı dostu bir arayüze sahip tek tıklamayla yerel yapay zeka istiyorsunuz: LM Studio veya Ollama'yı düşünün.
- Akıllı önbelleğe alma ve kutudan çıkar çıkmaz nicemleme ile uygulamalar için sağlam bir sunucu/API istiyorsunuz: Ollama veya vLLM.
- Bir GPU çiftliğinden veya tek bir güçlü karttan saniyede elde edilebilecek son jetonu bile sıkmak istiyorsunuz: vLLM.
- RAG ve aracılar için Python öncelikli, her şey dahil bir yığın istiyorsunuz: LangChain + Ollama veya vLLM gibi bir çıkarım arka ucu.
- Minimum kurulum sıkıntısı ile tarayıcı tabanlı bir deney istasyonu istiyorsunuz: WebLLM veya Open WebUI (Ollama gibi bir arka uçla eşleştirilmiş).
Evet, daha fazla seçenek var. Hayır, hepsine ihtiyacınız yok. En iyi LLaMA.cpp alternatiflerini ve ne zaman mantıklı olduklarını inceleyelim.
Ollama: "Sadece çalışır" yerel model çalıştırıcısı
LLaMA.cpp 73 eklentili bir İsviçre Çakısı ise, Ollama aslında kullandığınız üç araçtır: bıçak, makas, tirbuşon; tek, temiz bir sapta sarılı.
- Neden bir alternatif: Çok basit model getirme, sizin için işlenen nicemleme, sistemleri oluşturmak için kolay model dosyaları (Modelfiles). Uygulamalarınızın OpenAI benzeri bir uç nokta gibi çağırabilmesi için yerel bir HTTP API'si sunar.
- Kurulum havası: Uygulamayı yükleyin.
ollama run llama3 (veya favori modeliniz). Bitti. 14 adımlı CMake arayışları yok.
- Performans: Önceden oluşturulmuş nicemlemelerle (Q4, Q5, Q8) sağlam CPU ve GPU desteği. Genellikle büyük veri merkezi GPU'larında mutlak en hızlısı değil, ancak dizüstü bilgisayarlar ve masaüstü bilgisayarlar için mükemmel.
- Şunlar için en iyisi: Yerel uygulamalar geliştiren geliştiriciler, hız ve akıl sağlığı isteyen tinker'lar, küçük bir MLOps ayak izi isteyen herkes.
- Güzel ekstralar: Model kitaplığı, basit istem, gömme desteği ve büyüyen bir GUI sarmalayıcıları ekosistemi.
Kimler kullanmamalı? Birden fazla GPU arasında çok sayıda isteği düzenliyorsanız ve yangın hortumu hızında jeton akışı gerekiyorsa, muhtemelen vLLM'yi isteyeceksiniz.
vLLM: GPU'lar için yüksek verimli canavar
LLaMA.cpp neredeyse her yerde çalışabilir. vLLM gerçek bir GPU ister ve onu beslediğiniz için sizi ödüllendirir. Bunu çıkarım için otoyol ekspres şeridi olarak düşünün.
- Neden bir alternatif: PagedAttention ve gelişmiş KV önbellek yönetimi gibi özelliklerle hızlı, ölçeklenebilir çıkarım için özel olarak üretilmiştir. Birçok üretim sınıfı dağıtımın arkasındaki motordur.
- Kurulum havası: Python, CUDA, sürücüler; evet, biraz daha ağır. Ancak çalışır duruma geldiğinde çığlık atar.
- Performans: NVIDIA GPU'larda harika; uzun bağlamlar ve birçok eşzamanlı istekle parlar.
- Şunlar için en iyisi: API'ler, üretim uygulamaları, ağır iş yükleri dağıtan ekipler veya "tps"nin bir aşk dili olduğunu düşünen herkes.
- Güzel ekstralar: OpenAI uyumlu sunucu modu, tensör paralelliği, sürekli toplu işleme, uzun bağlam desteği.
Kesinlikle yalnızca CPU kullanıyorsanız veya sürücü kurulumlarına alerjiniz varsa atlayın. Bu durumda, Ollama veya LM Studio daha samimi gelecektir.
LM Studio: Yerel modeller için kullanıcı dostu masaüstü stüdyosu
Bu, "Güzel bir uygulama penceresi ve bir Çalıştır düğmesi istiyorum" seçeneğidir. LM Studio, model barındırmanın AirBnB'sidir: temiz, rahat ve aslında ışık anahtarını bulabilirsiniz.
- Neden bir alternatif: Tam GUI, yerleşik model pazarı, yerel sohbet ve uygulamalarınız için açabileceğiniz OpenAI uyumlu bir sunucu.
- Kurulum havası: İndirin, açın, bir model seçin, çalıştır'ı tıklayın. Ayrıca yapılandırma dosyaları yerine kaydırıcılar ve grafikler elde edersiniz.
- Performans: Diğer çalıştırıcılara benzer altta yatan teknoloji; modern Mac'lerde (Metal) sorunsuz ve Windows/Linux'ta iyi.
- Şunlar için en iyisi: GUI öncelikli ince ayar yapmayı ve hızlı bir "öğle yemeğinden önce beş model deneme" iş akışını tercih eden yazarlar, analistler, geliştiriciler.
- Güzel ekstralar: İstek şablonları, konuşma geçmişi, belirteç görselleştirmesi ve iyi macOS desteği.
GUI'lerden nefret ediyorsanız ve yalnızca CLI konuşuyorsanız, Ollama veya vLLM daha çok sizin hızınızda olacaktır.
Open WebUI + bir arka uç (Ollama/vLLM): Modüler kokpit
Open WebUI şık gösterge panosudur; Ollama veya vLLM motordur. Birlikte, roller, belgeler ve uzantılarla çok modelli bir sohbet laboratuvarı istiyorsanız harika bir LLaMA.cpp alternatifidir.
- Neden bir alternatif: Çok kullanıcılı, gösterişli bir ön uç elde ederken arka ucu esnek tutarsınız.
- Kurulum havası: Docker veya tek satırlık kurulumlar. Model sunucunuza yönlendirin.
- Performans: Arka uca bağlıdır; hız için vLLM ile, basitlik için Ollama ile eşleştirin.
- Şunlar için en iyisi: Küçük ekipler, laboratuvarlar veya istemleri test etmek, modelleri karşılaştırmak ve sohbetleri paylaşmak için merkezi bir yer isteyen herkes.
Text Generation WebUI: Tinker'ın araç seti
Evet, hala ortalıkta ve hala düğmeleri ve grafikleri seven güçlü tinker'lar tarafından seviliyor.
- Neden bir alternatif: Tonlarca uzantı, nicemleme kontrolleri ve model takasları.
- Kurulum havası: En basiti değil, ancak çalıştıktan sonra inanılmaz derecede yapılandırılabilir.
- Şunlar için en iyisi: Bir laboratuvar tezgahı hissi, birçok model formatı ve eklenti gücü isteyen kişiler.
WebLLM: Modeller... tarayıcınızda
Hayır, cidden: LLM'leri WebGPU ile doğrudan Chrome'da çalıştırın. Sunucu yığınınızın yerini alacak mı? Muhtemelen değil. Demolar, eğitim ve gizlilik öncelikli deneyler için büyülü mü? Kesinlikle.
- Neden bir alternatif: Sıfır arka uç, korumalı alan kullanımı ve deneyleri paylaşmak için harika.
- Kurulum havası: Bir web sayfası açın. Tamam, bazen bir model dosyası yükleyin.
- Şunlar için en iyisi: Hafif sohbet, sınıf demoları, gizliliğe duyarlı senaryolar ve "vay canına, burada çalışıyor mu?" anları.
MLC/MLC-LLM: Çapraz platform, donanım hızlandırmalı derlemeler
"Bir kez derle, birçok cihazda hızlı çalıştır" vaadini seviyorsanız, MLC ekosistemi sizin arkadaşınızdır.
- Neden bir alternatif: Tek bir yığınla Metal'i (Apple), Vulkan'ı, CUDA'yı hedefleme, ayrıca nicemleme ve dağıtım yardımcıları.
- Kurulum havası: Geliştirici odaklı. Satın aldıktan sonra, taşınabilirlik ödüldür.
- Şunlar için en iyisi: Tutarlı performansın önemli olduğu Mac, Windows ve mobil cihazlarda uygulama gönderen ekipler.
llama.cpp - dünya: Aslında farklı olan ne?
Şunu insan diline çevirelim:
- Kurulum sürtünmesi: LLaMA.cpp, ikili dosyalar aracılığıyla çok basit olabilir, ancak özel derlemelere veya GPU ayarlamasına ihtiyacınız olduğunda sürtünme artar. Ollama ve LM Studio "kur ve unut" konusunda kazanır.
- API ve uygulamalar: LLaMA.cpp'nin sunucuları ve bağlamaları vardır, ancak Ollama/vLLM, daha temiz HTTP, toplu işleme ve OpenAI uyumlu rotalarla uygulama arka uçları için özel olarak üretilmiştir.
- GPU hızı: vLLM büyük GPU'ları kahvaltıda yer. LLaMA.cpp neredeyse her şeyde çalışır, ancak en yüksek verim vLLM'nin parti numarasıdır.
- GUI cilası: LM Studio ve Open WebUI modern, keşfedilebilir ve keyifli bir şekilde sıkıcı (iyi türden) hissettiriyor.
- Çok modelli koşuşturma: Ollama, modelleri ve nicemlemeleri değiştirmeyi acısız hale getirir; Text Generation WebUI, uzmanlar için ince ayarlı kontrol sunar.
Donanım ve kullanım durumuna göre alternatifinizi seçme
İşte aslında ihtiyacınız olan normal insan akış şeması:
- Yalnızca bir CPU dizüstü bilgisayar mı? Ollama veya LM Studio'yu seçin. Daha küçük nicemlenmiş modeller (Q4/Q5) kullanın. 3-8 belirteç/sn hedefleyin ve sakinliğin tadını çıkarın.
- Apple Silicon Mac mi? Metal hızlandırmalı Ollama veya LM Studio. Llama 3, Phi-3 veya Mistral'i karıştırın. Hızlı yanıtlar ve düşük fan draması bekleyin.
- Bir tüketici NVIDIA GPU'su mu (örn. 3060–4090)? Hız ve bir API istiyorsanız vLLM'yi deneyin; basit yerel iş akışları istiyorsanız Ollama'yı deneyin.
- Çoklu GPU veya sunucu mu? vLLM. Toplu işleme, uzun bağlam ve daha mutlu verim grafikleri elde edersiniz.
- Birden fazla kişi için bir ofis kullanıcı arayüzüne mi ihtiyacınız var? Open WebUI + Ollama veya vLLM.
- Bol miktarda düğmeyle maksimum tinker gücü mü istiyorsunuz? Text Generation WebUI.
- Tarayıcı içi gizliliğe veya demolarına mı ihtiyacınız var? WebLLM.
Pazarlama parıltısı olmadan performans beklentileri
- Küçük modeller (3–8B): CPU'larda bile, nicemlenmiş modeller rahatça sohbet edebilir. M serisi Mac'lerde veya orta sınıf GPU'larda anında hissedilirler.
- Orta modeller (13–34B): GPU VRAM'e (12–24GB+) ihtiyacınız olacak. 24 GB VRAM'de, 4/5 bit nicemlemedeki 13B–14B modelleri sohbet ve kod için uçar.
- Büyük modeller (70B+): Bu, rahatlık için küme veya A100/H100 bölgesidir. Bunları yerel olarak sıkıştırırsanız, ödünler bekleyin: nicemleme, daha yavaş çıktı veya akıllı sunucu hileleri.
Geliştirici ergonomisi: Model dosyaları, bağdaştırıcılar ve önbellek büyüsü
- Ollama'nın Model dosyaları, LLM'ler için Dockerfile'lar gibidir. Bir temel model tanımlarsınız, sistem istemleri eklersiniz, belki bir bağdaştırıcı eklersiniz ve bum; taşınabilir tarif.
- vLLM'nin OpenAI uyumlu sunucusu, uygulama kodunuzun zar zor değiştiği anlamına gelir. Ayrıca, uzun belgelerin belleğinizi bir stres topuna dönüştürmemesi için KV önbelleğini bir profesyonel gibi işler.
- Text Generation WebUI, LoRA, quant ve örnekleme stratejileri için uygulamalı kontroller sağlar. İstek deneyleri ve doğrudan karşılaştırmalar için harika.
RAG ve aracılar: Tabanınızı seçin, oyuncaklarınızı yerleştirin
Alma ile zenginleştirilmiş oluşturma (RAG), çoğunuzun şu anda yaşadığı yerdir: verileri buluta göndermeden belgelerinizden, biletlerinizden veya PDF'lerinizden soruları yanıtlamak.
- Arka uç: Hıza ve eşzamanlılığa ihtiyacınız varsa vLLM'yi veya yerel geliştirme ve küçük ekip dağıtımları için Ollama'yı kullanın.
- Çerçeve: Tesisatı (belge öbekleme, gömme, önbelleğe alma) işlemek için LangChain veya LlamaIndex.
- Gömme: Birçok çalıştırıcı artık yerel gömme uç noktaları sunuyor. Değilse, ayrı bir yerel gömme modeli cıvatalayın.
- Koruyucu raylar: Bunun gerçek müşteri verilerine dokunması durumunda PII maskeleme veya denetleme araçlarını düşünün.
Maliyet, gizlilik ve kontrol: alternatifler neden önemli
- Maliyet: LLaMA.cpp açık kaynaklıdır ve alternatiflerin çoğu da öyledir. Faturanız donanım ve elektriktir. vLLM, GPU'lardan daha fazla sıkmaya yardımcı olur; Ollama, bulut API çalkantısından kaçınır.
- Gizlilik: Yerel çalıştırıcılar verilerinizi yerel tutar. Bu, yasal, tıbbi veya sadece "notlarımın eğitim setlerinde olmasını istemiyorum" havaları için çok önemlidir.
- Kontrol: Model dosyaları, bağdaştırıcılar ve açık ağırlıklarla kara bir kutuya bağlı değilsiniz. Gerektiğinde modelleri değiştirin: bugün Mistral, yarın Llama 3, minik ve akıllı istediğinizde Phi-3.
Artıları ve eksileri özeti (kısa, dürüst, gereksiz yok)
- Artıları: Aptalca basit, iyi varsayılanlar, dizüstü bilgisayarlar için harika, temiz API.
- Eksileri: Ölçekte kesinlikle en hızlı değil; laboratuvar araçlarından daha az ezoterik düğme.
- Artıları: En üst düzey GPU verimi, toplu işleme, uzun bağlam, üretime uygun.
- Eksileri: Daha ağır kurulum, gerçekten parlamak için GPU gerekli.
- Artıları: Gösterişli GUI, kolay model keşfi, hızlı sunucu geçişi.
- Eksileri: Saf CLI çözümlerinden daha az komut dosyası yazılabilir.
- Open WebUI (+ Ollama/vLLM)
- Artıları: Ekip dostu arayüz, eklenti ekosistemi, modelden bağımsız.
- Eksileri: Korumak için iki hareketli parça; performans arka uca bağlı.
- Artıları: Maksimum kontrol, geniş uzantı topluluğu.
- Eksileri: Daha dik öğrenme eğrisi; bir laboratuvar tezgahı gibi hissedilebilir.
- Artıları: Sıfır arka uç, varsayılan olarak özel demolar.
- Eksileri: Tarayıcı/cihaz kaynaklarıyla sınırlı; ağır kaldırma için değil.
- Artıları: Çapraz platform hızlandırma, birçok hedefe dağıtılabilir.
- Eksileri: Daha fazla geliştirme çabası; ürünler geliştiren ekipler için en iyisi.
Bunu fazla düşünmemeniz için gerçek dünyadan mini senaryolar
- Bir MacBook Air'de yerel bir not asistanı geliştiren yalnız bir geliştirici: Ollama'yı yükleyin, Q4'te 7B bir model çalıştırın, bir gömme uç noktası ekleyin ve basit bir RAG zincirine bağlayın. Kahveniz soğumadan işiniz bitecek.
- 4090 kutusu ve bir Slack botu olan bir startup: Hız için vLLM ile modellere hizmet verin. Geliştirici olmayanların istemleri test edebilmesi için Open WebUI'yi dahili olarak kullanın. Uygulama kodunuzu temiz tutmak için OpenAI uyumlu bir rota oluşturun.
- Bir makale için 10 modeli karşılaştıran bir araştırmacı: Hızlı dönüşler ve günlükler için LM Studio veya ayrıntılı örnekleme kontrolleri ve görselleştirmeler istiyorsanız Text Generation WebUI.
- Öğrenci verileri odadan çıkmadan AI'yı gösteren bir öğretmen: Küçük bir modelle tarayıcıda WebLLM. Sihirli numara kilidi açıldı.
Belirtmekte fayda var: Sider.AI burada AI yardımcı pilotunuz olabilir
Uyarı: Seçeneklerle hokkabazlık yapıyorsanız, Sider.AI istemleri ve iş akışlarını hızlı bir şekilde test etmenize ve ardından hayat hikayenizi yeniden yazmadan arka uçları değiştirmenize yardımcı olabilir. Bunu bir akıl sağlığı kontrol katmanı olarak düşünün: yerel bir Ollama modeliyle prototip oluşturun, bir vLLM uç noktasıyla karşılaştırın ve istemlerinizi ve belgelerinizi tek bir yerde tutun. GPU'nuzu sizin için seçmez, ancak deneylerinizin "son-son-v3" adlı 19 farklı klasöre dökülmesini engelleyebilir. Kurulum anlık görüntüleri: "Merhaba, model"e ne kadar hızlı ulaşabilirsiniz?
ollama run mistral (veya llama3, phi3, vb.)
- OpenAI benzeri bir istemciyle vurun
- HF model yolunuz ve GPU yapılandırmalarınızla sunucuyu başlatın
- Uygulamanızdan OpenAI uyumlu API rotasını çağırın
- Kitaplıktan bir model seçin
- Çalıştır'ı tıklayın; isteğe bağlı olarak yerel sunucuyu değiştirin
- Arka uç olarak Ollama veya vLLM'ye yönlendirin
- Ekip arkadaşlarınızı davet edin ve istemleri karşılaştırmaya başlayın
Hayır, sürücü baş ağrılarını atlamadım. NVIDIA ile Windows'daysanız, sürücüleri ve CUDA'yı güncelleyin. macOS'daysanız, Metal ağır işleri halledecektir. Linux'ta, ne yaptığınızı zaten biliyorsunuz veya forumlardan hoşlanıyorsunuz.
Çalıştırıcınızla doğru model ailelerini seçme
- Llama 3 ve arkadaşları: Harika genel sohbet ve akıl yürütme; çalıştırıcılar ve quant formatları arasında güçlü destek.
- Mistral/Mixtral: Hız ve yetenek arasında mükemmel denge; Ollama ve vLLM ülkesinde popüler.
- Phi-3: Minik ama güçlü. CPU/Mac kurulumları ve hızlı yanıtlar için mükemmel.
- Qwen, Gemma, DeepSeek çeşitleri: Kod ve olgusal S&A için test etmeye değer; çoğu iyi talimat ayarlı ağırlıklar gönderir.
Profesyonel ipucu: Kullanım durumu başına iki veya üç model deneyin. Kodlama için "kod" ayarlı bir varyant. Soru-Cevap için "talimat" ayarlı bir varyant. Yaratıcılık için, daha küçük modeller daha hızlı yinelemeyle sizi şaşırtabilir.
Arıza olmadan sorun giderme
- CPU'da yavaş jetonlar mı? Daha küçük bir quanta (Q4) veya daha küçük bir modele (7B) geçin. Yalnızca ihtiyacınız varsa bağlamı artırın.
- GPU'da VRAM hataları mı? Hassasiyeti (4 bit) azaltın, mümkün olduğunda uzun bağlam yerine ip ölçeklendirme kullanın veya daha küçük bir temel model deneyin.
- Dalgalı akışlar mı? Toplu işleme veya KV önbellek boyutlarını kontrol edin; vLLM burada parlıyor. Ollama'da eşzamanlı istekleri düşük tutun.
- Garip çıktılar mı? Sistem istemlerini sıfırlayın, başka bir talimat ayarlı model deneyin veya belirteçleme ayarlarını doğrulayın.
Sonuç: LLaMA.cpp yerine ne seçmeli?
- En sorunsuz yerel deneyimi ve minimum kurulumla temiz bir API istiyorsanız Ollama'yı seçin.
- Hız, ölçek ve üretime hazır bir sunucu istiyorsanız vLLM'yi seçin.
- Gösterişli bir masaüstü uygulaması deneyimi ve hızlı model keşfi istiyorsanız LM Studio'yu seçin.
- İşbirliği yapıyorsanız veya çok sayıda istem karşılaştırması yapıyorsanız Open WebUI'yi cıvatalayın.
- Güç kullanıcısı kontrolleri ve derin deneyler istiyorsanız Text Generation WebUI'yi kullanın.
- Tarayıcı öncelikli demolar ve gizlilik demoları için WebLLM'yi getirin.
Sadece bir modele akşam yemeği fikirleri sormak için gece yarısı çekirdekleri derleyen kişi olmanıza gerek yok. LLaMA.cpp harika; ama bu alternatifler de öyle. Zamanınıza, donanımınıza ve akıl sağlığınıza saygı duyanı seçin. Sonra önemli şeylere geri dönün. Modelinize, açıkça "Son e-postama göre..." demek istediğinizde "Saygılarımla" yazmayı bırakmasını öğretmek gibi...
SSS
S1:Yeni başlayanlar için en iyi LLaMA.cpp alternatifi nedir?
Ollama veya LM Studio ile başlayın. Her ikisi de yerel modelleri basit, hızlı ve kullanıcı dostu hale getirir, minimum kurulum ve güçlü model kitaplıkları ile. Yerel AI'nın gücünü kaybetmeden kolay bir başlangıç yapacaksınız.
S2:vLLM, GPU iş yükleri için LLaMA.cpp'den daha mı hızlı?
Genellikle evet. vLLM, toplu işleme ve gelişmiş KV önbellek hileleriyle yüksek verimli GPU çıkarımı için oluşturulmuştur. Amacınız ölçekte hız ise, vLLM güçlü bir LLaMA.cpp alternatifidir.
S3: RAG ve yerel arama için LLaMA.cpp alternatiflerini kullanabilir miyim?
Kesinlikle. Gömme ve geri alma için Ollama veya vLLM'yi LangChain veya LlamaIndex ile eşleştirin. Belgelerinizi buluta göndermeden özel, yerel RAG elde edersiniz.
S4: Apple Silicon'da macOS için hangi alternatif en iyisi?
Ollama ve LM Studio, Metal hızlandırması ile Apple Silicon'da harika çalışır. Mistral, Llama 3 ve Phi-3 gibi küçük ila orta ölçekli modeller hızlıdır ve fanlarınızın sessiz kalmasını sağlar.
S5: Bu alternatiflerle iyi sonuçlar almak için bir GPU'ya ihtiyacım var mı?
Bir GPU yardımcı olur, ancak zorunlu değildir. Kuantize edilmiş 7B–8B modelleriyle, CPU üzerindeki Ollama veya LM Studio hala iyi sohbet performansı sağlayabilir. Ağır iş yükleri veya daha büyük modeller için, GPU'lu vLLM parlar.