શું સુર્યવારે રાત્રે LLaMA.cpp કમ્પાઇલ કરવાનો પ્રયાસ કર્યો અને ધ્યાન પૂરાવ્યું કે તમે એક ચેટબોટ નહીં પણ સ્પેસ હીટર બનાવી મૂક્યો છો? એવું બહુએ કર્યું છે. મારા લેપટોપના ફેન્સ એવી ઝડપે ફર્યાં કે મને લાગ્યું કે તેઓ Top Gun માટે ઓડિશન આપી રહ્યાં છે. સારા સમાચાર એ છે કે, ઉત્તમ સ્થાનિક AI ચલાવવા માટે તમારે LLaMA.cpp સાથે જ રહેવાનું નથી. એવા ચતુર અને સારો ટેકો આપતા LLaMA.cpp વિકલ્પો છે જે સેટઅપમાં સરળ છે, GPU માટે અનુકૂલિત છે અને તમારા મનને શાંત રાખે છે.
આ માર્ગદર્શિકા તમારા માટે શ્રેષ્ઠ LLaMA.cpp વિકલ્પોની એક માર્ગદર્શિકા છે જ્યાં તમે તમારા ઉપયોગ માટે શ્રેષ્ઠ પ્લેટફોર્મ પસંદ કરી શકો. હું સમજાવીશ કે કોણ કયા વિકલ્પનો ઉપયોગ કરવો, ઇન્સ્ટોલેશન કેટલું મુશ્કેલ છે, સામાન્ય હાર્ડવેર પર (ભલભલાઈ NASA લેબ નથી) કઈ પ્રદર્શન મળશે, અને કયા ટૂલ્સ દૈનિક કાર્યજાળમાં - જેમ કે ક્વાન્ટાઈઝેશન, મોડેલ બદલવા, એમ્બેડિંગ્સ - ને વધુ સરળ બનાવે છે.
ઉદ્દેશની જાણકારી: તમે “LLaMA.cpp વિકલ્પો” શોધ્યા હશે કારણ કે તમે કોઈ ત્રણ ઈચ્છાઓમાંથી એક માટે શોધતા હોવ—સરળ સેટઅપ, તમારી હાર્ડવેર માટે વધુ ઝડપ, અથવા વિકસકો માટે સારો અનુભવ. ચાલો 40-ટેબ પર કૂદ્યા વિના તમારું કામ સરળ બનાવીએ.
જલદીના જવાબ: તમે LLaMA.cpp ની જગ્યાએ શું શોધો છો
- તમે એ-ક્લિક સ્થાનિક AI UI સાથે ઈચ્છો છો: LM Studio અથવા Ollama ને વિચારો.
- તમને એપ્લિકેશન્સ માટે મજબૂત સર્વર/API જોઈએ, જેમાં સ્માર્ટ કેશિંગ અને ક્વોન્ટાઈઝેશન ಮನપસંદ હોય: Ollama અથવા vLLM.
- GPU ફાર્મ અથવા એક જ મજબૂત કાર્ડ પરથી દરેક ટોકન પ્રતિ સેકન્ડ ની ઝડપ કાઢવી: vLLM.
- Python-પ્રથમ, બેટરી-સહીત સ્ટેક RAG અને એજેન્ટ્સ માટે: LangChain + સુધીમાં Ollama અથવા vLLM.
- બ્રાઉઝરના આધારે પ્રાયોગિક સ્થળ સંયોજન સાથે ઓછા ઇન્સ્ટોલ પેઇન માટે: WebLLM અથવા Open WebUI (Ollama જેવું બેકએન્ડ સાથે).
હા, વધુ વિકલ્પો છે. નહિં, તમારે બધા લેવાના નથી. ચાલો શ્રેષ્ઠ LLaMA.cpp વિકલ્પો ને અને ક્યારે યોગ્ય હોય તે જોઈયે.
Ollama: "એકદમ ચાલે" એવી સ્થાનિક મોડેલ રનર
જો LLaMA.cpp 73 સાધનો સાથે સ્વિસ આર્મી ચાકૂ છે, તો Ollama તે ત્રણ સાધનો છે જે તમે વાસ્તવિક રીતે વાપરો છો—ચાકૂ, કાકી, કોર્કસ્ક્રૂ—એક સરળ અને સ્વચ્છ હેન્ડલમાં.
- શા માટે આ વિકલ્પ છે: ખૂબ સરળ મોડેલ ધરાવવાની રીત, ક્વોન્ટાઈઝેશન તમારું કામ કરે છે, સરળ મોડેલ ફાઇલો (Modelfiles)થી સિસ્ટમ બનાવો. તે સ્થાનિક HTTP API પહોંચી કરી આપે જે તમારી એપ્લિકેશન્સને OpenAI જેવું એન્ડપોઇંટ તરીકે કૉલ કરવા દે છે.
- સેટઅપ માહોલ: એપ્લિકેશન ઇન્સ્ટોલ કરો.
ollama run llama3 (અથવા તમારી પસંદના મોડેલ). પૂરું. કોઈ 14-ધપકિયા CMake મિશન નહીં.
- કાર્યક્ષમતા: સોલિડ CPU અને GPU આધાર સાથે પૂર્વનિર્મિત ક્વોન્ટાઈઝેશન (Q4, Q5, Q8). મોટા ડેટાસેન્ટર GPUs પર સૌથી ઝડપી નથી કેમકે, પરંતુ લેપટોપ અને ડેસ્કટોપ માટે શ્રેષ્ઠ.
- શ્રેષ્ઠ માટે: સ્થાનિક એપ્લિકેશન્સ માટે વિકાસકર્તાઓ, જ którzy ઝડપ અને શાંતિ બંને જોઈએ, કે જેઓ ઓછી MLOps અસર સાથે વ્યવહાર કરવા માંગે.
- સુસંસ્કાર વિશેષતા: મોડેલ લાઇબ્રેરી, સરળ પ્રોમ્પ્ટિંગ, એમ્બેડિંગ્સ સમર્થન, અને GUI રૅપરનો વધતો પરિસર.
કોણ ઉપયોગ ન કરે? જો તમે બહુ GPU પર ઘણી વિનંતીઓ વ્યવસ્થિત કરવા માગતા હો અને ટોકન સ્ટ્રીમિંગ пожарઝાળ ઝડપે જોઈએ, તો તમે vLLM પસંદ કરશો.
vLLM: GPUs માટે ઉચ્ચ-પ્રવાહશીલ પશુ
LLaMA.cpp લગભગ कहींપણ ચાલે છે. vLLMને સાચી GPU જોઈએ અને તે તમને તેના માટે રિવોર્ડ આપશે. તેInference માટે હાઇવે એક્સપ્રેસ લેન છે.
- શા માટે વિકલ્પ છે: ઝડપી, સ્કેલેબલInference માટે નિર્મિત, જેમ કે PagedAttention અને અદ્યતન KV કેશ વ્યવસ્થાપન વિશેષતાઓ સાથે. તે ઘણા પ્રોડક્શન ગ્રેડ ઉપયોગોમાં એન્જિન છે.
- સેટઅપ માહોલ: Python, CUDA, ડ્રાઇવર્સ—હા, થોડી નિડર. પણ એકવાર ચાલી જાય પછી તે ગર્જે છે.
- કાર્યક્ષમતા: NVIDIA GPUs પર શાનદાર; લાંબા સંદર્ભ અને ઘણી સાથે વિનંતીઓ સાથે ઉજસ્વી.
- શ્રેષ્ઠ માટે: API, પ્રોડક્શન એપ્સ, ભારે કામ માટે ટિમો, અથવા કે જેઓ 'tps' પ્રેમની ભાષા માનતા હોય.
- સુસંસ્કાર વિશેષતા: OpenAI-સમાન સર્વર મોડ, ટેંસર પેરલલિઝમ, સતત બેચિંગ, લાંબા સંદર્ભ સમર્થન.
CPU-માત્ર વપરાશકર્તાઓ માટે અથવા ડ્રાઇવર ઇન્સ્ટોલ્સથી allergy હોય તો ટાળવું. તે દ્રશ્યમાં Ollama અથવા LM Studio વધુ મિત્રતાપૂર્વક લાગશે.
LM Studio: સ્થાનિક મોડેલો માટે મૈત્રીપૂર્ણ ડેસ્કટોપ સ્ટુડિયો
આ ‘મને એક સરસ એપ વિન્ડો અને રન બટન જોઈએ’ વિકલ્પ છે. LM Studio મોડેલ હોસ્ટિંગનું AirBnB છે: સફાઈ, આરામદાયક, અને તમે વાસ્તવમાં લાઈટ સ્વીચ શોધી શકો.
- શા માટે વિકલ્પ: સંપૂર્ણ GUI, બિલ્ટ-ઇન મોડેલ માર્કેટપ્લેસ, સ્થાનિક ચેટ, અને તમારા એપ્લિકેશન્સ માટે ટૉગલ કરી શકાય તેવો OpenAI-સમાન સર્વર.
- સેટઅપ માહોલ: ડાઉનલોડ કરો, ખોલો, મોડેલ પસંદ કરો અને ક્લિક કરો. તમે કન્ફિગરેશન ફાઇલો કરતાં સ્લાઇડર અને ચાર્ટ્સ પણ મેળવો છો.
- કાર્યક્ષમતા: અન્ય રનર્સની ટેક્નોલોજી સમાન; આધુનિક Macs (Metal) પર સુમેળદાયક અને Windows/Linux પર સારુ.
- શ્રેષ્ઠ માટે: લેખક, વિશ્લેષક, વિકાસકર્તાઓ જે GUI-પ્રથમ નિયમન અને ‘લંડન પહેલાં પાંચ મોડેલ અજમાવવું’ કાર્યપ્રવાહ પસંદ કરે.
- સુસંસ્કાર વિશેષતા: પ્રોમ્પ્ટ ટેમ્પલેટ્સ, વાતચીત ઇતિહાસ, ટોકન વિઝ્યુઅલાઇઝેશન, અને સારી macOS આધાર.
જો તમને GUIs આ બદલાઈ ન આવે અને CLI જ બોલતા હોવ તો Ollama અથવા vLLM વધુ તમારી ગતિ લાગશે.
Open WebUI + બેકએન્ડ (Ollama/vLLM): મોડીયૂલર કોકપિટ
Open WebUI હળવી ડેશબોર્ડ છે; Ollama અથવા vLLM એ એન્જિન. એક સાથે, આ શ્રેષ્ઠ LLaMA.cpp વિકલ્પ છે જો તમે બહુમોદેલ ચેટ લેબ સાથે ભૂમિકા, દસ્તાવેજો અને વિસ્તાર પસંદ કરો છો.
- શા માટે વિકલ્પ: તમે બેકએન્ડ લવચીક રાખો છો જ્યારે એક તીખી બહુમુલ્યુક વપરાશકર્તા ફ્રન્ટએન્ડ મળે છે.
- સેટઅપ માહોલ: Docker અથવા એકલાઈન ઇન્સ્ટોલ. તમારા મોડેલ સર્વર પર પોઈંટ કરો.
- કાર્યક્ષમતા: બેકએન્ડ પર આધારિત—ઝડપી માટે vLLM સાથે જોડાવ, સરળતા માટે Ollama સાથે.
- શ્રેષ્ઠ માટે: નાની ટીમો, લેબ્સ, અથવા જેઓ પ્રોમ્પ્ટ ટેસ્ટ કરવા, મોડેલો સરખાવવામાં અને ચેટ શેર કરવા માગે.
ટેક્સ્ટ જનરેશન WebUI: સંશોધકનું ટૂલકિટ
હા, તે હજુ અસપાસ છે—અને પાવર તinkerર્સએ ખૂબ પસંદ કર્યું છે જેઓ આગળ વધવા કંટ્રોલ અને ગ્રાફ પસંદ કરે છે.
- શા માટે વિકલ્પ: અનેક વિસ્તારો, ક્વોન્ટાઈઝેશન નિયંત્રણો, અને મોડેલ સ્વેપિંગ કારગિરી.
- સેટઅપ માહોલ: સરળ નથી, પરંતુ ચલાવ્યા પછી અત્યંત અનુકૂળ.
- શ્રેષ્ઠ માટે: જેઓ લેબ બेंચ અનુભવ, ઘણા મોડેલ ફોર્મેટ્સ અને પ્લગઇન શક્તિ માંગે.
WebLLM: તમારા બ્રાઉઝરમાં મોડેલો
સાચું, સીધા Chrome માં LLM ચલાવો WebGPU સાથે. શું તે તમારા સર્વર સ્ટેકને બદલે? કદાચ નહીં. ડેમોઝ, શિક્ષણ અને પ્રાઇવસી-પ્રથમ પરીક્ષણો માટે તે જાદુઈ છે.
- શા માટે વિકલ્પ: ઝીરો બેકએન્ડ, સન્ડબૉક્સ્ડ વપરાશ માટે અને પરીક્ષણો શેર કરવા માટે સરસ.
- સેટઅપ માહોલ: વેબ પેજ ખોલો. ક્યારેક મોડેલ ફાઇલ લોડ કરો.
- શ્રેષ્ઠ માટે: હલકી ચેટ, કલાસરૂમ ડેમોઝ, ખાનગી સંવેદનશીલ પરિસ્થિતિઓ, અને “વાહ, અહીં ચાલે છે?” ક્ષણો.
MLC/MLC-LLM:/platform-અનુકૂળ, હાર્ડવેર-ઝડપી બિલ્ડ્સ
જો તમે “એકવાર કંપાઇલ કરો, બહુ ડિવાઇસ પર ઝડપી ચાલાવે”નું વચન પસંદ કરો છો તો MLC ઇકોઝિસ્ટમ તમારું મિત્ર છે.
- શા માટે વિકલ્પ: મેટલ (એપલ), વુલ્કન, CUDA ટાર્ગેટ માટે એક સ્ટેક, સાથે ક્વોન્ટાઈઝેશન અને ડિપ્લોયમેન્ટ સહાયક.
- સેટઅપ માહોલ: વિકાસકર્તા મૈત્રીપૂર્ણ. તમે એકવાર અપનાવો, પોર્ટેબિલિટી એ ઇનામ છે.
- શ્રેષ્ઠ માટે: ટીમો જે Mac, વિન્ડોઝ અને મોબાઇલ પર એપ્સ મોકલે છે જ્યાં સાતત્યવાળું પ્રદર્શન મહત્વપૂર્ણ છે.
llama.cpp vs. દુનિયા: શું વાસ્તવમાં અલગ છે?
ચાલો માનવ માટે અનુવાદ કરીએ:
- સેટઅપ મુશ્કેલી: LLaMA.cpp બાયનરીસ મારફત ખૂબ સરળ હોઈ શકે છે, પરંતુ કસ્ટમ બિલ્ડ અથવા GPU ટ્યુનિંગ સાથે મુશ્કેલી વઘે છે. Ollama અને LM Studio 'ઇન્સ્ટોલ કરો અને ભૂલી જાઓ' પર વિજેતા છે.
- API અને એપ્લિકેશન્સ: LLaMA.cpp પાસે સર્વર્સ અને બાંધકામ છે, પરંતુ Ollama/vLLM એપ બેકએન્ડ માટે બનાવાયેલા છે જેમાં વધુ સાફ HTTP, બેચિંગ અને OpenAI-સમાન માર્ગો છે.
- GPU ઝડપ: vLLM મોટાં GPUs માટે શ્રેષ્ઠ. LLaMA.cpp લગભગ બધાં ઉપકરણ પર ચાલે છે, પરંતુ સૌથી વધુ થ્રુપુટ vLLM નું વિશેષતા છે.
- GUI બ્રિલિયન્સ: LM Studio અને Open WebUI આધુનિક, શોધી શકાતી અને આનંદદાયક છે (સારો પ્રકાર).
- બહુમોડેલ હસ્તકલા: Ollama મોડેલ સ્વેપિંગ અને ક્વોન્ટાઈઝેશન સરળ બનાવે છે; Text Generation WebUI કઠોર નિયંત્રણ પ્રદાન કરે છે.
તમારી હાર્ડવેર અને ઉપયોગ અનુસાર વિકલ્પ પસંદ કરવો
અહીં સામાન્ય વપરાશકર્તાઓ માટે પ્રવાહચિત્ર છે:
- માત્ર CPU લેપટોપ? Ollama કે LM Studio નાં ઉપયોગ કરો. નાની ક્વોન્ટાઈઝ્ડ મોડેલ્સ (Q4/Q5) લો. 3-8 ટોકન/સેકન્ડ માટે આશા રાખો અને શાંતિ માણો.
- એપલ સિલિકોન મેક? Ollama અથવા LM Studio Metal સટંધ સાથે. Llama 3, Phi-3, અથવા Mistral સાથે મિક્સ કરો. ઝડપી જવાબ અને ઓછા ફેનનો નારાજગી આપવાનો અંદાજ.
- એક NVIDIA GPU (જેમ કે 3060-4090)? જો ઝડપ અને API માંગો છો તો vLLM અજમાવો; સરળ સ્થાનિક કાર્યપ્રવાહ માટે Ollama.
- મલ્ટિ-GPU કે સર્વર? vLLM. તમને બેચિંગ, લાંબા સંદર્ભ અને વધુ ખુશ થ્રુપુટ ગ્રાફ્સ મળશે.
- ઘણા લોકો માટે ઓફિસ UI જોઈએ? Open WebUI + Ollama અથવા vLLM.
- સર્વોચ્ચ તપાસ શક્તિ અને અનેક નોબ્સ? Text Generation WebUI.
- બ્રાઉઝરમાં પ્રાઇવસી અથવા ડેમો? WebLLM.
માર્કેટિંગ ફ્લોસ વિના પ્રદર્શનની અપેક્ષા
- નાના મોડેલો (3-8B): CPU પર પણ ક્વોન્ટાઈઝ્ડ મોડેલો આરામથી વાત કરે છે. M-શ્રેણી Macs કે મધ્યમ શરણી GPUs પર તે તરત લાગે છે.
- મધ્યમ મોડેલો (13-34B): GPU VRAM (12-24GB+) જોઈએ. 24GB VRAM પર 13B-14B મોડેલ Q4/Q5-bit ક્વોન્ટાઈઝિંગ સાથે ચેટ અને કોડ માટે ઝડપથી ચાલે.
- મોટા મોડેલો (70B+): આ ક્લસ્ટર અથવા A100/H100 ટેરિટોરી છે સુખદ માટે. જો સ્થાનિક રીતે દબાવશો તો વ્યાપકતા: ક્વોન્ટાઈઝેશન, ધીમી આઉટપુટ, કે ચતુર સર્વર તકનીકો અપેક્ષિત.
વિકાસકર્તા વ્યવસ્થાપન: Modelfiles, એડપ્ટર્સ અને કેશ મેજિક
- Ollama ના Modelfiles LLM માટે Dockerfiles જેવી છે. તમે બેઝ મોડેલ પરિભાષિત કરો, સિસ્ટમ પ્રોમ્પ્ટ્સ ઉમેરો, કદાચ એડપ્ટર, અને પોર્ટેબલ રેસીપી તૈયાર.
- vLLM ના OpenAI-સમાન સર્વરથી તમારી એપ્લિકેશન کود બહુ જ ઓછું બદલાય. તે KV કેશ વ્યવહાર પણ પ્રભુત્વથી કરે જેથી લાંબા દસ્તાવેજો તમારા મેમરી પર ભાર ન બનાવે.
- Text Generation WebUI તમને LoRA, ક્વોન્ટ અને સંપ્લિંગ નીતિઓ માટે હેન્ડ્સ-ઓન કંટ્રોલ આપે. પ્રોમ્પ્ટ પરીક્ષણો અને મોડેલ સરખામણામાં શ્રેષ્ઠ.
RAG અને એજન્ટ્સ: તમારું બેઝ પસંદ કરો અને તમારા ટોય્સ સ્લોટ કરો
Retrieval-augmented generation (RAG) એ ત્યાં છે જ્યાં ઘણા આજે કામ કરે છે—તમારા દસ્તાવેજો, ટિકિટ્સ, અથવા PDFs માંથી જવાબ મેળવવો ક્લાઉડ પર ડેટા નહિ મોકલતાં.
- બેકએન્ડ: જો ઝડપ અને સહકાળીકતા જોઈએ તો vLLM વાપરો, અથવા સ્થાનિક વિકાસ અને નાની ટીમ માટે Ollama.
- ફ્રેમવર્ક: LangChain અથવા LlamaIndex ડોક્યુમેન્ટ ફાળવણી, એમ્બેડિંગ્સ, કેશિંગ હાથ ધરવા.
- એંબેડિંગ્સ: હવે ઘણા રનર્સ સ્થાનિક એમ્બેડિંગ્સ એકંદર આપે છે. નહિ હોય તો અલગ સ્થાનિક એમ્બેડિંગ મોડેલ જોડો.
- ગુરાડરેલ્સ: જો તે વાસ્તવિક ગ્રાહક ડેટા સ્પર્શે તો PII માસ્કિંગ કે મોડરેશન સાધનોનો વિચાર કરો.
ખર્ચ, પ્રાઇવસી અને નિયંત્રણ: વિકલ્પો શા માટે જરૂરી છે
- ખર્ચ: LLaMA.cpp ઓપન સોર્સ್ છે, અને વધારે ઉત્તમ વિકલ્પો પણ. તમારું બિલ હાર્ડવેર અને વીજળી છે. vLLM GPUsમાંથી વધુ કાઢે; Ollama ક્લાઉડ API ખર્ચ ટાળે.
- પ્રાઇવસી: સ્થાનિક રનર્સ તમારું ડેટા સ્થાનિક જ રાખે છે. આ કાયદાકીય, મેડિકલ કે “મારા નોટસ તાલીમ સેટ્સમાં ન જ લાગવી” માટે મોટું છે.
- નિયંત્રણ: Modelfiles, એડપ્ટર્સ અને ખુલ્લા વેઇટ્સ સાથે, તમે બ્લેક બોક્સમાં બંધાયેલા નથી. મોડેલ બદલશો—આજે Mistral, કાલે Llama 3, જ્યારે જોઈએ ત્યારે Phi-3.
ફાયદા અને નુકશાન સરવાળો (લઘુ, સત્ય, મૂર્ખપણાવાળા નથી)
- ફાયદા: બહુ સરળ, સારા ડિફોલ્ટ્સ, લેપટોપ માટે ઉત્તમ, શુદ્ધ API.
- નુકશાન: મોટા પાયે સૌથી ઝડપી નહીં; લેબ સાધનો કરતા ઓછા અસાધારણ નિયંત્રણો.
- ફાયદા: શિર્ષક GPU થ્રુપુટ, બેચિંગ, લાંબો સંદર્ભ, પ્રોડક્શન માટે અનુકૂળ.
- નુકશાન: ભારે સેટઅપ, GPU આવશ્યક છે મહાન પ્રદર્શન માટે.
- ફાયદા: પૉલિશ_GUI, સરળ મોડેલ શોધ, ઝડપી સર્વર ટૉગલ.
- નુકશાન: શુદ્ધ CLI સરવાળાના કરતા ઓછી સ્ક્રિપ્ટેબલ.
- Open WebUI (+ Ollama/vLLM)
- ફાયદા: ટીમ માટે અનુકૂળ ઈન્ટરફેસ, પ્લગઇન ઇકોસિસ્ટમ, મોડેલ-એગ્રોસ્ટીક.
- નુકશાન: બે ઘટકો સંભાળવાનું; પ્રદર્શન બેકએન્ડ પર આધારિત.
- ફાયદા: મહત્તમ નિયંત્રણ, વિશાળ વિસ્તરણ સમુદાય.
- નુકશાન: ઊંડો શીખવાનો વક્ર, તફાવતી લેબ બेंચ અનુભવ.
- ફાયદા: ઝીરો બેકએન્ડ, ખાનગી-પ્રથમ ડેમોઝ.
- નુકશાન: બ્રાઉઝર/ડિવાઇસ સ્રોતોથી સીમિત; ભારે કાર્ય માટે યોગ્ય નહીં.
- ફાયદા: ક્રોસ-પ્લેટફોર્મ ઝડપી, ઘણા ટાર્ગેટ માટે ડિપ્લોય કરી શકાય તેવું.
- નુકશાન: વધુ વિકાસ પ્રયાસ; ટિમો માટે શ્રેષ્ઠ જે ઉત્પાદન બનાવે છે.
વાસ્તવિક દુનિયાના મિની દૃશ્યો જેથી તમને વધુ વિચાર કરવાનો ના પડે
- એકલોટ વિકાસકર્તા MacBook Air પર સ્થાનિક નોટ્સ સહાયક બનાવી રહ્યો છે: Ollama ઇન્સ્ટોલ કરો, Q4 માં 7B મોડેલ ચલાવો, એમ્બેડિંગ્સ એન્ડપોઇન્ટ ઉમેરો અને સરળ RAG ચેઇન જોડો. તમારું કૉફી ઠંડુ થાય તે પહેલાં પૂરું થશે.
- સ્ટાર્ટઅપ પાસે 4090 બોક્સ અને Slack બોટ છે: મોડેલ્સ માટે vLLM વાપરો ઝડપ માટે. ઓપન WebUI આંતરિક ઉપયોગ માટે જેથી નોન-ડેવલૉપર વર્તન પરીક્ષણ કરી શકે. OpenAI-સમાન રૂટ બેક કરવાનું ન ભૂલવો.
- શોધકર્તા કાગળ માટે 10 મોડેલ સરખાવતો: ઝડપી ચકાસવા માટે LM Studio, અથવા વિગતવાર સંપ્લિંગ નિયંત્રણો અને દ્રશ્યાઙ্কન માટે Text Generation WebUI.
- શિક્ષક વિદ્યાર્થીઓના ડેટા બહાર વગર AI ડેમો આપે છે: બ્રાઉઝરમાં WebLLM સાથે નાનું મોડેલ. જાદૂ ખૂલે છે.
નોધપાત્ર: Sider.AI અહીં તમારું AI સહયોગી બની શકે છે
Heads up: જો તમે પસંદગીઓ વચ્ચે જંગલમાં હોવ તો Sider.AI ઝડપી પ્રોમ્પ્ટ અને કાર્યપ્રવાહ ટેસ્ટ ચલાવવાની સહાય કરે છે, પછી બેકએન્ડ બદલી શકો છો જીવનકથા ફરી લખ્યા વિના. તે GPUs પસંદ નહીં કરે бирок તમારું પ્રયોગ 19 અલગ ફોલ્ડર “final-final-v3” માં વિભાજિત થવા અટકાવે છે. સેટઅપ_snapshots: 'હેલો, મોડેલ' સુધી કેટલો ઝડપથી પહોંચી શકો?
ollama run mistral (અથવા llama3, phi3)
- OpenAI-જેમ ક્લાઈન્ટથી કૉલ કરો
- તમારા HF મોડેલ પાથ અને GPU ગાળો સાથે સર્વર શરૂ કરો
- તમારી એપ થી OpenAI-સમાન API રૂટ કૉલ કરો
- લાઇબ્રેરીમાંથી મોડેલ પસંદ કરો
- રીતસ Run પર ક્લિક કરો; વૈકલ્પિક રીતે સ્થાનિક સર્વર ટૉગલ કરો
- Ollama અથવા vLLM ને બેકએન્ડ તરીકે પોઈન્ટ કરો
- સાથે કામ કરનારા આમંત્રણ આપો અને પ્રોમ્પ્ટ સરખાવતા શરુ કરો
હા, મેં ડ્રાઇવર-વિશે દુખાવા નહીં ટાળ્યા. જો તમે Windows NVIDIA પર છો તો ડ્રાઈવર અને CUDA અપડેટ કરો. macOS પર Metal તમને મદદ કરશે. Linux પર, તમે પહેલેથી જ જાણો છો કે શું કરવું અથવા ફોરમ્સનો આનંદ લો.
તમારા રનર સાથે સાચા મોડેલ કુટુંબ પસંદ કરવી
- Llama 3 અને મિત્રો: ઉત્તમ સામાન્ય ચેટ અને રીઝનિંગ માટે; બધા રનર્સ અને ક્વાન્ટી ફોર્મેટ્સમાં મજબૂત સમર્થન.
- Mistral/Mixtral: ઝડપ અને ક્ષમતા માટે ઉત્તમ સંતુલન; Ollama અને vLLM માં લોકપ્રિય.
- Phi-3: નાનું પણ શક્તિશાળી. CPU/Mac માટે સરસ અને ઝડપી જવાબ માટે.
- Qwen, Gemma, DeepSeek variants: કોડ અને તથ્ય આધારિત Q&A માટે અજમાવવાના લાયક; ઘણા સારી સૂચનાઓ સાથે વેઇટસ સાથે આવે.
પ્રોફ ટિપ: દરેક ઉપયોગ માટે બે-ત્રણ મોડેલો અજમાવો. કોડિંગ માટે 'code' ટ્યુન્ડ વેરિયન્ટ, પ્રશ્ન-જવાબ માટે 'instruct' ટ્યુન્ડ. સર્જનાત્મકતામાં નાની મોડેલો ઝડપથી ઇટરે શન આપે.
ટ્રબલશૂટિંગ વિના તલવાર મુકાવવી
- CPU પર ટોકન ધીમી? નાના ક્વોન્ટ (Q4) કે નાનો મોડેલ (7B) અજમાવો. જરૂર છે તો જ સંદર્ભ વધારવો.
- GPU પર VRAM ભૂલો? નીચું પ્રીસિજન (4-bit), ત્યાં શક્ય હોય ત્યારે લાંબો સંદર્ભ નહીં પણ રોપ સ્કેલિંગ વાપરો, અથવા નાનો બેઝ મોડેલ અજમાવો.
- સ્ટ્રીમ કરचन? બેચિંગ કે KV કેશ સાઇઝ તપાસો; vLLM અહીં તેજ છે. Ollama પર સમકક્ષ વિનંતી ઓછી રાખો.
- અજાણ્યાં આઉટપુટ? સિસ્ટમ પ્રોમ્પ્ટ ફરીથી સેટ કરો, બીજો સૂચિત મોડેલ અજમાવો, કે ટોકનાઈઝેશન સેટિંગ્સ ચકાસો.
નિષ્કર્ષ: LLaMA.cpp ની જગ્યાએ શું પસંદ કરવું
- Ollama પસંદ કરો જો તમે સર્વશ્રેષ્ઠ સ્થાનિક અનુભવ અને ઓછા સેટઅપ સાથે સાફ API માંગો છો.
- vLLM પસંદ કરો જો તમને ઝડપ, સ્કેલ અને પ્રોડક્શન-જવાબદાર સર્વર જોઈએ.
- LM Studio પસંદ કરો જો તમે પૉલિશ્ડ ડેસ્કટોપ એપ અનુભવ અને ઝડપી મોડેલ શોધ માંગો છો.
- તમામ સરખામણી માટે Open WebUI જોડો.
- પાવર-યુઝર કંટ્રોલ અને ઊંડા પ્રયોગ માટે Text Generation WebUI વાપરો.
- બ્રાઉઝર-પ્રથમ ડેમોઝ અને પ્રાઇવસી માટે WebLLM લાવો.
મધ્યરાત્રે કર્નેલ કમ્પાઈલ કરવાનો મુશ્કેલ કાર્ય તમારું થવું જોઈએ નહીં ફક્ત મોડલથી ડિનર વિચારો માંગવા માટે. LLaMA.cpp સારું છે—પરંતુ આ વિકલ્પો પણ છે. તે પસંદ કરો જે તમારો સમય, હાર્ડવેર અને શાંતિ સન્માન કરે. અને પછી મહત્વપૂર્ણ કામ પર ફરી જાઓ. જેમ કે તમારા મોડલને શીખવાડવું કે તે ઇમેઇલ્સમાં “Kind regards” નહીં લખે જ્યારે તમે સ્પષ્ટપણે “Per my last email...”માં હતા.
શિક્ષણમાં પુછાતા પ્રશ્નો
પ્ર: શરુઆત માટે શ્રેષ્ઠ LLaMA.cpp વિકલ્પ કયો છે?
ઉત્તર: Ollama અથવા LM Studio થી શરૂઆત કરો. બંને સ્થાનિક મોડેલો સરળ, ઝડપી અને મૈત્રીપૂર્ણ બનાવે છે, ઓછા સેટઅપ સાથે અને મજબૂત મોડેલ લાઇબ્રેરી સાથે. તમે સ્થાનિક AI ની શક્તિ ગુમાવ્યા વિના સરળ શરૂઆત કરો છો.
પ્ર: GPU વરકોટે માટે vLLM શું LLaMA.cpp કરતાં વધુ ઝડપથી છે?
સામાન્ય રીતે હા. vLLM બચ્ચિંગ અને અદ્યતન KV કેશ નીતિઓ સાથે ઝડપી, ઉચ્ચ પ્રવાહશીલ GPUInference માટે બનાવેલ છે. જો તમારું લક્ષ્ય ઝડપ અને સ્કેલ છે, તો vLLM મજબૂત LLaMA.cpp વિકલ્પ છે.
પ્રશ્ન 3: શું હું RAG અને લોકલ સર્ચ માટે LLaMA.cpp ના વિકલ્પોનો ઉપયોગ કરી શકું?
ચોક્કસ. એમ્બેડિંગ્સ અને રિટ્રીવલ માટે ઓલામા અથવા vLLM ને LangChain અથવા LlamaIndex સાથે જોડો. તમને તમારા દસ્તાવેજોને ક્લાઉડ પર મોકલ્યા વિના ખાનગી, લોકલ RAG મળશે.
પ્રશ્ન 4: Apple સિલિકોન પર macOS માટે કયો વિકલ્પ શ્રેષ્ઠ છે?
ઓલામા અને LM સ્ટુડિયો બંને મેટલ એક્સલરેશન સાથે Apple સિલિકોન પર સરસ ચાલે છે. મિસ્ટ્રલ, Llama 3 અને Phi-3 જેવા નાનાથી મધ્યમ કદના મોડેલો ઝડપી લાગે છે અને તમારા પંખાને શાંત રાખે છે.
પ્રશ્ન 5: શું આ વિકલ્પો સાથે સારા પરિણામો મેળવવા માટે મારે GPU ની જરૂર છે?
GPU મદદ કરે છે, પરંતુ તે ફરજિયાત નથી. ક્વોન્ટાઇઝ્ડ 7B–8B મોડેલો સાથે, CPU પર ઓલામા અથવા LM સ્ટુડિયો હજી પણ નક્કર ચેટ પરફોર્મન્સ આપી શકે છે. ભારે વર્કલોડ્સ અથવા મોટા મોડેલો માટે, GPU સાથે vLLM ચમકે છે.