ഞായറാഴ്ച രാത്രി LLaMA.cpp സംയോജിപ്പിക്കാൻ ശ്രമിച്ച്, നിങ്ങൾക്ക് ചാറ്റ്ബോട്ട് ഉണ്ടാക്കാൻ പകരം ഒരു സ്പെയിസ് ഹീറ്റർ ഉടച്ചു പോയിരിക്കുന്നു എന്ന് മനസ്സിലായിട്ടുണ്ടോ? അതേ, ഞാൻ ആ അനുഭവം നേരിട്ടു. എന്റെ ലാപ്ടോപ്പിന്റെ ഫാനുകൾ അങ്ങേയറ്റം വേഗത്തിലായി പ്രവർത്തിക്കുകയായിരുന്നു; ഞാൻ അതെ Top Gun-ലേയ് ഒട്ടിയതാണെന്നാണ് കരുതി. നല്ല വാർത്ത: ബെസ്റ്റായ പ്രാദേശിക AI പ്രവർത്തിപ്പിക്കാൻ LLaMA.cpp-നൊപ്പം കുടുക്കേണ്ടതില്ല. സജ്ജീകരിക്കാൻ ലളിതവും GPU സൗഹൃദവുമായ, നിങ്ങളുടെ മനസ്സ് സംരക്ഷിക്കുന്ന സാരവുമുള്ള LLaMA.cpp-നുള്ള മികച്ച മികച്ച ഐച്ഛികങ്ങൾ ഉണ്ട്.
ഈ ഗൈഡ് മികച്ച LLaMA.cpp ഐച്ഛികങ്ങൾ തിരഞ്ഞെടുക്കാനുള്ള മാർഗ്ഗനിർദ്ദേശം ആണ്. ആരെന്തു ഉപയോഗിക്കണം, ഇൻസ്റ്റാൾ ചെയ്യുന്നത് എത്ര പ്രയാസമെന്ന്, സാധാരണ ഹാർഡ്വെയറിൽ (ഒരു NASA ലാബ് അല്ലാതെ) കാണുന്ന പ്രകടനം என்னെല്ലാം ആണെന്ന് വിശദീകരിക്കും. കൂടാതെ ഉപകരണങ്ങൾ ദിവസേന ചെയ്യുന്ന ചെറിയ ക്രമീകരണങ്ങൾ — ക്വാണ്ടൈസേഷൻ, മോഡൽ മാറ്റം, എംബെഡിങ്ങുകൾ — അവ ആഘോഷങ്ങളുടെ കാലഘട്ടത്തിൽ ലൈറ്റ് തണുത്ത് വയിരിക്കുന്നതുപോലെ അല്ല, സ്വിച്ച് ഓണാക്കുന്നതുപോലെ എളുപ്പമാക്കി.
ഉദ്ദേശ്യം അറിയിക്കുക: നിങ്ങൾ “LLaMA.cpp ഐച്ഛികങ്ങൾ” എന്നു തിരയുന്നത് മൂന്നിൽ ഒന്നായിരിക്കാം — ലളിതമായ സജ്ജീകരണം, നിങ്ങളുടെ ഹാർഡ്വെയറിൽ മെച്ചപ്പെട്ട വേഗം, അല്ലെങ്കിൽ മെച്ചപ്പെട്ട വികസന അനുഭവം. 40 ടാബുകളുടെrabbit hole-ലേക്ക് പോകാതെ ഞങ്ങൾ നിങ്ങളെ അവിടെ എത്തിക്കും.
ഫാസ്റ്റ് അനുഭവക്കുറിപ്പുകൾ: LLaMA.cpp പകരം നിങ്ങൾ യാഥാർത്ഥത്തിൽ എന്താണു വേണ്ടത്
- ഒന്ന് ക്ലിക്ക് പ്രാദേശിക AI സൗഹൃദ UI-യോടെ വേണ്ടൽ: LM Studio അല്ലെങ്കിൽ Ollama അനുസരിക്കുക.
- അപ്ലിക്കേഷനുകൾക്കായി ശക്തമായ സർവർ/API വേണം, സ്മാർട്ട് ക്യാഷിംഗ്, ക്വാണ്ടൈസേഷൻ എന്നിവ ബോക്സിൽ നിന്ന്: Ollama അല്ലെങ്കിൽ vLLM.
- GPU ഫാം അല്ലെങ്കിൽ ഒരു ശക്തമായ കാർഡ് ആണെങ്കിൽ ഏറ്റവും കൂടുതൽ ടോക്കൺ-പ്രതി-സെക്കന്റ് എടുക്കാൻ ആഗ്രഹിക്കുന്നവർ: vLLM.
- Python-പ്രധാനമായ, ബാറ്ററിയും ചേർന്ന സ്റ്റാക്ക് വേണ്ടി RAG, ഏജന്റുകൾക്കായി: LangChain + inference ബാക്ക്എൻഡ് പോലെ Ollama അല്ലെങ്കിൽ vLLM.
- ബ്രൗസർ അടിസ്ഥാനപരമായ പരീക്ഷണ സ്റ്റേഷൻ കുറഞ്ഞ ഇൻസ്റ്റാൾ പൈൻോടെ: WebLLM അല്ലെങ്കിൽ Open WebUI (Ollama പോലുള്ള ബാക്ക്എൻഡിനൊപ്പം).
അതെ, കൂടുതൽ ഓപ്ഷനുകൾ ഉണ്ട്. അല്ല, എല്ലാം നിങ്ങൾക്ക് ആവശ്യമില്ല. ഏറ്റവും നല്ല LLaMA.cpp ഐച്ഛികങ്ങൾ എന്തൊക്കെയാണെന്ന്, അവ എപ്പോൾ പ്രയോജനപ്പെടും എന്നും പരിശോധിക്കാം.
Ollama: “അത് വെറും ഓടുന്നു” പ്രാദേശിക മോഡൽ റണ്ണർ
LLaMA.cpp 73 ഉപകരണങ്ങളുള്ള സ്വിസ് ആർമി കര്ഫൈൻമെന്ന പോലെ ആണെങ്കിൽ, Ollama നിങ്ങള് വേണ്ട πραγματικά u സാരമുള്ള മൂന്ന് ഉപകരണങ്ങള് — കത്തിയ, കത്തി, കോർക്ക്സ്ക്രൂ — ഒറ്റയ്ക്കുള്ള വശവും എളുപ്പവും നൽകുന്നു.
- എന്തുകൊണ്ട് പകരം: കുറഞ്ഞ വഴി മോഡൽ ലഭ്യമാകണം, ക്വാണ്ടൈസേഷൻ നിർവ്വഹിക്കുന്നത് നിങ്ങൾക്കായി, എളുപ്പമുള്ള മോഡൽ ഫയലുകൾ (Modelfiles) സിസ്റ്റം നിർമ്മിക്കുന്നതിന്. ഇത് ഒരു പ്രാദേശിക HTTP API പ്രദാനം ചെയ്യുന്നു, നിങ്ങളുടെ ആപ്പുകൾ അത് OpenAI പോലെയുള്ള എന്റ്പോയിന്റായി വിളിക്കാം.
- സജ്ജീകരണം: ആപ്പ് ഇൻസ്റ്റാൾ ചെയ്യുക.
ollama run llama3 (അഥവാ നിങ്ങൾ പ്രിയപ്പെട്ട മോഡൽ). വഴിപാടില്ലാത്ത CMake 14-പടി യാത്രകൾ ഇല്ല.
- പ്രകടനം: മുൻകൂട്ടിയുള്ള ക്വാണ്ടൈസേഷനുകൾ (Q4, Q5, Q8) ഉള്ള സാധു CPU, GPU പിന്തുണ. വലിയ ഡാറ്റാസെന്റർ GPU-കളിൽ ഏറ്റവും വേഗമുള്ളതല്ല, എന്നാൽ ലാപ്ടോപ്പിലും ഡെസ്ക് ടോപ്പിലും ഉത്തമം.
- മികച്ചത്: പ്രാദേശിക ആപ്പ് വികസിപ്പിക്കുന്ന ഡെവലപ്പർമാർ, വേഗവും മാനസിക ശാന്തിയും വേണ്ടവർ, ചെറുതായ MLOps വളെറ്റ് ഇഷ്ടപ്പെടുന്നവർ.
- സുഖകരമായ വൃത്താന്തങ്ങൾ: മോഡൽ ലൈബ്രറി, ലളിതമായ പ്രോംപ്റ്റ്, എംബെഡിങ്ങ് പിന്തുണ, GUI റാപ്പറുകളുടെ വളരുന്ന സമ്പ്രദായം.
ഉപയോക്താക്കൾക്ക് മുൻഗണന ഇല്ലെങ്കിൽ? ഒരുപാട് അഭ്യർത്ഥനകൾ നിരവധി GPU-കളിൽ നിയന്ത്രിക്കുന്നവർ, ടോക്കൺ സ്ട്രീമിംഗ് വലിയ വേഗത്തിൽ ആവശ്യമായവർ vLLM വേണം.
vLLM: GPU-ക്കുള്ള ഉയർന്ന സഞ്ചാരം ത്യജ്ജകനായ ഭീമൻ
LLaMA.cpp ഏതിൽവിടെ വേണമെങ്കിലും ഓടാം. vLLM യഥാർത്ഥ GPU ഉണ്ട് വേണമെന്നുണ്ട്; അതിന് ഒരു സാഹസിക ഹൈവേ എക്സ്പ്രസ് ലെയിൻ എന്ന് കരുതുക.
- പകരം: വേഗതയേറിയ സ്കെയിലബിള്c ഇൻഫറൻസ് ഉപയോഗിച്ച് നിർമ്മിച്ചത്, PagedAttention, പരിചിത KV ക്യാഷ് മാനേജ്മെന്റ് എന്നിവയുള്ളതാണ്. അനേകം പ്രൊഡക്ഷന് ലേഡിയ ഡിപ്ലോയ്മെന്റിന് പിന്നിൽ നിന്നിട്ടുള്ള എൻജിൻ.
- സജ്ജീകരണം: Python, CUDA, ഡ്രൈവർസ് — ഉണ്ണം, ചെറിയ ഭാരം. പക്ഷേ ഒരിക്കൽ പ്രവർത്തിക്കുമ്പോൾ അത് കുരയ്ക്കും.
- പ്രകടനം: NVIDIA GPU-കളിൽ മികച്ച പ്രകടനം; ദീര്ഘകോണ്ടെക്സ്റ്റുകളും ധാരാളം സമകാലീന അഭ്യർത്ഥനകളും.
- മികച്ചത്: APIs, പ്രൊഡക്ഷൻ ആപ്പുകൾ, ഭാരം കൂടിയ ജോലികൾ, അല്ലെങ്കിൽ “tps” ഒരു സ്നേഹഭാഷയാണെന്ന് കരുതുന്നവർ.
- വളരെ നല്ലത്: OpenAI-സമ്മതപ്പെട്ട സർവർ മോഡ്, ടെൻസർ പരലലിസം, തുടർച്ചയായ ബാച്ചിംഗ്, ദീർഘകോണ്ടെക്സ്റ്റ് പിന്തുണ.
കൃത്യമായി CPU മാത്രം ഉപയോഗിക്കുന്നവർ അല്ലെങ്കിൽ ഡ്രൈവർ ഇൻസ്റ്റാൾ/ഒഴിവുകാർ വണ്ടിയിലേക്ക്. ആ സാഹചര്യത്തിൽ, Ollama അല്ലെങ്കിൽ LM Studio സൗഹൃദമാകും.
LM Studio: പ്രാദേശിക മോഡലുകൾക്കുളള സൗഹൃദമായ ഡെസ്ക്ടോപ്പ് സ്റ്റുഡിയോ
“എനിക്ക് നല്ല ആപ്പ് വിൻഡോ, റൺ ബട്ടൺ വേണം” എന്ന ഓപ്ഷൻ ഇത്. LM Studio മോഡൽ ഹോസ്റ്റിംഗും AirBnB പോലെയാണ്: ശുഭ്രവും സൗകര്യപ്രദവും; ലൈറ്റ് സ്വിച്ച് എവിടെയെന്ന് കണ്ടെത്താൻ കഴിയും.
- എന്തുകൊണ്ട് പകരം: പൂർണ്ണ GUI, നിർമ്മിച്ച മോഡൽ മാർക്കറ്റ്, പ്രാദേശിക ചാറ്റ്, ഒപ്പം ഓപ്പൺഎഐ-സമാനമായ സർവർ അല്ലെങ്കിൽ നിങ്ങളുടെ ആപ്പുകൾക്ക് ടോഗിൾ ചെയ്യാൻ കഴിയുന്ന ഓപ്ഷൻ.
- സജ്ജീകരണം: ഡൗൺലോഡ്, തുറക്കുക, മോഡൽ തിരഞ്ഞെടുക്കുക, റൺ ക്ലിക്ക് ചെയ്യുക. കോൺഫിഗ് ഫയലുകളുടെ പകരം സ്ലൈഡറുകൾ, ചാർട്ടുകൾ ലഭിക്കും.
- പ്രകടനം: മറ്റ് റണ്ണേഴ് ന്ങൾ പോലെയുള്ള സാങ്കേതിക വിദ്യ; മൊഴിമാറ്റ Macs (Metal) ൽ സ്മൂത്ത്; Windows/Linux-ൽ ശരാശരി.
- മികച്ചത്: എഴുത്തുകാരും, വിശകലനക്കാരും, GUI-ആധാരിത ക്രമീകരണം ഇഷ്ടപ്പെടുന്ന ഡെവലപ്പർമാർ; ലഞ്ചിന് മുമ്പ് അഞ്ചു മോഡലുകൾ പരീക്ഷിക്കാൻ ഇഷ്ടപ്പെടുന്നവർ.
- സുഖകരമായ വൃത്താന്തങ്ങൾ: പ്രോംപ്റ്റ് ടെംപ്ലേറ്റുകൾ, സംവാദ ചരിത്രം, ടോക്കൺ ദർശനം, നല്ല macOS പിന്തുണ.
GUI-ക Approved CLI മാത്രം സംസാരിക്കുന്നവർക്ക് Ollama അല്ലെങ്കിൽ vLLM ശക്തമായ അനുഭവമായി തോന്നും.
Open WebUI + ഒരു ബാക്ക്എൻഡ് (Ollama/vLLM): മോടുലാർ കോക്പിറ്റ്
Open WebUI കാച്ചെ സുഗമവും, Ollama അല്ലെങ്കിൽ vLLM എൻജിനുമായി. ഇത് LLaMA.cpp പകരം ഒരു മൾട്ടി-മോഡൽ ചാറ്റ് ലാബ് ആയിരിക്കാം — റോൾസ്, ഡോക്യുമെന്റുകൾ, എക്സ്റ്റൻഷനുകൾ എന്നിവയുള്ളത്.
- എന്തുകൊണ്ട് പകരം: ബാക്ക്എൻഡ് സ്വതന്ത്രമായി സൂക്ഷിക്കുമ്പോഴും മികച്ച, മൾട്ടി-ഉപയോക്തൃ ഫ്രണ്ട്എൻഡ്.
- സജ്ജീകരണം: Docker അല്ലെങ്കിൽ ഒന്ന്-ലൈൻ ഇൻസ്റ്റാൾസ്. മോഡൽ സർവറായി സൂചിപ്പിക്കുക.
- പ്രകടനം: ബാക്ക്എൻഡ് അനുസരിച്ച് — വേഗത്തിനായി vLLM, ലളിതത്വത്തിനായി Ollama പൊരുത്തപ്പെടുത്താം.
- മികച്ചത്: ചെറിയ ടീമുകൾ, ലാബുകൾ, പ്രോംപ്റ്റുകൾ പരീക്ഷിക്കാനും മോഡലുകൾ താരതമ്യം ചെയ്യാനും ചാറ്റുകൾ പങ്കിടാനായി ഒരു കേന്ദ്ര സ്ഥലം.
Text Generation WebUI: ടിങ്കറർമാരുടെ ടൂൾകിറ്റ്
ഇനി പോലും ജനപ്രിയമാണ് — നോബുകളും ഗ്രാഫുകളും ഇഷ്ടപ്പെടുന്ന ശക്തമായ ടിങ്കറർമാർക്കായി.
- എന്തുകൊണ്ട് പകരം: അനേകം എക്സ്റ്റൻഷനുകൾ, ക്വാണ്ടൈസേഷൻ നിയന്ത്രണം, മോഡൽ മാറ്റം.
- സജ്ജീകരണം: ലളിതമല്ല, എന്നാൽ ഒരിക്കൽ പ്രവർത്തനക്ഷമമായാല് വളരെ ക്രമീകരിക്കാൻ കഴിയും.
- മികച്ചത്: ലാബ് ബഞ്ചിന്റെ അനുഭവം, അനേക മോഡൽ ഫോർമാറ്റുകൾ, പ്ലഗിൻ പവർ വേണ്ടവർ.
WebLLM: നിങ്ങളുടെ برൗസറിൽ മോഡലുകൾ
സൂക്ഷ്മം: WebGPU ഉപയോഗിച്ച് Chrome-ൽ നേരിട്ടുള്ള LLM ഓടിക്കുക. ഇത് നിങ്ങളുടെ സർവർ സ്റ്റാക്ക് പകരക്കാരനാകുമോ? ആയിരിക്കും നിഷേധം. όμως ഡെമോകൾക്ക്, വിദ്യാഭ്യാസത്തിനും, സ്വകാര്യതയ്ക്ക് മുന്ഗണന നൽകുന്ന പരീക്ഷണങ്ങൾക്കു് അത്ഭുതകരമാണ്.
- എന്തുകൊണ്ട് പകരം: ബാലൻസ് ബാക്ക്എൻഡ്; വിശ്വസനീയമായ സാന്റ്ബോക്സും ഷെയറിൽ പറ്റും.
- സജ്ജീകരണം: എളുപ്പത്തിൽ ഒരു വെബ് പേജ് തുറക്കുക. ചിലപ്പോൾ ഒരു മോഡൽ ഫയൽ ലോഡുചെയ്യണം.
- മികച്ചത്: ഹل്ക് ചാറ്റ്, ക്ലാസ്റൂം ഡെമോകൾ, സ്വകാര്യതാ ബാധിത സാഹചര്യങ്ങൾ, “വാവ, ഇത് ഇവിടെ ഓടുന്നു?” അനുഭവങ്ങൾ.
MLC/MLC-LLM: ക്രോസ്-പ്ലാറ്റ്ഫോം, ഹാർഡ്വെയർ രീതി വേഗം
“ഒന്ന് കമ്പൈൽ ചെയ്താൽ പല ഉപകരണങ്ങളിലും വേഗത്തിൽ ഓടും” എന്ന പ്രത്യാശ ഇഷ്ടമുള്ളവർക്ക് MLC പരിസ്ഥിതി സുഹൃത്ത്.
- എന്തുകൊണ്ട് പകരം: Metal (ആപ്പിൾ), Vulkan, CUDA ലക്ഷ്യമാക്കി ഒരു സ്റ്റാക്ക്, ക്വാണ്ടൈസേഷൻ, ഡിപ്പ്ലോയ്മെന്റ് സഹായകങ്ങൾ എന്നിവയെത്തിവ്.
- സജ്ജീകരണം: ഡെവലപ്പർ-മുന്നേറ്റം. ഒരു ځل സമ്മതിച്ചാൽ, പൊർട്ടബിലിറ്റിയാണ് നേട്ടം.
- മികച്ചത്: Mac, Windows, മൊബൈൽ ആപ്ലിക്കേഷനുകൾ കൈമാറുന്ന ടീമുകൾക്ക് സമാന പ്രകടനം ആവശ്യമായവർ.
llama.cpp-ക്കും ലോകത്തിനും (the world): യാഥാർത്ഥ്യത്തിൽ വ്യത്യാസമുണ്ടാകുന്നത്?
അതിനെ മനുഷ്യഭാഷയാക്കി പരിഭാഷപ്പെടുത്താം:
- സജ്ജീകരണ പ്രയാസം: LLaMA.cpp ബൈനറികൾ വഴി ലളിതമാകാമെങ്കിൽ, കസ്റ്റം ബിൽഡ്സോ GPU ട്യൂണിങ്ങോ ആവശ്യമെങ്കിൽ പ്രയാസം കൂടും. "ഇൻസ്റ്റാൾ ചെയ്ത് മറക്കുക" എന്ന വിഷയത്തിൽ Ollama, LM Studio ഉത്തമം.
- API, ആപ്പുകൾ: LLaMA.cpp-ക്ക് സർവറുകളും ബൈൻഡിംഗും ഉണ്ടെങ്കിലും, Ollama/vLLM ആപ്പ് ബാക്ക്എൻഡുകൾക്കായി പ്രത്യേകം നിർമ്മിച്ച HTTP, ബാച്ചിംഗ്, OpenAI-സമ്മതപത്ര മാർഗ്ഗങ്ങളുള്ളവ.
- GPU വേഗത: vLLM വലിയ GPU-കളിൽ ഉത്തമം. LLaMA.cpp എവിടെയും ഓടും; എന്നാൽ പരമാവധി ത്രൂപുട്ട് vLLM-ന്റെ പ്രത്യേകത.
- GUI ശാസ്രത്വം: LM Studio, Open WebUI ആധുനികവും കണ്ടെത്താൻ എളുപ്പവും വല്ലാതെ നന്നായവ.
- മൾട്ടി-മോഡൽ പ്രവർത്തനം: മോഡലുകളും ക്വാണ്ടൈസേഷനുകളും പെട്ടെന്ന് മാറാൻ Ollama; Text Generation WebUI ദക്ഷമായ നിയന്ത്രണം നൽകുന്നത്.
ഹാർഡ്വെയറും ഉപയോഗത്തിനും അനുസരിച്ചുള്ള ഐച്ഛികം തിരഞ്ഞെടുക്കൽ
സാധാരണ ആളുകൾക്ക് വേണ്ട പ്രവാഹചിത്രം ഇങ്ങനെ:
- കേവലം CPU ലാപ്ടോപ്പുണ്ടെങ്കിൽ? Ollama അല്ലെങ്കിൽ LM Studio ഉപയോഗിക്കുക. ചെറിയ ക്വാണ്ടൈസ് മോഡലുകൾ (Q4/Q5) ഉപയോഗിക്കുക. 3–8 ടോക്കൺ/വെള്ളിക്കൽ ലക്ഷ്യമിട്ട് സാന്ത്വനം അനുഭവിക്കുക.
- ആപ്പിൾ സിലിക്കൺ മാക്? Metal സജീവമാക്കിയാൽ Ollama അല്ലെങ്കിൽ LM Studio. Llama 3, Phi-3, Mistral ചേർത്തു ഉപയോഗിക്കുക. വേഗത്തിലുള്ള പ്രതികരണം, കുറഞ്ഞ ഫാൻ ശബ്ദം.
- ഒന്ന് NVIDIA GPU (3060–4090 പോലുള്ള) ഉണ്ടെങ്കിൽ? വേഗക്കും API-ക്കുമായി vLLM പരീക്ഷിക്കുക; ലളിത പ്രാദേശിക പ്രവാഹങ്ങൾക്ക് Ollama.
- മൾട്ടി-GPU അല്ലെങ്കിൽ സർവർ? vLLM. ബാച്ചിംഗ്, ദീർഘകോണ്ടെക്സ്റ്റ്, സർക്കാർ പ്രകടനം മെച്ചപ്പെടുത്തും.
- ഒരേ ഓഫിസിൽ പലർക്കും UI വേണ്ടെങ്കിൽ? Open WebUI + Ollama അല്ലെങ്കിൽ vLLM.
- പരമാ പവർ - നൂക്കിനും കണക്റ്ററിനുമുള്ള Text Generation WebUI.
- ബ്രൗസർ അടിസ്ഥാന പ്രദർശനങ്ങൾക്കും സ്വകാര്യതയ്ക്ക് WebLLM.
വിപണന വേള്ച്ചയില്ലാതെ പ്രകടന പ്രതീക്ഷകൾ
- ചെറിയ മോഡലുകൾ (3–8B): CPU-ഉം, ക്വാണ്ടൈസ് മോഡലുകളും സുഖകരം ചാറ്റ് ചെയ്യാം. M-സീരീസ് മാക്സ് അല്ലെങ്കിൽ മധ്യമതിയുള്ള GPU-കളിൽ ഉടൻ മുക്തിയായി തോന്നും.
- മദ്ധ്യമുള്ള മോഡലുകൾ (13–34B): GPU VRAM (12–24GB+) ആവശ്യമാണ്. 24GB VRAM-ൽ 13B–14B മോഡലുകൾ 4/5-bit ക്വാണ്ടൈസ് ചെയ്തു വേഗത്തിൽ പ്രവർത്തിക്കും.
- വലിയ മോഡലുകൾ (70B+): ക്ലസ്റ്റർ അല്ലെങ്കിൽ A100/H100 ആവശ്യം ഇളക്കത്തിൽ വേഗം; مقامي ക്വാണ്ടൈസേഷൻ, നിശിതമായ ഉൽപ്പത്തി, സർവർ ട്രിക്കുകൾ ഉപയോഗിക്കണം.
ഡെവലപ്പർ അനുഭവം: Modelfiles, അഡാപ്പ്റ്റേഴ്സ്, ക്യാഷ് മാജിക്ക്
- Ollama-യുടെ Modelfiles LLM-കൾക്കായുള്ള Dockerfiles പോലെയാണ്. ഒരു അടിസ്ഥാന മോഡൽ നിർവചിച്ച്, സിസ്റ്റം പ്രോംപ്റ്റുകൾ ചേർത്ത്, അഡാപ്റ്റർ ചേർക്കാം, ഒന്ന് പോലെ പോർട്ടബിൾ റെസിപ്പി ഉണ്ടാക്കാം.
- vLLM OpenAI-സമ്മതപ്പെട്ട സർവർ നിങ്ങളുടെ ആപ്പ് കോഡും മാറ്റാതെ കൃത്യമായി പ്രവർത്തിക്കും. ദീർഘവായ്പ്പ് പ്രഭാഷണവും മെമ്മറി സമ്മർദം കുറയും.
- Text Generation WebUI നിങ്ങൾക്ക് LoRA, ക്വാണ്ടൈ, സാമ്പിൾ സമ്പ്രദായങ്ങൾ നിയന്ത്രിക്കാൻ കഴിയും. പ്രോംപ്റ്റ് പരീക്ഷണങ്ങൾക്കും തമ്മിലുള്ള താരതമ്യത്തിന് ഉത്തമം.
RAG, ഏജന്റുകൾ: അടിസ്ഥാന മോഡൽ തിരഞ്ഞെടുക്കും, ഉപകരണങ്ങൾ ചേർക്കും
Retrieval-augmented generation (RAG) ഇപ്പോൾ നിങ്ങൾ പലരും ഉപയോഗിക്കുന്നത് ആണ് — ഡോക്യുമെന്റുകൾ, ടിക്കറ്റുകൾ, PDF കളിൽ നിന്നുള്ള ചോദ്യങ്ങൾ ഉത്തരപ്പെടുത്തുന്നു, ഡാറ്റ ക്ലൗഡിലേക്ക് അയക്കാത്തതാണ്.
- ബാക്ക്എൻഡ്: വേഗത്തേയും സമകാലീനതയേയും വേണമെങ്കിൽ vLLM; പ്രാദേശിക ഡെവ്, ചെറിയ ടീമിനായി Ollama.
- ഫ്രെയിംവർക്ക്: LangChain അല്ലെങ്കിൽ LlamaIndex ഉപയോഗിച്ച് ഡോക്യുമെന്റ് ചങ്കിങ്, എംബെഡിങ്ങ്, ക്യാഷിംഗ് കൈകാര്യം ചെയ്യുക.
- എംബെഡിങ്ങുകൾ: പല റണ്ണറുകളും ഇപ്പോൾ പ്രാദേശിക എംബെഡിങ്ങ് എന്റ്പോയിന്റുകൾ നൽകുന്നു; ഇല്ലെങ്കിൽ വേറൊരു പ്രാദേശിക എംബെഡിങ്ങ് മോഡൽ ചേർക്കുക.
- ഗാർഡ്റെയിൽസ്: പേഴ്സണൽ ഐഡന്റിഫയറാവുന്ന വിവരങ്ങളുടെ മറച്ചുവെപ്പ് അല്ലെങ്കിൽ മോടറേഷൻ ഓപ്പ്ഷനുകൾ പരിഗണിക്കുക, യഥാർത്ഥ കസ്റ്റമർ ഡാറ്റയുമായി ബന്ധപ്പെട്ടാൽ.
വില, സ്വകാര്യത, നിയന്ത്രണം: എന്തുകൊണ്ട് ഐച്ഛികങ്ങൾ പ്രധാനമാണ്
- വില: LLaMA.cpp ഓപ്പൺ സോഴ്സ് ആണ്, കൂടുതൽ ഐച്ഛികങ്ങളും അതുപോലെയാണ്. നിങ്ങളുടെ ബിൽ: ഹാർഡ്വെയറും വൈദ്യുതി ചെലവും മാത്രം. vLLM GPUകൾ കൂടുതൽ ഫലപ്രദമാക്കും; Ollama ക്ലൗഡ് API സറവ് മാറ്റം ഒഴിവാക്കും.
- സ്വകാര്യത: പ്രാദേശിക റണ്ണറുകൾ നിങ്ങളുടെ ഡാറ്റ പ്രാദേശികം സൂക്ഷിക്കും. നിയമപരമായും, മെഡിക്കൽ മേഖലത്തെയും, അല്ലെങ്കിൽ 'എന്റെ കുറിപ്പുകൾ ട്രെയിനിംഗ് സെറ്റുകളിൽ ഇല്ലാതിരിക്കണോ എന്ന്' ഇഷ്ടപ്പെടുന്നവർക്ക് ഇത് വലിയ കാര്യം.
- നിയന്ത്രണം: Modelfiles, അഡാപ്റ്റേഴ്സ്, തുറന്ന ഭാരങ്ങൾ ഉള്ളതിനാൽ ബ്ലാക്ക്ബോക്സ് അല്ല. മോഡലുകൾ മാറാം — ഇപ്പോൾ Mistral, നാളെ Llama 3, നിങ്ങൾക്ക് ചെറിയ Phi-3 ആവശ്യമായാൽ.
മികച്ചതും മോശത്തും സംഗ്രഹം (ചുരുക്കം, പ്രാമാണികം, മിറ്റി മൂടിയില്ലാതെ)
- നന്മ: അത്ഭുതകരമായി ലളിതം, നല്ല ഡീഫോൾട്ടുകൾ, ലാപ്ടോപ്പിനും അനുയോജ്യമാണ്, ശുചിത്വമുള്ള API.
- ദോഷം: വലുതായി സ്കെയിലിൽ ഏറ്റവും വേഗമാണ് അല്ല; ലാബ് ടൂളുകൾ പോലുള്ള എക്സോട്ടിക് നോബുകൾ കുറവ്.
- നന്മ: ഉത്തമ GPU ത്രൂപുട്ട്, ബാച്ചിംഗ്, ദീർഘകോണ്ടെക്സ്റ്റ്, പ്രൊഡക്ഷൻ സൗഹൃദം.
- ദോഷം: ഇൻസ്റ്റാൾ ചെയ്യുന്നത് ഭാരം കൂടിയത്, സെണിസം ഉറപ്പിക്കാൻ GPU ആവശ്യമാണ്.
- നന്മ: പൊളിഷ് ചെയ്ത GUI, എളുപ്പം മോഡൽ കണ്ടെത്തൽ, വേഗമുള്ള സർവർ ടോഗിൾ.
- ദോഷം: പൂർണ്ണ CLI പരിഹാരങ്ങളെ കുറിച്ച് കുറവ് സ്ക്രിപ്റ്റബിൾ.
- Open WebUI (+ Ollama/vLLM)
- നന്മ: ടീമിനായി സൗഹൃദപരമായ ഇന്റർഫേസ്, പ്ലഗിൻ സമ്പ്രദായം, മോഡൽ-അഗ്നോസ്റ്റിക്ക്.
- ദോഷം: രണ്ട് ഘടകങ്ങൾ കൈകാര്യം ചെയ്യണം; പ്രകടനം ബാക്ക്എൻഡിനോട് ബന്ധപ്പെട്ടിരിക്കുന്നു.
- നന്മ: പരമാ നിയന്ത്രണം, വമ്പൻ കമ്മ്യൂണിറ്റി എക്സ്റ്റൻഷനുകൾ.
- ദോഷം: പഠിക്കാൻ കഠിനമായ മുടക്കം; ഒരു ലാബ് ബഞ്ച് പോലെ തോന്നാം.
- നന്മ: ബാക്ക്എൻഡ് ഇല്ല, സ്വകാര്യപ്രധാനമുള്ള പ്രദർശനങ്ങൾ.
- ദോഷം: ബ്രൗസർ/ഉപകരണം പരിമിതികൾ; ഭാരം കൂടിയ ജോലി കാരണം അല്ല.
- നന്മ: ക്രോസ്-പ്ലാറ്റ്ഫോം വേഗം, പല ലക്ഷ്യങ്ങളിലേക്കും ഡിപ്പ്ലോയിംഗ്.
- ദോഷം: കൂടുതൽ ഡെവലപ്പർ പരിശ്രമം; ഉൽപ്പന്നം നിർമ്മിക്കുന്ന ടീമുകൾക്ക് ഉത്തമം.
യാഥാർത്ഥ്യമുള്ള ചെറിയ സാഹചര്യങ്ങൾ നിങ്ങൾ അത്ര കാര്യമായി ആലോചിക്കാതിരിക്കാന്
- സോളോ ഡെവലപ്പർ പ്രാദേശിക കുറിപ്പു സഹായകൻ MacBook Air-ൽ നിർമ്മിക്കുന്നു: Ollama ഇൻസ്റ്റാൾ ചെയ്ത്, 7B മോഡൽ Q4-ൽ ഓടിക്കുക, എംബെഡിങ്ങ് എന്റ്പോയിന്റ് ചേർക്കുക, ലളിത RAG ചെയിൻ ബന്ധിപ്പിക്കുക. നിങ്ങൾ കാപ്പി തണുത്തുമുമ്പ് പൂർത്തിയാകും.
- സ്റ്റാർട്ടപ്പ് 4090 ബോക്സും സ്ലാക്ക് ബോട്ടും: വേഗത്തിനായി vLLM ഉപയോഗിച്ച് മോഡലുകൾ സർവ് ചെയ്യുക. ആന്തരികമായി Open WebUI ഉപയോഗിച്ച് ഡവലപ്പർമാരല്ലാത്തവർക്കും പ്രോംപ്റ്റുകൾ പരീക്ഷിക്കാം. OpenAI-സമ്മതമാർഗ്ഗം ആപ്പ് കോഡ് സുതാര്യമായി സൂക്ഷിക്കുക.
- രിസർച്ചർ പേപ്പറിന്റെ 10 മോഡലുകൾ താരതമ്യം ചെയ്യുന്നു: LM Studio വേഗ തവണകൾക്കും ലോഗുകൾക്കും; Text Generation WebUI കൂടുതൽ സാമ്പിളിംഗ് നിയന്ത്രണങ്ങൾക്കും ദൃശ്യീകരണങ്ങൾക്കും.
- പാഠം പഠിപ്പിക്കുന്നവർ വിദ്യാർത്ഥി ഡാറ്റ പുറത്തായിരിക്കാതെ AI പ്രദർശിപ്പിക്കുന്നു: ബ്രൗസറിലുള്ള WebLLM ചെറുമോഡലിനൊപ്പം. മാജിക് നടന്നു.
ഗమనിക്കുക: Sider.AI നിങ്ങളുടെ AI കോ-പൈലറ്റ് ആകാം
നിരീക്ഷിക്കുക: മറ്റു തിരഞ്ഞെടുപ്പുകൾ നടത്തുമ്പോൾ Sider.AI പ്രോംപ്റ്റുകളും പ്രവാഹങ്ങളും വേഗത്തിൽ പരീക്ഷിക്കാൻ സഹായിക്കും, ബാക്ക്എൻഡ് മാറ്റുമ്പോൾ ജീവിതകഥ എഴുതാതെ. അത് ഒരു ബുദ്ധിമുട്ട് പരിശോധിക്കൽ പാളിയിടം പോലെ: പ്രാദേശിക Ollama മോഡൽ ഉപയോഗിച്ച് പ്രോട്ടോടൈപ്പ് ചെയ്യുക, vLLM എന്റ്പോയിന്റുമായി താരതമ്യം ചെയ്യുക, നിങ്ങളുടെ പ്രോംപ്റ്റുകളും ഡോക്യുമെന്റുകളും ഒരിടത്ത് സൂക്ഷിക്കുക. GPU തിരഞ്ഞെടുക്കില്ല, പക്ഷേ പരീക്ഷണങ്ങൾ 19 വ്യത്യസ്ത "final-final-v3" എന്ന പേരുള്ള ഫോൾഡറുകളിലേക്ക് പൊളിയുന്നതിൽ നിന്ന് തടയും. സജ്ജീകരണ നോട്ടുകൾ: “ഹലോ, മോഡൽ” വരെയാണ് എത്ര വേഗം എത്തുന്നത്?
ollama run mistral (അല്ലെങ്കിൽ llama3, phi3 തുടങ്ങിയവ)
- OpenAI-പോലുള്ള ക്ലയന്റ് ഉപയോഗിക്കുക
- ഉംറ്ച്ച ചെയ്ത ഹഗ്ഫേസിന്റെ മോഡൽ പാതയും GPU കോൺഫിഗും ഉപയോഗിച്ച് സർവർ ആരംഭിക്കുക
- ആപ്പിൽ നിന്നുള്ള OpenAI-സമ്മതപത്ര API വിളിക്കുക
- ലൈബ്രറിയിൽ നിന്നൊരു മോഡൽ തിരഞ്ഞെടുക്കുക
- റൺ ക്ലിക്ക് ചെയ്യുക; ഇച്ഛാനുസരണം പ്രാദേശിക സർവർ ടോഗിൾ ചെയ്യാം
docker run ഇമേജ് ഓടിക്കുക
- ഇടത്തരം ബാക്ക്എൻഡ് ആയി Ollama അല്ലെങ്കിൽ vLLM ഉപയോഗിക്കുക
- ടീംമെറ്റുകൾ ക്ഷണിക്കുകയും പ്രോംപ്റ്റുകൾ താരതമ്യം ചെയ്യുന്നതു ആരംഭിക്കുക
ഞാൻ ഡ്രൈവർ പ്രശ്നങ്ങൾ മറച്ചില്ല. Windows NVIDIA-ൽ ഡ്രൈവർസ്, CUDA അപ്ഡേറ്റ് ചെയ്യുക. macOS-ൽ Metal ആണ് ഭാരവാഹി. Linux-ൽ ਫോറങ്ങളിൽ മുകളിൽ പറയുന്നതേയുള്ളൂ അല്ലെങ്കിൽ നിങ്ങൾ പിടിച്ച് നാണംകെട്ടവനാണ്.
നിങ്ങളുടെ റണ്ണറിന overeenkomst ആയ മോഡൽ കുടുംബങ്ങൾ തിരഞ്ഞെടുക്കൽ
- Llama 3 മുതലായവ: മികച്ച സാധാരണ ചാറ്റിന്, റീസണിങ്ങിനും; റണ്ണറുകളിലും ക്വാണ്ട്ഫോർമാറ്റുകളിലും ശക്തമായ പിന്തുണ.
- Mistral/Mixtral: വേഗതയും കഴിവും സിമിതമുള്ള നല്ല ബാലൻസ്; Ollama, vLLM ലെ ജനപ്രിയ മോഡലുകൾ.
- Phi-3: ചെറുതും ശക്തവുമാണ്. CPU/Mac സജ്ജീകരണങ്ങൾക്കും വേഗമുള്ള പ്രകടനത്തിനും ഉത്തമം.
- Qwen, Gemma, DeepSeek വർഗ്ഗങ്ങൾ: കോഡിങ്ങിനും തથ്യപ്പെട്ട ചോദ്യോത്തരങ്ങൾക്കുമുള്ള പരീക്ഷണത്തിന് യോഗ്യമായവ; പലരും നല്ല ഇൻസ്ട്രക്റ്റ്-ട്യൂൺഡ് ഭാരങ്ങൾ ലഭ്യമാക്കുന്നു.
പ്രൊ ടിപ്പ്: ഉപയോഗത്തിന് അനുസരിച്ച് രണ്ട്-മൂന്ന് മോഡലുകൾ പരീക്ഷിക്കൂ. കോഡിങ്ങിന് “code” ട്യൂൺഡ്, ചോദ്യോത്തരത്തിനായി “instruct” ട്യൂൺഡ് മോഡൽ, ക്രിയാത്മകതയ്ക്ക് ചെറിയ മോഡലുകൾ വേഗത്തിൽ ഫലങ്ങൾ കാണിക്കാൻ കഴിയും.
പ്രശ്നപരിഹാരം മുറുകാതെ, കൊല്ലമായ്മില്ലാതെ
- CPU-ൽ ടോക്കൺ വേഗം മന്ദഗമനം? ചെറിയ ക്വാണ്ട (Q4) അല്ലെങ്കിൽ ചെറിയ മോഡൽ (7B) ഉപയോഗിക്കുക. വേണ്ടെങ്കിൽ മാത്രം കോൺടെക്സ്റ്റ് കൂട്ടുക.
- GPU VRAM പിശകുകൾ?.precision കുറയ്ക്കുക (4-ബിറ്റ്), ദീർഘകോണ്ടെക്സ്റ്റ് പകരം റോപ്പ് സ്കെയ്ലിംഗ് ഉപയോഗിക്കുക അല്ലെങ്കിൽ ചെറിയ അടിസ്ഥാന മോഡൽ പരീക്ഷിക്കുക.
- സ്റ്റ്രീമിംഗിലെ തടസം? ബാച്ചിംഗ് അല്ലെങ്കിൽ KV ക്യാഷ് വലിപ്പം പരിശോധിക്കുക; vLLM ഇവിടെ മികവാണ്. Ollama-യിൽ സമകാലീന അഭ്യർത്ഥന കുറവാക്കുക.
- വ്യത്യസ്ത ഔട്ട്പുട്ടുകൾ? സിസ്റ്റം പ്രോംപ്റ്റുകൾ പുനഃസജ്ജമാക്കുക, മറ്റൊരു ഇൻസ്ട്രക്റ്റ്-ട്യൂൺഡ് മോഡൽ പരീക്ഷിക്കുക അല്ലെങ്കിൽ ടോക്കൺതിരിക്കുന്ന ക്രമീകരണങ്ങൾ പരിശോധിക്കുക.
അവസാനത്തരം: LLaMA.cpp പകരം എന്ത് തിരഞ്ഞെടുക്കണം
- ഏറ്റവും സൗകര്യപ്രദമായ പ്രാദേശിക അനുഭവം , ലളിതമായ API കൂടുമ്പോൾ Ollama തിരഞ്ഞെടുക്കുക.
- വേഗം, സ്കെയിൽ, പ്രൊഡക്ഷൻ റെഡിയായി സർവർ വേണമെങ്കിൽ vLLM തിരഞ്ഞെടുക്കുക.
- പോളിഷ് ചെയ്ത ഡെസ്ക്ടോപ്പ് ആപ്പ് അനുഭവവും വേഗത്തിലുള്ള മോഡൽ കണ്ടെത്തലും വേണ്ടെങ്കിൽ LM Studio തിരഞ്ഞെടുക്കുക.
- പ്രോംപ്റ്റ് താരതമ്യങ്ങൾക്കും ടീം സഹകരണത്തിനും Open WebUI ചേർക്കുക.
- പവർ യൂസർ നിയന്ത്രണങ്ങളും ഗംഭീര പരീക്ഷണങ്ങളും വേണ്ടി Text Generation WebUI ഉപയോഗിക്കുക.
- ബ്രൗസർ-ഓരിയന്റഡ് ഡെമോകളും സ്വകാര്യതാ ഡെമോകളുമായി WebLLM ഉപയോഗിക്കുക.
രാത്രി പാലിക്ക Kernels കമ്പൈൽ ചെയ്യേണ്ട ആവശ്യം ഇല്ലാതെ മാത്രം വയ്ക്കുടുക്കാനും മോഡലിനോട് ചോദ്യങ്ങൾ ചോദിക്കാനും LLaMA.cpp മികച്ചതാണ് — എന്നാൽ ഈ ഐച്ഛികങ്ങളും അതുപോലെ നല്ലതാണ്. നിങ്ങളുടെ സമയം, നിങ്ങളുടെ ഹാർഡ്വെയർ, നിങ്ങളുടെ മാനസികാരോഗ്യം മാനിക്കുന്ന ഒരാളെ തിരഞ്ഞെടുക്കുക. പിന്നെ പ്രധാന കാര്യത്തിലേക്ക് മടങ്ങുക. നിങ്ങളുടെ മോഡലിനെ “Kind regards” എന്നു എഴുതാതിരിക്കാൻ വെളിപാടായി “Per my last email…” എന്നു എഴുതാൻ പഠിപ്പിക്കുക.
സ frecuentes ചോദിക്കപ്പെടുന്ന ചോദ്യങ്ങൾ (FAQ)
Q1: തുടങ്ങി തുടങ്ങുന്നവർക്കുള്ള ഏറ്റവും നല്ല LLaMA.cpp ഐച്ഛികം ഏതാണ്? Ollama അല്ലെങ്കിൽ LM Studio ഞങ്ങളാണ് ശുപാർശ ചെയ്യുന്നത്. ഇരുവരും പ്രാദേശിക മോഡലുകൾ ലളിതവും വേഗത്തിലും സൗഹൃദപരവുമാക്കുന്നു, കുറച്ചുപ്രവർത്തനവും ശക്തമായ മോഡൽ ലൈബ്രറികളും നൽകും. പ്രാദേശിക AI-യുടെ ശക്തി നഷ്ടമാക്കാതെ എളുപ്പം തുടങ്ങാം.
Q2: GPU ജോലികൾക്കായി vLLM LLaMA.cpp-യ്ക്കുൽ പെട്ടെന്ന് പ്രവർത്തിക്കുമോ? സാധാരണയായി ഉത്തരം ഒത്ത്; vLLM ഉയർന്ന ത്രൂപുട്ട് GPU ഇൻഫറൻസിനായി നിർമ്മിച്ചതാണ്, ബാച്ചിംഗ്, KV ക്യാഷ് ട്രിക്കുകൾ എന്നിവയുമായി. വേഗം കൂടുക ലക്ഷ്യമാണെങ്കിൽ vLLM ശക്തമായ LLaMA.cpp പകരമാണ്.
ചോദ്യം 3: RAG-നും ലോക്കൽ സെർച്ചിനുമായി LLaMA.cpp-ക്ക് പകരം മറ്റ് ആൾട്ടർനേറ്റീവുകൾ ഉപയോഗിക്കാമോ?
തീർച്ചയായും. LangChain അല്ലെങ്കിൽ LlamaIndex എന്നിവയുമായി ചേർത്ത് Ollama അല്ലെങ്കിൽ vLLM ഉപയോഗിക്കുക. നിങ്ങളുടെ ഡോക്യുമെന്റുകൾ ക്ലൗഡിലേക്ക് അയക്കാതെ തന്നെ സ്വകാര്യവും പ്രാദേശികവുമായ RAG നിങ്ങൾക്ക് ലഭിക്കും.
ചോദ്യം 4: Apple Silicon-ൽ macOS-ന് ഏറ്റവും അനുയോജ്യമായ ആൾട്ടർനേറ്റീവ് ഏതാണ്?
Ollama-യും LM Studio-യും Metal ആക്സിലറേഷനോടുകൂടി Apple Silicon-ൽ മികച്ച രീതിയിൽ പ്രവർത്തിക്കും. Mistral, Llama 3, Phi-3 പോലുള്ള ചെറിയതും ഇടത്തരവുമായ മോഡലുകൾ വേഗത്തിൽ പ്രവർത്തിക്കുകയും ഫാനുകൾക്ക് അധികം ശബ്ദമുണ്ടാക്കാതിരിക്കാനും സഹായിക്കും.
ചോദ്യം 5: ഈ ആൾട്ടർനേറ്റീവുകൾ ഉപയോഗിച്ച് മികച്ച ഫലം ലഭിക്കാൻ എനിക്ക് GPU ആവശ്യമുണ്ടോ?
GPU സഹായകമാണ്, പക്ഷേ അത് നിർബന്ധമല്ല. ക്വാಂಟൈസ് ചെയ്ത 7B–8B മോഡലുകൾ ഉപയോഗിച്ച്, CPU-ലുള്ള Ollama അല്ലെങ്കിൽ LM Studio എന്നിവയ്ക്ക് മികച്ച ചാറ്റ് പെർഫോമൻസ് നൽകാൻ കഴിയും. വലിയ വർക്ക്ലോഡുകൾക്കോ വലിയ മോഡലുകൾക്കോ, GPU-യുള്ള vLLM മികച്ചതാണ്.