በአንድ እሁድ ማታ LLaMA.cpp ለመኮነን ሞክረው እንደሰማችሁ ስርዓት በመፍጠር እንቅስቃሴ ከማይሆን ቻትቦት መሆኑን ሲያስተውሉ? እኔም እንደ እርስዎ ነኝ። ኮምፒውተር በጣም ነፋስ ከፍ ሲል እንደ Top Gun ሊደርስ እንደሚፈልግ ደረስሁ። ጥሩ ዜናው: ጥሩ የአካባቢ AI እንዲሰራ ለመስራት LLaMA.cppን መጠቀም አለብዎት አይደለም። በቀላሉ ለመተከል የተደጋጋሚና የGPU ምርት የሚሰጡ ከLLaMA.cpp በተለያዩ አማራጮች ያሉ መሣሪያዎች አሉ።
ይህ መመሪያ የተለያዩ LLaMA.cpp አማራጮችን ለምርጫዎ መንገድ ነው። የሚጠቀሙትን ማን እንደሆነ፣ እንዴት እንደሚገነባ ፣ በተለመዱት መሳሪያዎች (እንደ NASA ላብ አይደለም) እንደሚታየው ምን ያህል የውጤት እንደሚኖር እና በየቀኑ የሚደረጉትን ማስተካከያዎች - ከኳንታይዜሽን እስከ ሞዴል ለውጥ እና እቅድ ማስተካከያ - እንዴት እንደሚቀላልፋ እሰራለሁ።
የግድ ማስታወቂያ፡ ምናልባት “LLaMA.cpp አማራጮች” ብለው የፈለጉት ሶስት ነገሮች አሉ—ቀላል ማቅረብ፣ በሃርድዌርዎ ላይ በፍጥነት መንቀሳቀስ ወይም ደስተኛ የአንድ አሰራር ሁኔታ ማግኘት። እንግዲህ ከ40 ትካላ በላይ በሚገኙበት ፍላጎት ውስጥ አይገዛም።
ፍጥነት ማቅረብ እንደተፈለገው ምን እንደሚያስፈልግ፡ LLaMA.cpp እንደ ተቃራኒ የሚወሰድ
- አንድ አንቀሳቃሽ አካባቢ AI የሚፈልጉ ከሆነ፡ LM Studio ወይም Ollama አስበው።
- እንደ በርካታ ተግባራት የአፕሊኬሽኖች ተስማሚ አገልግሎት/API ፣ ከሳሽንን እና ከኳንታይዜሽን ጋር፡ Ollama ወይም vLLM እንደ መምጣት ማለት ነው።
- ከGPUs የሚጠንቀቅ ተብላ ወይም አንድ ጠንካራ ካርድ በመጠቀም ያለ፣ የተመጣጠነ ፍጥነት ማስገባት እንደሚፈልጉ፡ vLLM።
- የPython መጀመሪያ ፣ ባትሪዎች ተደርጓቸው የሆነ መደበኛ መልክ ለRAG እና ኤጀንቶች፣ LangChain እና እንደ Ollama ወይም vLLM ያሉት የጥናት ከተማ አካል።
- በብራውዘር ውስጥ የሚሰራ ተሞክሮ ቦታ፣ ከፍተኛ እንቅስቃሴ የለም፡ WebLLM ወይም Open WebUI (ከ Ollama ወይም ከ vLLM ጋር ተመሳሳይ)።
አዎን፣ ሌሎችም አማራጮች አሉ። እነዚህ ሁሉም አስፈላጊ አይደሉም። ከLLaMA.cpp የተለያዩ አማራጮችን እና ምን ጊዜ እንደሚመለከቱ እንውስናውን እንፈትሻለን።
Ollama፡ “በጣም ቀላል የሚሰራ” የአካባቢ ሞዴል አስከፊ
ከLLaMA.cpp በሺ ተጨማሪ የተያያዘ ስለሚሆን ቢሆንም፣ Ollama ለተጠቃሚዎች ሦስት መሣሪያዎች—ማቀናበሪያ፣ መቆረጫ እና ኮርክስክሩ—አንደኛ፣ ንፁህ እና ቀላል ጠቃሚ በኩል ያሰቀለ ነው።
- ለምን አማራጭ ነው፥ በቀላሉ ሞዴሎችን ማውጣት፣ ኳንታይዜሽን ለእርስዎ ማቀናበር፣ ቀላል ሞዴል ፋይሎች (Modelfiles) ተጠቃሚ ስርዓት ለማቆም። የአካባቢ HTTP APIን በመተግበር እንደ OpenAI መሳሪያ እንዲጠቀምበት ይፋ ያደርጋል።
- የመግኛ ሁኔታ፡ መተግበሪያ አቋም።
ollama run llama3 (ወይም የወደዱት ሞዴል). ጨርስ። 14 እርምጃ ያለው ክፍተት አይደለም።
- አፈፃፀም፡ በCPU እና GPU ዘርፍ ጠንካራ ድጋፍ እና በቀድሞ የተሰሩ ኳንታይዜሽን (Q4, Q5, Q8). በታላቅ ዲታሴንተር GPU የተሻለ ፍጥነት እንዲሁም ላፕቶፕ እና ዴስክቶፕ ላይ በተስፋ ይሰራል።
- በጥሩ: በአካባቢ አፕሊኬሽኮች ለሚሰሩት ደብለኞች፣ ፍጥነት እና ስሜት የሚፈልጉ ተጫዋቾች፣ እና አንድ ትንሽ የMLOps እና ትንሽ እንቅስቃሴ የሚፈልጉት ማንኛውም ሰው።
- ጥሩ ተጨማሪዎች፡ የሞዴል ቤተ-መና፣ ቀላል ፕሮምፕቲንግ፣ እቅድ ድጋፍ፣ እና መንገዳዊ UI እንደገና የሚሰበሰብ ባለሁሉ።
ማን አይጠቀምበትም? በበለጠ ላይ በሚሰሩ ጊዜ በበርካታ GPUዎች የሚጠቀሙ እና በፈጥነት ለእንደባት ፍስስ የሚያስፈልጉ ከሆነ እርስዎ vLLMን ትፈልጋላችሁ።
vLLM፡ ለGPUs ከፍተኛ የፍጥነት አሳዳጊ
LLaMA.cpp አጠቃላይ በየትኛውም ቦታ መሥራት ይችላል። vLLM እጅግ እጅግ በGPU ላይ እንዲሰራ ይፈልጋልና አንድ እንደ ግንባር ልክ ይመልሳል። እንደ ጠፍታ ወደ ፍጥነት መንገድ መሄድ ነው።
- ለምን አማራጭ ነው፥ ፍጥነትን እና ተመጣጣኝ እንዲሆን የተመሰረተ፣ ከPagedAttention እስከ ወጣብ ኬችን አስተዳደር በላይ የተሻለ ባህሪያት አሉት። በብዙ ማህበረሰብ ማዕከላዊ አካላት ይሠራል።
- የመግኛ ሁኔታ፡ Python, CUDA, አሳሾች—አዎን ትንሽ ከባድ ነው። ነገር ግን አንደኛ ፍጥነት ይሰጣል።
- አፈፃፀም፡ NVIDIA GPUs ላይ እጅግ ጥሩ፣ ረጅም እና ብዙ እኩል ጥያቄዎች ላይ ይበራል።
- ለምን: የAPIዎችን ጣቢያዎች የሚያስተናግድ፣ የስራ ቡድኖች፣ ከባድ ስራዎች፣ ወይም “tps” ቋንቋ ለሚያውቁና የሚወዱ ሰዎች።
- ተጨማሪዎች፡ OpenAI-ተስማሚ የሰርቨር ሁኔታ፣ የተስፋፋ ትራንስፓርንቲዝም፣ ቀጥተኛ ባችንግ፣ ረጅም እንቅስቃሴ ድጋፍ።
ይህን ያስተውሉ፤ ብቻ CPU ብቻ ከሆነ ወይም አሳሾችን ማስገባት ከለም ከሆነ፣ Ollama ወይም LM Studio ይሻላል።
LM Studio፡ አከባቢ ሞዴሎች የሚያገለግል ተወዳጅ ዴስክቶፕ ስቱዲዮ
ይህ “በጥሩ አፕ መስኮት እና ሮን ቡታን እፈልጋለሁ” ምርጫ ነው። LM Studio ለሞዴል ማስተናገድ እንደ AirBnB ነው፤ ንፁህ፣ ተስማሚ እና ሚና መብራት እንደሚገኝ ያሰማል።
- ለምን አማራጭ ነው፣ አገልግሎታቸው፡ ሙሉ GUI ያለው፣ የተመረጡት ሞዴል ገበታ ያለው፣ አካባቢ ቻትና እንዲሁም OpenAI አማራጭ የሰርቨር ሁኔታ ለማቅረብ የሚችል።
- የመግኛ ሁኔታ፡ ይዘው ይለውጡና ቀላል ከተመረጠ ሞዴል run ይጫኑ። በሆላባም ስላይነሮችና ገበታዎች ተመልከቱ።
- አፈፃፀም፡ ከሌሎች ተስማሚ ማዕከላዊ ሞዴሎች ጋር እኩል፣ በአዳዲስ መንገድ የሚሰራ (Metal) እና Windows/Linux ላይ ተስማሚ።
- ለምን: ደራሲዎችን፣ ትንታኔ አዋቂዎችን እና በ GUI ላይ ለማስተካከል በፈለጉት የመስመር ላይ ይሻላሉ፤ “ለእንቅስቃሴው በእኩል 5 ሞዴሎችን መፈተሽ” ይህን እንደ እርስዎ ከፍ ይላሉ።
- ጥሩ ተጨማሪዎች፡ የፕሮምፕት አብነቶች፣ የልዩ ንግግር ታሪክ፣ ከማንኛውም ታኬን የሚታይ እና በmacOS ላይ ጥሩ ድጋፍ።
GUI ከሰው ቢበሉ፣ CLI ብቻ የሚናገሩ ሰዎች ለ Ollama ወይም vLLM ይሻላሉ።
Open WebUI + አንድ ከተማ ማስተናገድ (Ollama/vLLM): የተለያዩ አቀማመጦችን የሚቀበለው መቆጣጠሪያ
Open WebUI ፈጣን እና ቀላል አስተዳደር ያለው የመስመር ላይ አውታረ ገጽ ነው፤ Ollama ወይም vLLM እንደ ተንቀሳቃሽ ሞተር ይሰራሉ። በተቀላቀለ ሁኔታ በሚታወቀው ሁኔታ አማራጭ የLLaMA.cpp ስርዓት ነው።
- ለምን አማራጭ ነው፥ ከተማውን እንደኛ መቆጣጠሪያ ይዞመዋል በመጠቀም እና በአማራጮቹን የተቀዳቅሮ የመነሻ ቦታን ይሰጣችሁ።
- የመግኛ ሁኔታ፡ Docker ወይም አንድ መስመር እንደተጠቀሱ። ወደ ሞዴል አገልጋይዎ አሳይ።
- አፈፃፀም፡ ከከተማው ደረጃ ይሰራል፤ ፍጥነት ለvLLM፣ ቀላልነት ለOllama።
- ለምን: ትንሽ ቡድኖች፣ ላቦራቶሪዎች፣ ወይም እንደ አንድ ማእከል እንዲሆኑ የሚፈልጉት የፕሮምፕት ፈተናዎችን ለማድረግ፣ ለሞዴል እና ለቻቶች ለማካፈል።
Text Generation WebUI፡ ለመሳሪያ እና ለመጫወቻ ቻሪክ
አዎን፣ እንደገና አለና ለበጎ ጭነት ባለቤት ለተመረፈው ይወዳል በሚባል ቻሪክ ሰዎች።
- ለምን አማራጭነት፡ ብዙ እትም በማስተካከል፣ ኳንታይዜሽን መቆጣጠሪያዎችና ለሞዴል ለውጦች።
- የመግኛ ሁኔታ፡ ቀላል አይደለም፣ ነገር ግን ተመልከት ጣቢያዎች እና መቆጣጠሪያዎች ይችላሉ።
- ለምን፣ ለፍላጎት የሚፈልጉት: ለሞዴሎች ቢያንስ በተለያዩ ፎርማቶች ፣ በ ምቹ ጣቢያ ማስተካከያ እና እንዲሁም ቅጥር ነባሪ ፖለቲካዎች።
WebLLM፡ ሞዴሎች… በብራውዘርዎ ውስጥ
እውነት ነው፤ በChrome በቀጥታ LLMsን እንድትሣሩ እቃ ነው። ይህ የሚሰራ ለመሆኑ ሳልሆን፣ ለምሳሌዎች፣ ትምህርት እና ለግለሰብ ጥናቶች ግሩም ነው።
- ለምን አማራጭ፡ የኋላ የተሰራ ቢሆንም ይህ ቢታሰር ፣ በመስክ ውስጥ ተሞክሮና ለማጋራት በቀላሉ የሚጠቅም።
- የመግኛ ሁኔታ፡ አንድ ድህረ ገፅ ክፈት። አንዳንድ ጊዜ እንደ ሞዴል ፋይል መሞላት አለብዎት።
- ለምን፣ ለታንኳል ቻት፣ ክፍለ ቤተማዎች ምሳሌዎች፣ በግለሰብነት በመመረብ የሚደርስ ሁኔታዎች እና “እዚያ እንደሚሰራ?” ያለ ብረት ሰዎች።
MLC/MLC-LLM፡ በተለያዩ መንገዶች ላይ የሚሰራ በሃርድዌር የተሻለ እና በይነገጽ የተሻለ አምጣጥ
“አንደኛ ጊዜ ኮምፓይል አለ፣ በብዙ መሣሪያዎች በፍጥነት እንዲሰራ” ተግባር ተፈልጋለች ከሆነ የMLC ኢኮሲስተም የወዳጁ ነው።
- ለምን አማራጭ፡ አንድ ጣቢያ በመተግበሪያ ከMetal (Apple)፣ Vulkanና CUDA በመሰረት፣ ጋር ለመሰረት ይሰርዝ። ኳንታይዜሽን እና እንቅስቃሴ እና ድጋፍ እንደገና።
- የመግኛ ሁኔታ፡ የአነስተኛ ደረጃ ስራ እንደሚፈለግ ደረጃ። ከፍ ሲል ግን ተጠቃሚነት ትርፍ ነው።
- ለምን፡ በMac, Windows, በሞባይል የሚሰጥ አፕሊኬሽኖችን ከፍ ያለ አካል ወይም በተመሳሳይ አፈፃፀም ይኖራቸዋልና ማእከላዊ ድርጅቶች።
llama.cpp ከዓለም ሌሎች፡ እንዲህ እንደሚለው ምን ይለያል?
በሰው ቋንቋ እንትርጉም፡
- ትከሻ እንቅስቃሴ፡ በቀላሉ በአባል አማርኛ ሊሆን ይችላል፣ ነገር ግን ሲፈልጉ በGPU ላይ ለማስተካከል ፍላጎት ከፍ ይላል። Ollamaና LM Studio በ“አግባብ እና እንቆቅልሽን አትሞሉ” እንደሚለው ይሸኛሉ።
- API እና አፕሊኬሽኖች፡ LLaMA.cpp ደርሰኛ ውስጥ ያሉ ሰርቨሮችና መያዣዎች አሉ፣ ነገር ግን Ollama/vLLM ለመተግበሪያ ጀርባ ቤት በተለያዩ የHTTP አገልግሎት፣ ቢችንግ እና OpenAI ተስማሚ እንደ መንገዶች ይሰራሉ።
- GPU ፍጥነት፡ vLLM ትልቅ ኮምፒውተር GPUዎችን በግልጽ የፌስት ምግብ እንደሚበላ። LLaMA.cpp በከባድ ማህበረሰቦች በተለያዩ ቦታዎች ላይ ሲሰራ ነው፣ ነገር ግን ፍጥነት ከፍ ከvLLM የሚሰጠው ስለሆነ ነው።
- GUI ፍራፋት፡ LM Studioና Open WebUI ዘመናዊ እና ተለጣፊና እንደሚመስሉ ጥሩ እና ተርፎ ያላቸው ናቸው።
- በብዙ ሞዴሎች ላይ ለመለዋወጥ እና መንፈሳዊ ስራዎች፡ Ollama ሞዴሎችን እና ኳንታይዜሽን በቀላሉ ያጥራል። Text Generation WebUI ለጥሩ ቁልፍ ቁጥር ጥቅሞች በተለያዩ ተደራሽነት ያለው አማራጭ ነው።
በሃርድዌር እና በተጠቀምበት ፓር ከሚመርጡት የተለያዩ አማራጮች መርጫ
እነዚህ እውነተኛ ሰው ለመጠቀም ያስፈልገው የመንገድ አቀማመጥ ነው።
- ከ CPU ብቻ ያለው ላፕቶፕ? Ollama ወይም LM Studio ይምረጡ። ትንሽ ዝቅተኛ ኳንታይዜሽ (Q4/Q5) ሞዴሎችን ይጠቀሙ። በከፍተኛ 3–8 ቶክኖች/ሰከንድ ገብስ እንደሚቀርበው ደስ ይላችው።
- አፕል ሲሊኮን ማክ? Ollama ወይም LM Studio ከ Metal መንቀሳቀስ ጋር። Llama 3፣ Phi-3 ወይም Mistral ያካትቱ። በፍጥነት እና በትንሽ ድምብ መለመን ይሰሙ።
- አንድ የሚጠቀሙ Ƞ⒪ɇƬ GPU (ለምሳሌ 3060–4090)? ፍጥነት እና API እንደሚፈልጉ vLLMን ይሞክሩ። ቀላል አካባቢ የሚፈልጉ Ollama ይምረጡ።
- ብዙ GPU ወይም አገልግሎት ከፍተኛ? vLLM። ቢችንግ፣ ረጅም እንቅስቃሴና የዳስተም ዝግጅት እንዲሁም የደስታ ግራፎችን ይደርሳሉ።
- በቢሮ ስላሉ ብዙ ሰዎች ከሚጠቀሙ ሁኔታ አንድ የቢሮ UIን ትፈልጋለህ? Open WebUI + Ollama ወይም vLLM አጠቃላይ ነው።
- በፍጥነት በመጠቀም እና በብዙ አማራጮች ላይ በትክክል የሚሰሩ ሰዎች ከሆነ Text Generation WebUI።
- በብራውዘር ውስጥ ግልሰብነት ወይም ምሳሌዎች ማድረግ ከፈለጉ WebLLM ይጠቀሙ።
ያለ ማስታወቂያ ያለው የአፈፃፀም ጥቅም
- ትንሽ ሞዴሎች (3–8B): ምንም እንኳን በCPU ላይ ኳንታይዜሽን ሞዴሎች በቀላሉ እንደቻት ይቀራሉ። በM-series Macs ወይም በመካከለኛ አካል GPUዎች ላይ፣ እንደ በቅሎ ይባላሉ።
- መካከለኛ ሞዴሎች (13–34B): 12–24GB+ VRAM ያላቸው GPUዎችን ይፈልጋሉ። በ24GB VRAM ላይ 13B–14B ሞዴሎች በ4/5 ቢቶች ኳንታይዜሽ እንደ ዝምብ በቻት እና በኮድ ይብላሉ።
- ታላቅ ሞዴሎች (70B+): ይህ የቡድን ወይም A100/H100 ስፍራ ነው። ከአካባቢ ሲጠቀሙት፣ ማርገብ፣ ሊሞግቦ ወይም ሌሎች የሰርቨር መልክዎችን ይጠቀሙ።
የአሰራር ሙከራዎች፡ Modelfiles፣ አሳሳቢዎች እና ከተማ ሚስቲክንነት
- Modelfiles እንደ Dockerfiles ለLLMs የ Ollama ናቸው። በመጀመሪያ ሞዴልን ትክክለኛ አድርጉ፣ ሲስተም ፕሮምፕቶችን ያክሉ፣ አሳሳቢን አክሉ እና በፈጣን ቀድሞ።
- vLLM የOpenAI ተስማሚ ሰርቨር ማለት አፕሊኬሽን ኮድዎን እጅግ እንደገና አያስፈልግም። እንዲሁም KV ኬችንን በተሻለ እንደ ሞሩር ያስተዳድራል ርዝመት ያሉ ሰነዶች የእንደዚህ የማህበረሰብ አልጎሪዝሞችን አይገባውና።
- Text Generation WebUI ለLoRA፣ ኳንታይዜሽንና ቅኝ የማድረግ ስርዓቶች በእጅ መቆጣጠሪያዎች ያገለግላል። ለፕሮምፕት ሙከራዎች እና የማስተካከያ ቅርጸት ጥሩ ነው።
RAG እና ኤጀንቶች፡ መርጫዎን ይምረጡ፣ እቃዎችን ያክሉ
Retrieval-augmented generation (RAG) አሁን ብዙዎቻችሁ በውስጥ ላይ ያላችሁ ነው-ከሰነዶች፣ ትኬቶች ወይም PDF ላይ ጥያቄዎችን ያስረክባሉ ወይም መላውን መለኪያ ሳይላንስ እንዳይሆን በደህና እና ከዘርፋዊ ውሃ ሰብስ በቀላሉ እናንተን ያግዙ።
- ከተማው: ፍጥነትና ትኩረት ከፈለጉ vLLMን ተጠቀሙ፤ ለደብለኞች እና ለትንሽ ቡድኖች ከተማው ለ Ollama ይሆናል።
- መንደር፡ LangChain ወይም LlamaIndex ለሰነዶች ማቆም፣ እቅድ ማመንጨትና ማከማቻ ያደርጋል።
- እቅድ፡ ብዙ ማስከተል አውቆ በአካባቢ እቅድ ደረጃዎችን ያሳያል። ካልኖረው የተለያዩ ከተማ እቅድ ሞዴሎችን ይደርጉ።
- ጠባብ እና ጥንካሬ፡ ከዚህ የሚያጋሩ የPII ማሰሻና፣ የምስክርነት መንገዶች አሉ።
ወጪ፣ ግልሰብነትና ቁጥ控制 የምንፈልጋቸው የማስፈለጊያዎች
- ወጪ፡ LLaMA.cpp ክፍት ምንጭ ነው፣ እንዲሁም የተለያዩ አማራጮች እንደዚሁ ናቸው። የእርስዎ ክፍያ ኃርድዌርና ኤሌክትሪክ ነው። vLLM በ GPUs ላይ በተሻለ ነገር እንዲሰራ ይረዳል፤ Ollama ከደረጃ አየር ኬአፒይ ማለት ይቈላል።
- ግልሰብነት፡ አካባቢ እንዲሁም አቅርቦት ያላቸው ተጠቃሚዎችን አቅርቦት አያደርጉም። ይህ ለህግ፣ ለሕክምና ወይም “በማህበረሰብ መማሪያ ላይ የእቃዎን መረጃ አልፈልግም” አቋም በጣም አስፈላጊ ነው።
- ቁጥር ቁጥር: ከModelfiles፣ አሳሳቢዎችና ከክፋሎች ጋር፣ ከጭራሽዎች ጋር በጥያቄ ነገር አይደለም። ሞዴሎችን መቀየር በፈለጉ—Mistral ዛሬ፣ Llama 3 ነገ፣ Phi-3 ሲፈለግ ትንሽ እና የብልህ።
እርግጠኛነትና አፍታዎች (አጭር፣ ቀልጣፋ፣ ዝቅተኛ የሆነ)
- እርግጠኛነት፡ በጣም ቀላል፣ ጥሩ መደበኛዎች፣ ለላፕቶፕ ጥሩ፣ ጥሩ API።
- አፍታዎች፡ በተለይ ከፍተኛ ፍጥነት እንደማይወጡ፤ ከስራ ላቦራቶሪ መሣሪያዎች አስቸጋሪ ቁልፎች ዝቅተኛ ነው።
- እርግጠኛነት፡ ከፍተኛ የGPU ፍጥነት፣ ቢችንግ፣ ረጅም እና ለምርት የተስፋሚ።
- አፍታዎች: ከባድ መግኛ፣ GPU ማስፈለግ ለማግኘት።
- እርግጠኛነት፡ የተሠሩ የGUI ፣ ቀላል የሞዴል ፈልጋት፣ በፍጥነት እና በቀላል የሰርቨር ተጠቃሚነት።
- አፍታዎች፡ ከ CLI መፍትሄዎች የተለየ እንደማይሆን።
- Open WebUI (+ Ollama/vLLM)
- እርግጠኛነት፡ ቡድን-መለዋዋጭ አገልግሎት፣ የፕላጊን ኢኮሲስተም፣ ሞዴል አማራጭ።
- አፍታዎች፡ ሁለት የሚሠሩት ክፍሎች ማስተናገድ፤ አፈፃፀም በመነሻ ክፍል ይገጣጣል።
- እርግጠኛነት፡ ምንም በብዙ አገልግሎቶች ቁልፎች።
- አፍታዎች፡ ጽኑ መማር ክምር አለበት፤ መስክ ላይ መሰረት ያለም።
- እርግጠኛነት፡ የኋላ መሣሪያ የለም፣ በግልሰብነት ምሳሌዎች።
- አፍታዎች፡ በብራውዘር/መኪና ሃይል ተወላጅ፣ ለከባድ ስራዎች አይሆንም።
- እርግጠኛነት፡ በተለያዩ ላይ የሚሰራ ፍጥነት፣ እንዲስራ ለብዙ አይነት እቃዎች እንዲሰጥ ዝግጅት።
- አፍታዎች፡ አንደኛው በስራ እንቅስቃሴ ትርፍ ከፍተኛ ነው። ለብዙ ቡድኖች ማምጣት ይሻላል።
ከግል አሰራር እስከ ስራ ልማት በላይ ያልተጨማሪን ችግሮች አይደሉም
- በMacBook Air ላይ አንድ በተለያዩ ኪዎች የአካባቢ ማስታወሻ ሠራተኛ፡ Ollamaን አጭር ኮድ 7B በQ4 እንዲሰራ ያክሉ፣ እቅድ ማስገባት እና ቀላል የRAG ተከታይ ማድረግ። በቡናዎ ከቀዛ በፊት ይተከናዋል።
- 4090 ያለው ፓርቲ እና በSlack ቦት ያለው አንድ እንደሆነ፡ ሞዴሎችን በvLLM አጠቃላይ እንዲሰጥ፣ ለተለያዩ ሰዎች Open WebUI እንዲያስተናግድ፣ እንዲሁም OpenAI-ተስማሚ እንደ API መንገድ አክሉ።
- ለጥናት በፈለጉት 10 ሞዴሎችን እንዲነጋገሩ፡ በፍጥነት ለማጣራት LM Studio ወይም ለበለጠ ዝርዝር መቆጣጠሪያዎች እና ለምርጥ ቅርፀ ቅኝነት Text Generation WebUI ይሻላሉ።
- በኮርስ ቻት ውስጥ ያልነበረ የተማሪዎች መረጃ ሳይወጣ ለመምህር የAI ግልስ ማሳያ፡ WebLLM በብራውዘር እና በትንሽ ሞዴል ጋር። ማማሚያ ተከፍቷል።
እንደሚያስታውሱት፣ Sider.AI እዚህ እንደ AI እንደሚሰራ እንደ አጋር ይሆናል።
ማስታወቂያው: በምርጫ ላይ ቢሆኑ የ< a2>Sider.AI</a2> ፕሮምፕቶችንና በስራዎች ፈጣን ሙከራ በቀጣይ እንደ ሚያደርግ፣ ከ vLLM መንገድ በማስተካከል ሳይንዲይ እንደሆነ ይረዳል። GPUዎን አላስቀረበም፣ ነገር ግን ፕሮምፕቶችንና ሰነዶችን በአንድ ቦታ ያደርጋል እና በ 19 በሚለው ፎልደር ተዘይቷል።
የመግኛ ፎቶዎች፡ “ሰላም ሞዴል” እንደተናገሩ በፍጥነት ማመን።
ollama run mistral (ወይም llama3, phi3 ወዘተ)
- ከOpenAI የተመሠረተ እንደገና ተጠቃሚ ጠይቅ
- ከHugging Face ሞዴል መንገድና GPU ቅኝቶች ጋር አስጀምር ሰርቨር
- ከአፕሊኬሽን ወደ OpenAI ተስማሚ API እንዲጠይቁ ይጠይቁ
- Run ተጫን፤ እንደከፍተኛ አስተዳደር ማድረግ ትችላለህ
- አንድ በ Ollama ወይም vLLM እንደተመሳሰሉ መስመራዊ አደረጃጀት ታስከትላለህ
- ባለቤቶችን ይጋብዙ እና ፕሮምፕቶችን ይነጋገሩ
አይፈልጉትም እኔ ሳለሁም አሳሾችን አልተጠቀምሁም። በWindows በNVIDIA ከሆነ አሳሾቹንና CUDAን አዘምን። በmacOS ሲሆን Metal ያስተዳደርበታል። በLinuxም አሁንም እንዴት እንደሚሰራ ታውቃላችሁ ወይም በፎረሙ እንደሚያፈሩ።
በመሣሪያዎ ትክክለኛውን የሞዴል ቤተሰቦች መምረጥ
- Llama 3 እና ጓደኞቹ: መደበኛ የሆነ ቻት እና ማስታወቂያ; በብዙም ሞዴሎችና የተሻለ ኳንታይዜሽን።
- Mistral/Mixtral: ምንጭነትን እና ብቃት እንደሚጠቆመው አስደናቂ ሚዛን፤ በOllama እና vLLM ቦታ ተለዋዋጭ።
- Phi-3: ትንሽና ጠንካራ። ለCPU/Mac ሁኔታዎች እና ፈጣን ምላሽ ምርጥ።
- Qwen, Gemma, DeepSeek ተለዋዋጮች: ኮድና እውነተኛ ጥያቄና መልስ ለማድረግ እንደሚገባ ጥንካሬ አሉ። ብዙ ጥሩ የተማሩ ክብ ናቸው።
ለተለያዩ ጥቅሞች ሁለት ወይም ሶስት ሞዴሎች መሞከር አስተያየት። ለኮዲንግ “ኮድ” ከተለያዩ ሞዴሎች። ለQ&A “አመንዝራ” ሞዴል። ለፈጠራ አንዳንድ ትንሽ ሞዴሎች በፍጥነት ያሰናዳሉ።
እስካሁን እንቅስቃሴ ከማይኖረው ለግልጽ ማጽነት ለፍላጎቶች
- ሰዓታት በCPU ላይ እንደሚቈጥቡ ይዘው ትንሽ ኳንታይዜሽ (Q4) ወይም ትንሽ ሞዴል (7B) ለማድረግ። እንደ ማስፈለግ ብቻ ኮንቴክስት አስተዳደርን ከፍ ያድርጉ።
- በGPU ላይ VRAM ስህተቶች? ዝቅተኛ ጥራት (4-bit) ይጠቀሙ፣ ሪፕ ስኬሊንግን ለረጅም ኮንትሮሌር እንዲሁም የትንሽ መሠረታዊ ሞዴል ይሞክሩ።
- ቅራጽ የማይተረፉ? ቢችንግ ወይም KV ኬች እንዴት እንደሚኖሩ ይመልከቱ፤ እዚህ ላይ vLLM ጥሩ ነው። በOllama ላይ ብዙ ትእዛዞችን ከፍ አያድርጉ።
- የማይረባ ውጤቶች? ስርዓተ ፕሮምፕትን እንደገና አስጀምሩ፣ ሌላ አስተያየት ሞዴል ይሞክሩ ወይም የቶክን ቅርጸ ቃላትን ያረጋግጡ።
መጨረሻ፡ ከLLaMA.cpp የተለያዩ አማራጮችን ምን እንደምትምረጡ
- Ollamaን ይምረጡ እንዲቀላል በአካባቢ ስራ እና ቀላል API ከፍተኛ እንግዳ ጋር።
- vLLMን ይምረጡ። ፍጥነት፣ እንዲሁም ጥሩ ሰርቨር።
- LM Studioን ይምረጡ። ጥሩ የዴስክቶፕ አፕ እና አጋልጦ የሞዴል ፈልጋት ተሰጥቷል።
- በፕሮምፕት ግንዛቤ ላይ ተሳትፎ ከፈለጉ Open WebUI ይጨምሩ።
- Text Generation WebUI ከፍተኛ የተጠቃሚ መቆጣጠርና ጥልቅ ሙከራ ከፈለጉ ይጠቀሙ።
- WebLLMን ለበብራውዘር መዝገብና ለመምሳሌዎች ግል ጥበብ ለማስያዝ ይጠቀሙ።
እራት እንዲሆን ድንጋጤ ላይ ሊያሰሩት የሚችሉ ተቀዳዳሪዎች ሲኖሩ ላለፉት ፈቃድም የለም። LLaMA.cpp ጥሩ ነው—እነዚህም እንደዚህ አማራጮች ናቸው። የዘመናዊ እነዚህን ምርጫዎች ምረጡ፣ የጊዜዎን፣ የሃርድዌሩን፣ እና የስሜትዎን አክብሮት ጠብቁ። ከዚያም ወደ አስፈላጊ ነገሮች ይመለሱ። እንደ “በመጨረሻ ኢሜል በእኔ እንደተናገርኩት በጥሩ መንገድ ‘Kind regards’ ሲል ሲሰጥ ተቋም ለመላክ” እንዴት አስተምሯት።
መጠየቂያዎች
Q1: ለመጀመሪያ ጥሩ LLaMA.cpp አማራጭ ማነው?
Ollama ወይም LM Studio ይጀምሩ። ሁለቱም አካባቢን ሞዴሎችን ቀላል፣ ፍጥነት እና ተስማሚ በትንሽ ቅኝት እና በብሉት እቃዎች ማብቂያ ናቸው። አካባቢ AIን እንደገና አዳዲስ እና ቀላል ለማድረግ ተወዳጅ ሙከራ ይሰጣል።
Q2: vLLM ከLLaMA.cpp በ GPU ላይ ፍጥነት ይሻላል?
በአጠቃላይ አዎን። vLLM ለስፋት ያለ ፍጥነት እና በGPU ላይ የተሻለ እንደተሰራ ነው፣ በቢችንግ እና በከፍተኛ ማስተናገድ ባለት። ፍጥነት በስፋት ተፈለግ ከሆነ ይህ vLLM ከLLaMA.cpp የተሻለ አማራጭ ነው።
ጥያቄ 3፡ LLaMA.cpp አማራጮችን ለ RAG እና ለአካባቢያዊ ፍለጋ መጠቀም እችላለሁን?
በፍጹም። ለትስስር እና መልሶ ለማግኘት Ollama ወይም vLLMን ከ LangChain ወይም LlamaIndex ጋር ያጣምሩ። ሰነዶችዎን ወደ ደመና ሳይልኩ የግል፣ አካባቢያዊ RAG ያገኛሉ።
ጥያቄ 4፡ የትኛው አማራጭ ለማክኦኤስ በአፕል ሲሊኮን ላይ የተሻለ ነው?
Ollama እና LM Studio ሁለቱም በሜታል ማጣደፍ በአፕል ሲሊኮን ላይ ጥሩ ይሰራሉ። ሚስትራል፣ Llama 3 እና ፊ-3 ያሉ ትናንሽ እስከ መካከለኛ መጠን ያላቸው ሞዴሎች ፈጣን ናቸው እና ማራገቢያዎችዎን ጸጥ ያደርጋሉ።
ጥያቄ 5፡ ከእነዚህ አማራጮች ጋር ጥሩ ውጤት ለማግኘት ጂፒዩ ያስፈልገኛል?
ጂፒዩ ቢረዳም የግድ አስፈላጊ አይደለም። በ quantized 7B–8B ሞዴሎች፣ በሲፒዩ ላይ Ollama ወይም LM Studio አሁንም ጠንካራ የውይይት አፈጻጸም ሊያቀርቡ ይችላሉ። ለከባድ የስራ ጫናዎች ወይም ትላልቅ ሞዴሎች፣ vLLM ከጂፒዩ ጋር ያበራል።