ஞாயிற்றுக்கிழமை இரவு LLaMA.cpp-ஐத் தொகுக்க முயற்சி செய்து, ஒரு சாட்பாட்டிற்குப் பதிலாக ஹீட்டரை உருவாக்கிவிட்டோம் என்பதை உணர்ந்திருக்கிறீர்களா? நானும் இருந்திருக்கிறேன். ஒருமுறை என் லேப்டாப்பின் விசிறிகள் டாப் கன் திரைப்படத்திற்கு ஆடிஷன் பார்ப்பதுபோல் சுழன்றன. நல்ல செய்தி என்னவென்றால், சிறந்த லோக்கல் AI-ஐ இயக்க நீங்கள் LLaMA.cpp-ஐ மணக்க வேண்டியதில்லை. எளிதாக நிறுவவும், GPU-வுக்கு ஏற்றதாகவும், உங்கள் மன அமைதிக்கு உகந்ததாகவும் இருக்கும், நன்கு ஆதரவளிக்கும் LLaMA.cpp மாற்றுகள் உள்ளன.
சிறந்த LLaMA.cpp மாற்றுகளுக்கான உங்கள் விருப்பப்படி ஒரு வழிகாட்டி இது. யார் எதை பயன்படுத்த வேண்டும், நிறுவல்கள் எவ்வளவு கடினமானவை, வழக்கமான ஹார்டுவேரில் (NASA ஆய்வகம் அல்ல) என்ன மாதிரியான செயல்திறனை நீங்கள் காண்பீர்கள், மேலும் கருவிகள் குவாண்ட்டைசேஷன், மாதிரி மாற்றுதல், உட்பொதித்தல் போன்ற தினசரி வேலைகளை விடுமுறை விளக்குகளை இணைப்பது போல் இல்லாமல் ஒரு சுவிட்சை திருப்புவது போல் உணர வைக்கும் என்பதை நான் விளக்குவேன்.
நோக்கத்தைப் பற்றிய குறிப்பு: நீங்கள் “LLaMA.cpp மாற்றுகள்” என்று தேடியதற்கு மூன்று காரணங்கள் இருக்கலாம் - எளிமையான அமைப்பு, உங்கள் ஹார்டுவேரில் சிறந்த வேகம் அல்லது சிறந்த டெவலப்பர் அனுபவம். 40 தாவல்களைத் திறக்காமல் அங்கே செல்வோம்.
விரைவான டிகோடர் வளையம்: LLaMA.cpp க்கு பதிலாக நீங்கள் உண்மையில் விரும்புவது என்ன
- நட்பு UI உடன் கூடிய ஒரு-கிளிக் லோக்கல் AI ஐ நீங்கள் விரும்புகிறீர்கள்: LM Studio அல்லது Ollama-ஐ நினைத்துப் பாருங்கள்.
- ஸ்மார்ட் கேச்சிங் மற்றும் குவாண்ட்டைசேஷனுடன் கூடிய வலுவான சர்வர்/API ஐ நீங்கள் ஆப்ஸ்களுக்கு விரும்புகிறீர்கள்: Ollama அல்லது vLLM.
- GPU பண்ணை அல்லது ஒரு சக்திவாய்ந்த கார்டிலிருந்து ஒவ்வொரு கடைசி டோக்கனையும் ஒரு நொடிக்கு பிழிந்து எடுக்க விரும்புகிறீர்கள்: vLLM.
- RAG மற்றும் ஏஜென்ட்களுக்கான Python-முதல், பேட்டரிகள் உள்ளடக்கிய ஸ்டேக் உங்களுக்கு வேண்டும்: LangChain + Ollama அல்லது vLLM போன்ற அனுமான பின்புலம்.
- குறைந்த நிறுவல் வலியுடன் கூடிய உலாவி அடிப்படையிலான சோதனை நிலையம் உங்களுக்கு வேண்டும்: WebLLM அல்லது Open WebUI (Ollama போன்ற பின்புலத்துடன் இணைக்கப்பட்டது).
ஆம், இன்னும் பல விருப்பங்கள் உள்ளன. இல்லை, அவை அனைத்தும் உங்களுக்குத் தேவையில்லை. சிறந்த LLaMA.cpp மாற்றுகளைப் பிரிப்போம், மேலும் அவை எப்போது அர்த்தமுள்ளவை என்பதையும் பார்ப்போம்.
Ollama: "இது தானாகவே இயங்கும்" லோக்கல் மாடல் ரன்னர்
LLaMA.cpp 73 இணைப்புகளைக் கொண்ட ஒரு சுவிஸ் ராணுவ கத்தி என்றால், Ollama நீங்கள் உண்மையில் பயன்படுத்தும் மூன்று கருவிகள் - கத்தி, கத்தரிக்கோல், கார்க்ஸ்க்ரூ - ஒரு சுத்தமான கைப்பிடியில் மூடப்பட்டிருக்கும்.
- ஏன் இது ஒரு மாற்று: எளிமையான மாதிரி மீட்டெடுப்பு, உங்களுக்காக கையாளப்படும் குவாண்ட்டைசேஷன், அமைப்புகளை உருவாக்க எளிதான மாதிரி கோப்புகள் (Modelfiles). இது ஒரு லோக்கல் HTTP API ஐ வெளிப்படுத்துகிறது, எனவே உங்கள் ஆப்ஸ் அதை OpenAI போன்ற எண்ட்பாயிண்ட்டாக அழைக்கலாம்.
- அமைப்பின் அதிர்வு: செயலியை நிறுவவும்.
ollama run llama3 (அல்லது உங்களுக்கு பிடித்த மாதிரி). முடிந்தது. 14-படி CMake தேடல்கள் தேவையில்லை.
- செயல்திறன்: முன்பே உருவாக்கப்பட்ட குவாண்ட்டைசேஷன்களுடன் (Q4, Q5, Q8) திடமான CPU மற்றும் GPU ஆதரவு. பெரிய டேட்டா சென்டர் GPU-களில் எப்போதும் வேகமானதாக இருக்காது, ஆனால் லேப்டாப்கள் மற்றும் டெஸ்க்டாப்புகளுக்கு சிறந்தது.
- சிறந்தது: லோக்கல் ஆப்ஸ்களை உருவாக்கும் டெவலப்பர்கள், வேகம் மற்றும் மன அமைதியை விரும்புபவர்கள், சிறிய MLOps தடம் வேண்டுபவர்கள்.
- நல்ல கூடுதல் அம்சங்கள்: மாதிரி நூலகம், எளிய தூண்டுதல், உட்பொதி ஆதரவு மற்றும் GUI ரேப்பர்களின் வளர்ந்து வரும் சுற்றுச்சூழல் அமைப்பு.
யார் இதைப் பயன்படுத்தக்கூடாது? நீங்கள் பல GPU-களில் அதிக எண்ணிக்கையிலான கோரிக்கைகளை ஒழுங்கமைத்து, நெருப்பு குழாய் வேகத்தில் டோக்கன் ஸ்ட்ரீமிங் தேவைப்பட்டால், vLLM உங்களுக்குத் தேவைப்படலாம்.
vLLM: GPU-களுக்கான அதிக-உற்பத்தி திறன் கொண்ட மிருகம்
LLaMA.cpp ஏறக்குறைய எங்கும் இயங்கும். vLLM ஒரு உண்மையான GPU-வை விரும்புகிறது, மேலும் அதை நீங்கள் கொடுத்தால் வெகுமதி அளிக்கும். இதை அனுமானத்திற்கான அதிவேக நெடுஞ்சாலையாக நினைத்துப் பாருங்கள்.
- ஏன் இது ஒரு மாற்று: PagedAttention மற்றும் மேம்பட்ட KV கேச் மேலாண்மை போன்ற அம்சங்களுடன் வேகமான, அளவிடக்கூடிய அனுமானத்திற்காக உருவாக்கப்பட்டதாகும். பல உற்பத்தி தர வரிசைப்படுத்தல்களுக்கு இதுவே காரணம்.
- அமைப்பின் அதிர்வு: Python, CUDA, டிரைவர்கள் - ஆம், சற்று கனமானது. ஆனால் அது தயாரானதும், கூச்சலிடும்.
- செயல்திறன்: NVIDIA GPU-களில் அருமை; நீண்ட சூழல்களுடனும், அதிக ஒரே நேர கோரிக்கைகளுடனும் பிரகாசிக்கிறது.
- சிறந்தது: API-களை வரிசைப்படுத்தும் குழுக்கள், உற்பத்தி பயன்பாடுகள், அதிக வேலைப்பளு அல்லது "tps" என்பது காதல் மொழி என்று நினைப்பவர்கள்.
- நல்ல கூடுதல் அம்சங்கள்: OpenAI-இணக்கமான சர்வர் பயன்முறை, டென்சர் இணைத்தன்மை, தொடர்ச்சியான தொகுதி செயலாக்கம், நீண்ட சூழல் ஆதரவு.
நீங்கள் CPU-மட்டும் பயன்படுத்துபவராக இருந்தால் அல்லது டிரைவர் நிறுவல்களுக்கு ஒவ்வாமை இருந்தால் இதைத் தவிர்க்கவும். அந்த விஷயத்தில், Ollama அல்லது LM Studio மிகவும் நட்பாக இருக்கும்.
LM Studio: லோக்கல் மாடல்களுக்கான நட்பு டெஸ்க்டாப் ஸ்டுடியோ
இது "எனக்கு ஒரு நல்ல ஆப் விண்டோவும் ரன் பட்டனும் வேண்டும்" என்ற விருப்பம். LM Studio என்பது மாதிரி ஹோஸ்டிங்கின் AirBnB ஆகும்: சுத்தமாகவும், வசதியாகவும் இருக்கும், மேலும் லைட் ஸ்விட்சையும் நீங்கள் கண்டுபிடிக்க முடியும்.
- ஏன் இது ஒரு மாற்று: முழு GUI, உள்ளமைக்கப்பட்ட மாதிரி சந்தை, லோக்கல் சாட் மற்றும் உங்கள் ஆப்ஸ்களுக்காக நீங்கள் இயக்கக்கூடிய OpenAI-இணக்கமான சர்வர்.
- அமைப்பின் அதிர்வு: பதிவிறக்கம் செய்து, திறந்து, ஒரு மாதிரியைத் தேர்ந்தெடுத்து, ரன் என்பதைக் கிளிக் செய்யவும். உள்ளமைவு கோப்புகளுக்கு பதிலாக ஸ்லைடர்கள் மற்றும் விளக்கப்படங்களையும் பெறுவீர்கள்.
- செயல்திறன்: மற்ற ரன்னர்களுடன் ஒத்த தொழில்நுட்பம்; நவீன Mac-களில் (Metal) மென்மையாகவும், Windows/Linux-ல் ஒழுக்கமாகவும் இருக்கும்.
- சிறந்தது: எழுத்தாளர்கள், ஆய்வாளர்கள், GUI-ஐ முதலில் விரும்பும் டெவலப்பர்கள் மற்றும் மதிய உணவுக்கு முன் ஐந்து மாதிரிகளை முயற்சிக்கும் நபர்கள்.
- நல்ல கூடுதல் அம்சங்கள்: தூண்டுதல் டெம்ப்ளேட்கள், உரையாடல் வரலாறு, டோக்கன் காட்சிப்படுத்தல் மற்றும் நல்ல macOS ஆதரவு.
நீங்கள் GUI-களை வெறுத்து CLI மட்டுமே பேசினால், Ollama அல்லது vLLM உங்கள் வேகத்திற்கு ஏற்றதாக இருக்கும்.
Open WebUI + ஒரு பின்புலம் (Ollama/vLLM): மட்டு காக்பிட்
Open WebUI என்பது நேர்த்தியான டாஷ்போர்டு; Ollama அல்லது vLLM என்பது எஞ்சின். நீங்கள் பாத்திரங்கள், ஆவணங்கள் மற்றும் நீட்டிப்புகளுடன் கூடிய பல-மாதிரி சாட் ஆய்வகத்தை விரும்பினால், அவை இரண்டும் சிறந்த LLaMA.cpp மாற்றாகும்.
- ஏன் இது ஒரு மாற்று: ஒரு பளபளப்பான, பல பயனர் முன்பகுதியைப் பெறும்போது பின்புலத்தை நெகிழ்வாக வைத்திருக்கலாம்.
- அமைப்பின் அதிர்வு: Docker அல்லது ஒரு வரி நிறுவல்கள். அதை உங்கள் மாதிரி சர்வரில் சுட்டிக்காட்டுங்கள்.
- செயல்திறன்: பின்புலத்தைப் பொறுத்தது - வேகத்திற்கு vLLM உடன் இணைக்கவும், எளிமைக்கு Ollama உடன் இணைக்கவும்.
- சிறந்தது: சிறிய குழுக்கள், ஆய்வகங்கள் அல்லது தூண்டுதல்களை சோதிக்கவும், மாதிரிகளை ஒப்பிடவும் மற்றும் சாட்களைப் பகிரவும் ஒரு மைய இடம் வேண்டுபவர்களுக்கு.
Text Generation WebUI: டின்ங்கரரின் கருவித்தொகுப்பு
ஆம், இது இன்னும் உள்ளது - மேலும் நாப்ஸ் மற்றும் கிராஃப்களை விரும்பும் சக்திவாய்ந்த டின்ங்கரர்களால் இன்னும் விரும்பப்படுகிறது.
- ஏன் இது ஒரு மாற்று: டன் நீட்டிப்புகள், குவாண்ட்டைசேஷன் கட்டுப்பாடுகள் மற்றும் மாதிரி மாற்றுகள்.
- அமைப்பின் அதிர்வு: எளிமையானது அல்ல, ஆனால் இயங்கியதும் நம்பமுடியாத அளவிற்கு கட்டமைக்கக்கூடியது.
- சிறந்தது: ஆய்வக பெஞ்ச் உணர்வு, நிறைய மாதிரி வடிவங்கள் மற்றும் செருகு நிரல் சக்தி வேண்டுபவர்களுக்கு.
WebLLM: உங்கள் உலாவியில் உள்ள மாதிரிகள்...
இல்லை, தீவிரமாக: WebGPU உடன் LLM-களை Chrome-ல் இயக்கவும். இது உங்கள் சர்வர் ஸ்டேக்கிற்கு மாற்றாக இருக்குமா? ஒருவேளை இல்லை. டெமோக்கள், கல்வி மற்றும் தனியுரிமை-முதல் சோதனைகளுக்கு இது மாயாஜாலமாக இருக்கிறதா? நிச்சயமாக.
- ஏன் இது ஒரு மாற்று: ஜீரோ பின்புலம், சாண்ட்பாக்ஸ் செய்யப்பட்ட பயன்பாட்டிற்கும், சோதனைகளைப் பகிர்வதற்கும் சிறந்தது.
- அமைப்பின் அதிர்வு: ஒரு வலைப்பக்கத்தைத் திறக்கவும். சரி, சில சமயங்களில் ஒரு மாதிரி கோப்பை ஏற்றவும்.
- சிறந்தது: இலகுரக சாட், வகுப்பறை டெமோக்கள், தனியுரிமை உணர்திறன் சூழ்நிலைகள் மற்றும் “வாவ், இது இங்கே இயங்குகிறதா?” என்ற தருணங்கள்.
MLC/MLC-LLM: குறுக்கு-தளம், வன்பொருள்-துரிதப்படுத்தப்பட்ட உருவாக்கங்கள்
"ஒருமுறை தொகுக்கவும், பல சாதனங்களில் வேகமாக இயக்கவும்" என்ற வாக்குறுதியை நீங்கள் விரும்பினால், MLC சுற்றுச்சூழல் அமைப்பு உங்கள் நண்பர்.
- ஏன் இது ஒரு மாற்று: ஒரு ஒற்றை ஸ்டேக், பிளஸ் குவாண்ட்டைசேஷன் மற்றும் வரிசைப்படுத்தல் உதவியாளர்களுடன் Metal (Apple), Vulkan, CUDA ஐ குறிவைக்க குழாய்வழி.
- அமைப்பின் அதிர்வு: டெவலப்பர்-முன்னோக்கி. நீங்கள் வாங்கியவுடன், பெயர்வுத்திறன் பரிசு.
- சிறந்தது: Mac, Windows மற்றும் மொபைல் முழுவதும் பயன்பாடுகளை அனுப்பும் குழுக்கள், அங்கு சீரான செயல்திறன் முக்கியமானது.
llama.cpp vs. உலகம்: உண்மையில் என்ன வித்தியாசம்?
மனிதனாக மொழிபெயர்ப்போம்:
- அமைப்பில் ஏற்படும் உராய்வு: LLaMA.cpp பைனரிகள் மூலம் எளிமையாக இருக்கலாம், ஆனால் நீங்கள் தனிப்பயன் உருவாக்கங்கள் அல்லது GPU ட்யூனிங் செய்யும்போது, உராய்வு அதிகரிக்கும். Ollama மற்றும் LM Studio "நிறுவி மறந்துவிடு" என்பதில் வெற்றி பெறுகின்றன.
- API மற்றும் ஆப்ஸ்: LLaMA.cpp சேவையகங்கள் மற்றும் பைண்டிங்குகள் உள்ளன, ஆனால் Ollama/vLLM சுத்தமான HTTP, தொகுதி செயலாக்கம் மற்றும் OpenAI-இணக்கமான வழிகளுடன் ஆப்ஸ் பின்புலங்களுக்காக உருவாக்கப்பட்டவை.
- GPU வேகம்: vLLM பெரிய GPU-க்களை காலை உணவுக்கு சாப்பிடும். LLaMA.cpp ஏறக்குறைய எதிலும் இயங்கும், ஆனால் அதிகபட்ச உற்பத்தி திறன் vLLM இன் தந்திரம்.
- GUI பாலிஷ்: LM Studio மற்றும் Open WebUI நவீனமாகவும், கண்டுபிடிக்கக்கூடியதாகவும், மகிழ்ச்சியுடன் சலிப்பாகவும் (நல்லது) உணர்கின்றன.
- பல-மாதிரி வேகம்: Ollama மாதிரிகள் மற்றும் குவாண்ட்டைசேஷன்களை மாற்றுவதை வலியற்றதாக்குகிறது; Text Generation WebUI கான்னோயிசர்களுக்கான சிறந்த கட்டுப்பாட்டை வழங்குகிறது.
உங்கள் ஹார்டுவேர் மற்றும் பயன்பாட்டு நிகழ்வின் அடிப்படையில் உங்கள் மாற்றைத் தேர்ந்தெடுப்பது
உங்களுக்கு உண்மையில் தேவையான சாதாரண நபரின் ஃப்ளோசார்ட் இங்கே:
- CPU லேப்டாப் மட்டும் உள்ளதா? Ollama அல்லது LM Studio உடன் செல்லுங்கள். சிறிய குவாண்ட்டைஸ் செய்யப்பட்ட மாதிரிகளை (Q4/Q5) பயன்படுத்தவும். 3-8 டோக்கன்கள்/வினாடிக்கு இலக்கு வைத்து அமைதியாக இருங்கள்.
- Apple Silicon Mac உள்ளதா? Metal துரிதப்படுத்தலுடன் Ollama அல்லது LM Studio. Llama 3, Phi-3 அல்லது Mistral ஆகியவற்றை கலக்கவும். வேகமான பதில்களையும் குறைந்த விசிறி நாடகத்தையும் எதிர்பார்க்கலாம்.
- ஒரு நுகர்வோர் NVIDIA GPU (எ.கா., 3060–4090) உள்ளதா? வேகம் மற்றும் API வேண்டுமென்றால் vLLM ஐ முயற்சிக்கவும்; எளிய லோக்கல் வொர்க்ஃப்ளோக்கள் வேண்டுமென்றால் Ollama ஐ முயற்சிக்கவும்.
- பல-GPU அல்லது சர்வர் உள்ளதா? vLLM. நீங்கள் தொகுதி செயலாக்கம், நீண்ட சூழல் மற்றும் மகிழ்ச்சியான உற்பத்தி திறன் கிராஃப்களைப் பெறுவீர்கள்.
- பல நபர்களுக்கான அலுவலக UI தேவையா? Open WebUI + Ollama அல்லது vLLM.
- அதிகபட்ச டின்ங்கர் சக்தியை நாப்ஸுடன் விரும்புகிறீர்களா? Text Generation WebUI.
- உலாவியில் தனியுரிமை அல்லது டெமோக்கள் தேவையா? WebLLM.
சந்தைப்படுத்தல் இல்லாமல் செயல்திறன் எதிர்பார்ப்புகள்
- சிறிய மாதிரிகள் (3-8B): CPU-களில் கூட, குவாண்ட்டைஸ் செய்யப்பட்ட மாதிரிகள் வசதியாக சாட் செய்ய முடியும். M-series Mac-கள் அல்லது மிட்-ரேஞ்ச் GPU-களில், அவை உடனடியாக இருப்பதாக உணர்கின்றன.
- நடுத்தர மாதிரிகள் (13-34B): உங்களுக்கு GPU VRAM (12-24GB+) தேவைப்படும். 24GB VRAM இல், 13B-14B மாதிரிகள் 4/5-பிட் குவாண்டில் சாட் மற்றும் குறியீட்டிற்கு பறக்கின்றன.
- பெரிய மாதிரிகள் (70B+): இது வசதிக்கான கிளஸ்டர் அல்லது A100/H100 பிரதேசமாகும். நீங்கள் அவற்றை லோக்கலாகப் பிழிந்தால், சமரசங்களை எதிர்பார்க்கலாம்: குவாண்ட்டைசேஷன், மெதுவான வெளியீடு அல்லது புத்திசாலித்தனமான சர்வர் தந்திரங்கள்.
டெவலப்பர் பணிச்சூழலியல்: Modelfiles, அடாப்டர்கள் மற்றும் கேச் மேஜிக்
- Ollama இன் Modelfiles LLM-களுக்கான Dockerfiles போன்றவை. நீங்கள் ஒரு அடிப்படை மாதிரியை வரையறுத்து, சிஸ்டம் தூண்டுதல்களைச் சேர்த்து, ஒருவேளை ஒரு அடாப்டரைச் சேர்க்கலாம், மேலும் ஒரு போர்ட்டபிள் ரெசிபி கிடைக்கும்.
- vLLM இன் OpenAI-இணக்கமான சர்வர் என்றால் உங்கள் ஆப்ஸ் குறியீடு அரிதாகவே மாறும். நீண்ட ஆவணங்கள் உங்கள் நினைவகத்தை மன அழுத்த பந்தாக மாற்றாதபடி, அது KV கேஷையும் ஒரு சார்பு போல கையாள்கிறது.
- Text Generation WebUI LoRA, quant மற்றும் சாம்பிளிங் உத்திகளுக்கான கைகளை ஆன் கட்டுப்பாடுகளை வழங்குகிறது. தூண்டுதல் சோதனைகள் மற்றும் நேருக்கு நேர் ஒப்பீடுகளுக்கு சிறந்தது.
RAG மற்றும் ஏஜென்ட்கள்: உங்கள் தளத்தைத் தேர்ந்தெடுத்து, உங்கள் பொம்மைகளைச் சேர்க்கவும்
Retreival-augmented generation (RAG) என்பது உங்கள் ஆவணங்கள், டிக்கெட்டுகள் அல்லது PDF-களிலிருந்து கிளவுடுக்கு தரவை அனுப்பாமல் கேள்விகளுக்குப் பதிலளிக்கும் இடமாகும்.
- பின்புலம்: உங்களுக்கு வேகம் மற்றும் ஒரே நேர பயன்பாடு தேவைப்பட்டால் vLLM ஐப் பயன்படுத்தவும் அல்லது லோக்கல் டெவ் மற்றும் சிறிய குழு வரிசைப்படுத்தல்களுக்கு Ollama ஐப் பயன்படுத்தவும்.
- Framework: குழாய் வேலைகளை கையாள LangChain அல்லது LlamaIndex - ஆவணத் துண்டுகள், உட்பொதித்தல், கேச்சிங்.
- உட்பொதித்தல்: பல ரன்னர்கள் இப்போது லோக்கல் உட்பொதிப்பு எண்ட்பாயிண்ட்களை வெளிப்படுத்துகின்றன. இல்லையென்றால், ஒரு தனி லோக்கல் உட்பொதிப்பு மாதிரியில் திருகுங்கள்.
- பாதுகாப்பு: இது உண்மையான வாடிக்கையாளர் தரவைத் தொட்டால், PII முகமூடி அல்லது மிதப்படுத்தலுக்கான கருவிகளைக் கவனியுங்கள்.
செலவு, தனியுரிமை மற்றும் கட்டுப்பாடு: ஏன் மாற்றுகள் முக்கியம்
- செலவு: LLaMA.cpp திறந்த மூலமாகும், மேலும் பெரும்பாலான மாற்றுகளும் திறந்த மூலமாகும். உங்கள் கட்டணம் ஹார்டுவேர் மற்றும் மின்சாரம் ஆகும். vLLM GPU-களிலிருந்து அதிகத்தைப் பெற உதவுகிறது; Ollama கிளவுட் API சலசலப்பைத் தவிர்க்கிறது.
- தனியுரிமை: லோக்கல் ரன்னர்கள் உங்கள் தரவை லோக்கலாக வைத்திருக்கின்றன. இது சட்ட, மருத்துவ அல்லது “எனது குறிப்புகள் பயிற்சி தொகுப்புகளில் இருக்க வேண்டாம்” என்ற எண்ணங்களுக்கு முக்கியமானது.
- கட்டுப்பாடு: Modelfiles, அடாப்டர்கள் மற்றும் திறந்த எடைகளுடன், நீங்கள் ஒரு பிளாக் பாக்ஸுடன் பிணைக்கப்படவில்லை. தேவைக்கேற்ப மாதிரிகளை மாற்றவும் - இன்று Mistral, நாளை Llama 3, நீங்கள் சிறியதாகவும் புத்திசாலித்தனமாகவும் விரும்பும்போது Phi-3.
நன்மை தீமை தொகுப்பு (சுருக்கமான, நேர்மையான, ஆடம்பரமற்ற)
- நன்மைகள்: முட்டாள்-எளிமையானது, நல்ல இயல்புநிலைகள், லேப்டாப்களுக்கு சிறந்தது, சுத்தமான API.
- தீமைகள்: அளவில் மிகவும் வேகமானதல்ல; ஆய்வக கருவிகளை விட குறைவான மறைஞான நாப்ஸ்.
- நன்மைகள்: உயர்தர GPU உற்பத்தி திறன், தொகுதி செயலாக்கம், நீண்ட சூழல், உற்பத்திக்கு ஏற்றது.
- தீமைகள்: கனமான அமைப்பு, பிரகாசிக்க GPU தேவை.
- நன்மைகள்: பளபளப்பான GUI, எளிதான மாதிரி கண்டுபிடிப்பு, விரைவான சர்வர் சுவிட்ச்.
- தீமைகள்: தூய CLI தீர்வுகளை விட குறைவான ஸ்கிரிப்ட் செய்யக்கூடியது.
- Open WebUI (+ Ollama/vLLM)
- நன்மைகள்: குழு-நட்பு இடைமுகம், செருகு நிரல் சுற்றுச்சூழல் அமைப்பு, மாதிரி-அக்னோஸ்டிக்.
- தீமைகள்: பராமரிக்க இரண்டு நகரும் பாகங்கள்; செயல்திறன் பின்புலத்துடன் இணைக்கப்பட்டுள்ளது.
- நன்மைகள்: அதிகபட்ச கட்டுப்பாடு, நீட்டிப்புகளின் பெரிய சமூகம்.
- தீமைகள்: செங்குத்தான கற்றல் வளைவு; ஒரு ஆய்வக பெஞ்ச் போல் உணர முடியும்.
- நன்மைகள்: ஜீரோ பின்புலம், இயல்புநிலையாக தனிப்பட்டது டெமோக்கள்.
- தீமைகள்: உலாவி/சாதன ஆதாரங்களால் வரம்பிடப்பட்டது; கனமான தூக்குதலுக்கு அல்ல.
- நன்மைகள்: குறுக்கு-தளம் துரிதப்படுத்தல், பல இலக்குகளுக்கு வரிசைப்படுத்தக்கூடியது.
- தீமைகள்: அதிக டெவ் முயற்சி; தயாரிப்புகளை உருவாக்கும் குழுக்களுக்கு சிறந்தது.
உண்மையான சிறிய சூழ்நிலைகள், இதை நீங்கள் அதிகமாக சிந்திக்காமல் இருக்க
- MacBook Air இல் ஒரு லோக்கல் குறிப்புகள் உதவியாளரை உருவாக்கும் தனி டெவலப்பர்: Ollama ஐ நிறுவவும், Q4 இல் 7B மாதிரியை இயக்கவும், ஒரு உட்பொதிப்பு எண்ட்பாயிண்ட்டைச் சேர்க்கவும் மற்றும் அதை ஒரு எளிய RAG சங்கிலியுடன் இணைக்கவும். உங்கள் காபி ஆறும் முன் முடித்துவிடுவீர்கள்.
- 4090 பெட்டி மற்றும் ஒரு ஸ்லாக்க்கான பாட் கொண்ட ஸ்டார்ட்அப்: வேகத்திற்காக vLLM உடன் மாதிரிகளை வழங்கவும். டெவ் அல்லாதவர்கள் தூண்டுதல்களை சோதிக்க உள்நாட்டில் Open WebUI ஐப் பயன்படுத்தவும். உங்கள் ஆப்ஸ் குறியீட்டை சுத்தமாக வைத்திருக்க OpenAI-இணக்கமான வழியில் சுடவும்.
- ஒரு கட்டுரைக்காக 10 மாதிரிகளை ஒப்பிடும் ஆராய்ச்சியாளர்: விரைவான சுழற்சிகள் மற்றும் பதிவுகளுக்கு LM Studio அல்லது நீங்கள் விரிவான மாதிரி கட்டுப்பாடுகள் மற்றும் காட்சிப்படுத்தல்களை விரும்பினால் Text Generation WebUI.
- மாணவர்களின் தரவு அறையை விட்டு வெளியேறாமல் AI ஐ டெமோ செய்யும் ஆசிரியர்: ஒரு சிறிய மாதிரியுடன் உலாவியில் WebLLM. மேஜிக் தந்திரம் திறக்கப்பட்டது.
குறிப்பிடத்தக்கது: Sider.AI இங்கே உங்கள் AI உதவி விமானியாக இருக்கலாம்
முன்னெச்சரிக்கை: நீங்கள் தேர்வுகளைச் சமாளித்துக் கொண்டிருந்தால், Sider.AI தூண்டுதல்களையும் வொர்க்ஃப்ளோக்களையும் வேகமாக டெஸ்ட்-டிரைவ் செய்யவும், பின்னர் உங்கள் வாழ்க்கை கதையை மீண்டும் எழுதாமல் பின்புலத்தை மாற்றவும் உதவும். அதை ஒரு மனதைச் சரிபார்க்கும் லேயராக நினைத்துப் பாருங்கள்: லோக்கல் Ollama மாதிரி மூலம் முன்மாதிரியை உருவாக்கவும், vLLM எண்ட்பாயிண்ட்டுடன் ஒப்பிட்டு, உங்கள் தூண்டுதல்களையும் ஆவணங்களையும் ஒரே இடத்தில் வைக்கவும். அது உங்களுக்காக GPU ஐ எடுக்காது, ஆனால் இது உங்கள் சோதனைகள் “final-final-v3” என்று பெயரிடப்பட்ட 19 வெவ்வேறு கோப்புறைகளில் சிந்துவதைத் தடுக்கலாம். அமைவு ஸ்னாப்ஷாட்கள்: “ஹலோ, மாதிரி” என்பதற்கு எவ்வளவு விரைவாக வரலாம்?
ollama run mistral (அல்லது llama3, phi3, போன்றவை.)
- OpenAI போன்ற கிளையண்ட்டுடன் அணுகவும்
- உங்கள் HF மாதிரி பாதை மற்றும் GPU உள்ளமைவுகளுடன் சர்வரைத் தொடங்கவும்
- உங்கள் ஆப்ஸிலிருந்து OpenAI-இணக்கமான API வழியை அழைக்கவும்
- நூலகத்திலிருந்து ஒரு மாதிரியைத் தேர்ந்தெடுக்கவும்
- ரன் என்பதைக் கிளிக் செய்யவும்; விருப்பமாக லோக்கல் சர்வரை இயக்கவும்
- படத்தை
docker run செய்யவும்
- Ollama அல்லது vLLM ஐ பின்புலமாக சுட்டிக்காட்டவும்
- குழு உறுப்பினர்களை அழைக்கவும் மற்றும் தூண்டுதல்களை ஒப்பிடத் தொடங்கவும்
இல்லை, நான் டிரைவர் தலைவலிகளைத் தவிர்க்கவில்லை. நீங்கள் NVIDIA உடன் Windows இல் இருந்தால், டிரைவர்கள் மற்றும் CUDA ஐப் புதுப்பிக்கவும். நீங்கள் macOS இல் இருந்தால், Metal கனமான தூக்குதலைக் கையாளும். Linux இல், நீங்கள் ஏற்கனவே என்ன செய்கிறீர்கள் என்பது உங்களுக்குத் தெரியும் அல்லது மன்றங்களை அனுபவிக்கிறீர்கள்.
உங்கள் ரன்னருடன் சரியான மாதிரி குடும்பங்களைத் தேர்ந்தெடுப்பது
- Llama 3 மற்றும் நண்பர்கள்: சிறந்த பொது சாட் மற்றும் பகுத்தறிவு; ரன்னர்கள் மற்றும் quant வடிவங்களில் வலுவான ஆதரவு.
- Mistral/Mixtral: வேகம் மற்றும் திறனின் சிறந்த சமநிலை; Ollama மற்றும் vLLM நிலத்தில் பிரபலமானது.
- Phi-3: சிறியது ஆனால் சக்தி வாய்ந்தது. CPU/Mac அமைப்புகள் மற்றும் விரைவான பதில்களுக்கு ஏற்றது.
- Qwen, Gemma, DeepSeek மாறுபாடுகள்: குறியீடு மற்றும் உண்மை Q&A க்காக சோதனை செய்வது மதிப்பு; பல நல்ல அறிவுறுத்தப்பட்ட எடைகளை அனுப்புகின்றன.
புரோ குறிப்பு: பயன்பாட்டு நிகழ்விற்கு இரண்டு அல்லது மூன்று மாதிரிகளை முயற்சிக்கவும். குறியீட்டிற்கு, ஒரு “குறியீடு” ட்யூன் செய்யப்பட்ட மாறுபாடு. Q&A க்கு, ஒரு “அறிவுறுத்தல்” ட்யூன் செய்யப்பட்ட ஒன்று. படைப்பாற்றலுக்கு, சிறிய மாதிரிகள் வேகமான மறு செய்கை மூலம் உங்களை ஆச்சரியப்படுத்தலாம்.
முறிவு இல்லாமல் சரிசெய்தல்
- CPU இல் மெதுவான டோக்கன்கள்? சிறிய quant (Q4) அல்லது சிறிய மாதிரிக்கு (7B) இறக்கவும். உங்களுக்குத் தேவைப்பட்டால் மட்டுமே சூழலை அதிகரிக்கவும்.
- GPU இல் VRAM பிழைகள்? குறைந்த துல்லியம் (4-பிட்), முடிந்தவரை நீண்ட சூழலுக்கு பதிலாக கயிறு அளவிடுதலைப் பயன்படுத்தவும் அல்லது சிறிய அடிப்படை மாதிரியை முயற்சிக்கவும்.
- நறுக்கிய ஸ்ட்ரீம்கள்? தொகுதி செயலாக்கம் அல்லது KV கேச் அளவுகளைச் சரிபார்க்கவும்; vLLM இங்கே பிரகாசிக்கிறது. Ollama இல், ஒரே நேர கோரிக்கைகளை குறைவாக வைத்திருங்கள்.
- வித்தியாசமான வெளியீடுகள்? சிஸ்டம் தூண்டுதல்களை மீட்டமைக்கவும், மற்றொரு அறிவுறுத்தல்-ட்யூன் செய்யப்பட்ட மாதிரியை முயற்சிக்கவும் அல்லது டோக்கனைசேஷன் அமைப்புகளை சரிபார்க்கவும்.
முடிவுரை: LLaMA.cpp க்கு பதிலாக என்ன தேர்வு செய்வது
- நீங்கள் மென்மையான லோக்கல் அனுபவத்தையும் குறைந்த அமைப்போடு சுத்தமான API ஐயும் விரும்பினால் Ollama ஐத் தேர்ந்தெடுக்கவும்.
- வேகம், அளவு மற்றும் உற்பத்திக்கு தயாரான சர்வரை நீங்கள் விரும்பினால் vLLM ஐத் தேர்ந்தெடுக்கவும்.
- பளபளப்பான டெஸ்க்டாப் ஆப்ஸ் அனுபவத்தையும் விரைவான மாதிரி கண்டுபிடிப்பையும் நீங்கள் விரும்பினால் LM Studio ஐத் தேர்ந்தெடுக்கவும்.
- நீங்கள் ஒத்துழைக்கிறீர்கள் அல்லது நிறைய தூண்டுதல் ஒப்பீடுகளைச் செய்கிறீர்கள் என்றால் Open WebUI ஐ திருகவும்.
- நீங்கள் பவர்-பயனர் கட்டுப்பாடுகளையும் ஆழமான சோதனைகளையும் விரும்பினால் Text Generation WebUI ஐப் பயன்படுத்தவும்.
- உலாவி-முதல் டெமோக்கள் மற்றும் தனியுரிமை டெமோக்களுக்கு WebLLM ஐக் கொண்டு வாருங்கள்.
ஒரு மாதிரிக்கு இரவு உணவு யோசனைகளைக் கேட்க நீங்கள் நள்ளிரவில் கர்னல்களை தொகுக்கும் நபராக இருக்க வேண்டியதில்லை. LLaMA.cpp சிறந்தது - ஆனால் இந்த மாற்றுகளும் அவ்வாறே. உங்கள் நேரம், உங்கள் ஹார்டுவேர் மற்றும் உங்கள் மன அமைதிக்கு மதிப்பளிக்கும் ஒன்றைத் தேர்ந்தெடுக்கவும். பின்னர் முக்கியமான விஷயங்களுக்குத் திரும்புங்கள். நீங்கள் தெளிவாக "எனது கடைசி மின்னஞ்சல் படி..." என்று அர்த்தப்படுத்தும்போது "அன்புடன்" என்று சொல்லும் மின்னஞ்சல்களை எழுதுவதை உங்கள் மாதிரி நிறுத்துவதற்கு கற்பிப்பது போல.
FAQ
கே 1: ஆரம்பநிலைக்கு சிறந்த LLaMA.cpp மாற்று எது?
Ollama அல்லது LM Studio உடன் தொடங்கவும். இரண்டும் குறைந்தபட்ச அமைப்பு மற்றும் வலுவான மாதிரி நூலகங்களுடன் லோக்கல் மாதிரிகளை எளிமையாகவும், வேகமாகவும், நட்பாகவும் ஆக்குகின்றன. லோக்கல் AI இன் சக்தியை இழக்காமல் எளிதாகப் பயன்படுத்தலாம்.
கே 2: GPU வேலைப்பளுக்களுக்கு vLLM LLaMA.cpp ஐ விட வேகமாக உள்ளதா?
பொதுவாக ஆம். vLLM தொகுதி செயலாக்கம் மற்றும் மேம்பட்ட KV கேச் தந்திரங்களுடன் அதிக உற்பத்தி திறன் கொண்ட GPU அனுமானத்திற்காக கட்டமைக்கப்பட்டுள்ளது. அளவிலான வேகமே உங்கள் குறிக்கோளாக இருந்தால், vLLM ஒரு வலுவான LLaMA.cpp மாற்றாகும்.
Q3: RAG மற்றும் உள்ளூர் தேடலுக்கு LLaMA.cpp மாற்றுகளை நான் பயன்படுத்தலாமா?
நிச்சயமாக. உட்பதிவுகள் மற்றும் மீட்டெடுப்புக்காக LangChain அல்லது LlamaIndex உடன் Ollama அல்லது vLLM ஐ இணைக்கவும். உங்கள் ஆவணங்களை கிளவுடுக்கு அனுப்பாமல் தனிப்பட்ட, உள்ளூர் RAG ஐப் பெறுவீர்கள்.
Q4: Apple Silicon இல் macOS க்கு எந்த மாற்று சிறந்தது?
Ollama மற்றும் LM Studio இரண்டும் Metal முடுக்கத்துடன் Apple Silicon இல் சிறப்பாக இயங்குகின்றன. Mistral, Llama 3 மற்றும் Phi-3 போன்ற சிறிய முதல் நடுத்தர அளவிலான மாதிரிகள் விரைவாக இருக்கும், மேலும் உங்கள் மின்விசிறிகளை அமைதியாக வைத்திருக்கும்.
Q5: இந்த மாற்றுகளுடன் நல்ல முடிவுகளைப் பெற எனக்கு GPU தேவையா?
A GPU உதவுகிறது, ஆனால் அது கட்டாயமில்லை. குவாண்ட்டைஸ் செய்யப்பட்ட 7B–8B மாதிரிகளுடன், CPU இல் Ollama அல்லது LM Studio இன்னும் உறுதியான சாட் செயல்திறனை வழங்க முடியும். அதிக வேலைப்பளு அல்லது பெரிய மாதிரிகளுக்கு, GPU உடன் vLLM பிரகாசிக்கிறது.