ನೀವು ಸದSundayರ ವಿಭೈಷಣೆಯಲ್ಲಿ LLaMA.cpp ಅನ್ನು ಸಂಯೋಜಿಸಲು ಯತ್ನಿಸಿದಾಗ,却 ನೀವು ತಪ್ಪಾಗಿ ಚಾಟ್ಬಾಟ್ ಬದಲು ಒಂದು ಸ್ತಾನದ ತಾಪಕವನ್ನು ನಿರ್ಮಿಸಿದ್ದೀರಿ ಎಂದು ಕಂಡಿದ್ದೀರಾ? ನಾನು ಅದನ್ನು ಅನುಭವಿಸಿದ್ದೇನೆ. ನನ್ನ ಲ್ಯಾಪ್ಟಾಪಿನ ಫ್ಯಾನ್ಗಳು ಇಷ್ಟು ಕಠಿಣವಾಗಿ ಓಡಿದವು ಅವರು 'ಟಾಪ್ ಗನ್'ಗೆ ಸ್ಪರ್ಧೆ ನೀಡುತ್ತಿದ್ದರು ಎಂದು ನಾನು ಭಾವಿಸಿದೆ. ಒಳ್ಳೆಯ ಸುದ್ದಿ: ಅತ್ಯುತ್ತಮ ಸ್ಥಳೀಯ AI ಅನ್ನು ಚಲಾಯಿಸಲು LLaMA.cpp ಜೊತೆಗೆ ಅವಿಭಾಜ್ಯವಾಗಿ ಇರಬೇಕಾಗಿಲ್ಲ. LLaMA.cpp ಗೆ ಸುಲಭವಾಗಿ ಸೆಟ್ಅಪ್ ಮಾಡಬಹುದಾದ, ಜಿಪಿಯು ಸ್ನೇಹಿ, ಮತ್ತು ನಿಮ್ಮ ನರವಿಗೆ ಸಹನೀಯವಾದ ಪರ್ಯಾಯಗಳು ಇವೆ.
ಈ ಮಾರ್ಗದರ್ಶಿ ನಿಮ್ಮ ಆಯ್ಕೆಗಳ ಪಥವು ಉತ್ತಮ LLaMA.cpp ಪರ್ಯಾಯಗಳಿಗೆ ಆಗಿದೆ. ಯಾವ ಯಾರಿಗೆ ಯಾವದು ಸೂಕ್ತವಾಗುತ್ತದೆ, ಬೇರಿಸುವಿಕೆ ಎಷ್ಟು ಕಠಿಣ, ಸಾಮಾನ್ಯ ಹಾರ್ಡ್ವೇರ್ನಲ್ಲಿ ನಿಮಗೆ ಯಾವ ರೀತಿಯ ಪ್ರದರ್ಶನ ಸಿಗುತ್ತದೆ (ನಾಸಾ ಲ್ಯಾಬ್ ಅಲ್ಲ), ಮತ್ತು ಸಲಕರಣೆಗಳು ದೈನಂದಿನ ಟಿಂಕರಿಂಗ್ (ಕ್ವಾಂಟೈಜೆಶನ್, ಮಾದರಿ ಬದಲಾವಣೆ, ಇಂಬೆಡ್ಡಿಂಗ್ಗಳು) ಅನ್ನು ಹೇಗೆ ಸುಲಭವಾಗಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತೇನೆ.
ಉದ್ದೇಶದ ಮೇಲೆ ಗಮನ ನೀಡಿರಿ: ನೀವು “LLaMA.cpp ಪರ್ಯಾಯಗಳು” ಎಂದು ಹುಡುಕಿದ ಕಾರಣ ಮೂರುದು: ಸುಲಭ ಸೆಟ್ಅಪ್, ನಿಮ್ಮ ಹಾರ್ಡ್ವೇರ್ನಲ್ಲಿ ಉತ್ತಮ ವೇಗ, ಅಥವಾ ಉತ್ತಮ ಡೆವಲಪರ್ ಅನುಭವ. ನೀವು 40 ಟ್ಯಾಬ್ ಗಳ ರ್ಯಾಬ್ಟ್ ಹೋಲ್ಗೆ ಬಿದ್ದುಕೊಳ್ಳದೆ ಅದೃಷ್ಟವನ್ನು ಸಾಧಿಸೋಣ.
ತ್ವರಿತ ಡಿಕೋಡರ್: ನೀವು LLaMA.cpp ಬದಲಿಯಾಗಿ ಬಯಸುವುದು ಏನು
- ಒಂದು ಕ್ಲಿಕ್ನಲ್ಲಿ ಸ್ಥಳೀಯ AI ಮತ್ತು ಸ್ನೇಹಪೂರ್ಣ UI ಬೇಕೇ: LM Studio ಅಥವಾ Ollama ಯನ್ನು ಪರಿಗಣಿಸಿ.
- ಬಳಕೆಗಳಿಗೆ ಬಲಿಷ್ಠ ಸರ್ವರ್/API ಬೇಕಾದರೆ, ಸಹಜ ಕ್ಯಾಶಿಂಗ್ ಮತ್ತು ಕ್ವಾಂಟೈಜೆಶನ್ ಜೊತೆ: Ollama ಅಥವಾ vLLM.
- ಜಿಪಿಯು ಫರ್ಮ್ ಅಥವಾ ಹೆಚ್ಚಿನ ಶಕ್ತಿಯ ಕಾರ್ಡ್ನಿಂದ ಪ್ರತಿ ಕ್ಷಣದಲ್ಲಿ ಹೆಚ್ಚಿನ ಟೋಕನ್ ಗಳು ಬೇಕಾದರೆ: vLLM.
- Python-ಪ್ರಥಮ, ಬ್ಯಾಟರಿಗಳು ಸೇರಿರುವ ಸ್ಟಾಕ್ RAG ಮತ್ತು ಏಜೆಂಟ್ ಗಾಗಿ: LangChain + Ollama ಅಥವಾ vLLM ಯಾವದಾದರೂ ಇನ್ಫರೆನ್ಸ್ ಬ್ಯಾಕ್ಎಂಡ್.
- ಕ್ಲಿಷ್ಟತೆ ಕಡಿಮೆ ಹಾಗೂ ಬ್ರೌಸರ್ ಆಧಾರಿತ ಪ್ರಯೋಗಮಂಡಳಿ: WebLLM ಅಥವಾ Open WebUI (Ollama ಅಥವಾ vLLM ಜೊತೆಗೆ).
ಹೌದು, ಇನ್ನಷ್ಟು ಆಯ್ಕೆಗಳು ಇವೆ. ಇಲ್ಲ, ನೀವು ಅವುಗಳನ್ನು ಎಲ್ಲಾ ಬೇಕಾಗಿಲ್ಲ. ಉತ್ತಮ LLaMA.cpp ಪರ್ಯಾಯಗಳು ಯಾವಾಗ ಸಹಾಯಕ ಎಂಬುದನ್ನು ವಿವರಿಸೋಣ.
Ollama: 'ಇದು ಬರುವದಷ್ಟೆ' ಇರುವ ಸ್ಥಳೀಯ ಮಾದರಿ ಚಾಲಕ
LLaMA.cpp 73 ಉಪಕರಣಗಳನ್ನು ಹೊಂದಿದ್ದರೆ, Ollama ನೀವು ನಿಜವಾಗಿ ಉಪಯೋಗಿಸುವ ಮೂರು ಉಪಕರಣಗಳು—ಚೂರಿ, ಕತ್ತರಿ, ಕಾರ್ಕ್ ಸ್ಕ್ರೂ—ಒಂದೇ ಅರಳಿನಲ್ಲಿ ಹೊಂದಿದೆ.
- ಪರ್ಯಾಯವಾಗಿರುವುದು: ಸರಳ ಮಾದರಿ ಅಧಿಕೃತಿಕೆ, ಕ್ವಾಂಟೈಜೆಶನ್ ನಿಮ್ಮ ಪರವಾಗಿ ನಿಭಾಯಿಸಲಾಗುತ್ತದೆ, ವ್ಯವಸ್ಥೆಗಳ ನಿಂದಲೂ ಸುಲಭ ಮಾದರಿ ಫೈಲ್ (Modelfiles) ರಚನೆ. ನೀವು ನಿಮ್ಮ ಅಪ್ಲಿಕೇಷನ್ಗಳು OpenAI ಶೈಲಿಯ ಸ್ಥಳೀಯ HTTP API ಮೂಲಕ ಕರೆಮಾಡಬಹುದು.
- ಸೆಟ್ಅಪ್ ವಾತಾವರಣ: ಅಪ್ಲಿಕೇಷನ್ ಅನ್ನು ಸ್ಥಾಪಿಸಿ.
ollama run llama3 (ಅಥವಾ ನಿಮ್ಮ ಇಷ್ಟದ ಮಾದರಿ). ಮುಗಿದುಬಿಡಿ. 14 ಹಂತಗಳ CMake ಗೇಮ್ ಬೇಡ.
- ಪ್ರದರ್ಶನ: ಪೂರ್ವ-ನಿರ್ಮಿತ ಕ್ವಾಂಟೈಜೆಶನ್ಗಳೊಂದಿಗೆ ಭದ್ರ CPU ಮತ್ತು GPU ಬೆಂಬಲ (Q4, Q5, Q8). ದೊಡ್ಡ ಡೇಟಾ ಸೆಂಟರ್ ಜಿಪಿಯುಗಳಿಗೆ ಅತ್ಯಂತ ವೇಗವಂತಿಕೆಯಾಗಲು ಅಲ್ಲ ಆದರೆ ಲ್ಯಾಪ್ಟಾಪ್ ಮತ್ತು ಡೆಸ್ಕ್ಟಾಪ್ಗಳಿಗೆ ಚಿಕ್ಕ ಪ್ರಮಾಣದಲ್ಲಿ ಉತ್ತಮ.
- ಉತ್ತಮವಾಗಿದೆ: ಸ್ಥಳೀಯ ಅಪ್ಲಿಕೇಷನ್ ನಿರ್ಮಿಸುವ ಡೆವಲಪರ್ಗಳು, ವೇಗ ಮತ್ತು ಸಾಂತ್ಯವನ್ನು ಬಯಸುವ ಪ್ರಯೋಗಶೀಲರು, ಮತ್ತು ಸಣ್ಣ MLOps ಪ್ರಭಾವ ಬಯಸುವವರು.
- ಮನೋಹರ ಹೆಚ್ಚುವರಿ: ಮಾದರಿ ಪ್ಯಾಸ, ಸರಳ ಪ್ರಾಂಪ್ಟ್, ಇಂಬೆಡ್ಡಿಂಗ್ ಬೆಂಬಲ, ಮತ್ತು GUI ರೈಪರ್ಗಳ ಬೆಳವಣಿಗೆ ಇರುವ ಪರಿಸರ.
ಯಾರು ಬಳಸಬಾರದು? ನೀವು ಅನೇಕ GPU ಗಳಿನಲ್ಲಿ ಅನೇಕ ವಿನಂತಿಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತಿದ್ದರೆ ಮತ್ತು ಅಗ್ನಿಮುಖ ಪ್ರಮಾಣದಲ್ಲಿ ಟೋಕನ್ ಸ್ಟ್ರೀಮಿಂಗ್ ಬೇಕಾದರೆ, ನೀವು ಬಹುಶಃ vLLM ಬಯಸದಿರಿ.
vLLM: ಜಿಪಿಯುಗಳಿಗೆ ಹೆಚ್ಚಿನ ಪ್ರವಾಹದ ರಾಕ್ಷಸ
LLaMA.cpp ಹ 거의 ಎಲ್ಲೆಡೆ ಕಾರ್ಯನಿರ್ವಹಿಸಬಹುದು. vLLM ವಾಸ್ತವಿಕ ಜಿಪಿಯು ಬೇಕು ಎಂದು ಕೇಳುತ್ತದೆ ಮತ್ತು ಅದಕ್ಕೆ ಒದಗಿಸಿದಾಗ ನೀವು ಬಹುಮಾನ ಪಡೆಯುತ್ತೀರಿ. ಇದು ಇನ್ಫರೆನ್ಸ್ಗೆ ವಾಹನದ ತ್ವರಿತ express ಲೇನ್ ಅಲ್ಲದೆ ಮತ್ತೇನು.
- ಪರ್ಯಾಯವಾಗಿರುವುದು: ವೇಗದ, ತಲುಪಬಹುದಾದ ಇನ್ಫರೆನ್ಸ್ಗಾಗಿ ಉದ್ದೇಶಿತವಾದ. PagedAttention ಮತ್ತು ಸುಧಾರಿತ KV ಕ್ಯಾಶೆ ನಿರ್ವಾಹನದಂತಹ ವೈಶಿಷ್ಟ್ಯಗಳಿವೆ. ಅನೇಕ ಉತ್ಪಾದನಾ-ಮಟ್ಟದ ನಿಯೋಜನೆಗಳ ಹಿಂಬಾಲಿನ ಎಂಜಿನ್.
- ಸೆಟ್ಅಪ್ ವಾತಾವರಣ: Python, CUDA, ಡ್ರೈವರ್ಗಳು—ಹೌದು, ಸ್ವಲ್ಪ ಭಾರದ ಕೂಡ ಇದೆ. ಆದರೆ ಒಮ್ಮೆ ಚಾಲನೆ ಆರಂಭವಾದರೆ, ಅದ್ಭುತ ವೇಗ.
- ಪ್ರದರ್ಶನ: NVIDIA ಜಿಪಿಯುಗಳಲ್ಲಿ ಅದ್ಭುತ; ಉದ್ದ ಕೊನೆಯಲ್ಲಿ ಮತ್ತು ಹಲವಾರು ಸಹವಿನಂತಿಗಳು ಒಳ್ಳೆಯದರಂತೆ.
- ಉತ್ತಮವಾಗಿರುವುದು: APIಗಳ ನಿಯೋಜಿಸುವ ತಂಡಗಳು, ಉತ್ಪಾದನಾ ಅಪ್ಲಿಕೇಶನ್ಗಳು, ಭಾರೀ ಕೆಲಸಗಳಿಗಾಗಿ, ಅಥವಾ “tps” ಅನ್ನು ಪ್ರೀತಿ ಭಾಶೆ ಎಂದು ಭಾವಿಸುವ ಯಾರಿಗಾದರೂ.
- ಮರು ವಿನ್ಯಾಸ: OpenAI-ಸಮ್ಮತಿಯ ಸರ್ವರ್ ಮೋಡ್, ಟೆನ್ಸರ್ ಪ್ಯಾರಲೆಲಿಸಮ್, ನಿರಂತರ ಬ್ಯಾಚಿಂಗ್, ಉದ್ದ ಕೊನೆಯನ್ನು ಬೆಂಬಲಿಸುವುದು.
ನೀವು CPU ಮಾತ್ರ ಬಳಸದಿದ್ದರೆ ಅಥವಾ ಡ್ರೈವರ್ ಸ್ಥಾಪನೆಗಳಿಗೆ ಅಸಹomeloಆಗಿದ್ದರೆ, Ollama ಅಥವಾ LM Studio ನಿಮ್ಮಿಗೆ ಹೆಚ್ಚು ಸ್ನೇಹಪೂರ್ಣವಾಗಿರುತ್ತದೆ.
LM Studio: ಸ್ಥಳೀಯ ಮಾದರಿಗಳ ಗೆಳೆಯಾದ ಡೆಸ್ಕ್ಟಾಪ್ ಸ್ಟುಡಿಯೋ
ನೀವು “ಒಳ್ಳೆಯ ಅಪ್ಲಿಕೇಶನ್ ವಿಂಡೋ ಮತ್ತು ರನ್ ಬಟನ್” ಬಯಸಿದರೆ ಈ ಆಯ್ಕೆ. LM Studio ಮಾದರಿ ಹೊಸ್ಟ್ ಮಾಡಲಿರುವ AirBnB: ಸ್ವಚ್ಚ, ಆರಾಮದಾಯಕ ಮತ್ತು ಲೈಟ್ ಸ್ವಿಚ್ ಹುಡುಕಬಹುದಾದ.
- ಪರ್ಯಾಯವಾಗಿರುವುದು: ಪೂರ್ಣ GUI, ನಿರ್ಮಿತ ಮಾದರಿ ಮಾರುಕಟ್ಟೆ, ಸ್ಥಳೀಯ ಚಾಟ್, ಮತ್ತು ನಿಮ್ಮ ಅಪ್ಗೆ OpenAI-ಅನುಕೂಲಿತ ಸರ್ವರ್ ಕಂಡುಬರುವ ಒಂದು ಸ್ವಿಚ್.
- ಸೆಟ್ಅಪ್: ಡೌನ್ಲೋಡ್ ಮಾಡಿ, ತೆರೆಯಿರಿ, ಮಾದರಿಯನ್ನು ಆಯ್ಕೆ ಮಾಡಿ, ರನ್ ಮೇಲೆ ಕ್ಲಿಕ್ ಮಾಡಿ. ಕಾನ್ಫಿಗ್ ಫೈಲ್ಗಳ ಬದಲು ಸ್ಲೈಡರ್ಗಳು ಮತ್ತು ಚಾರ್ಟ್ಗಳು ಲಭ್ಯವಿವೆ.
- ಪ್ರದರ್ಶನ: ಇತರ ಚಾಲಕರಂತಹ ತಂತ್ರಜ್ಞಾನ, ಹೊಸ Macs (Metal) ನಲ್ಲಿ ಸುಗಮ, ಮತ್ತು Windows/Linux ನಲ್ಲಿ ಒಳ್ಳೆಯ.
- ಉತ್ತಮವಾಗಿರುವುದು: ಬರಹಗಾರರು, ವಿಶ್ಲೇಷಕರು, GUI-ಆಧಾರಿತ ಪ್ರಯೋಗಶೀಲತೆ ಇಚ್ಛಿಸುವ ಡೆವಲಪರ್ಗಳು ಮತ್ತು “ಭೋಜನಕ್ಕೂ ಮುನ್ನ 5 ಮಾದರಿಗಳನ್ನು ಪ್ರಯತ್ನಿಸಿ” ಕಾರ್ಯಪ್ರವಾಹಕ್ಕೆ.
- ಸುಂದರ ಹೆಚ್ಚುವರಿ: ಪ್ರಾಂಪ್ಟ್ ಟೆಂಪ್ಲೇಟುಗಳು, ಸಂಭಾಷಣೆಯ ಇತಿಹಾಸ, ಟೋಕನ್ ದೃಶ್ಯೀಕರಣ, ಮತ್ತು ಉತ್ತಮ macOS ಬೆಂಬಲ.
ನೀವು GUIsನ್ನು ಬಿಟ್ಟು CLI ಮಾತ್ರ ಮಾತನಾಡಿದರೆ, Ollama ಅಥವಾ vLLM ನಿಮ್ಮ ವೇಗವಾಗಿರುತ್ತದೆ.
Open WebUI + ಬ್ಯಾಕ್ಎಂಡ್ (Ollama/vLLM): ಮೆರಗುಯುಕ್ತ ಕೂಕ್ಪಿಟ್
Open WebUI ಸ್ಲಿಕ್ ಡ್ಯಾಶ್ಬೋರ್ಡ್; Ollama ಅಥವಾ vLLM ಎಂಜಿನ್. ಒಟ್ಟಿಗೆ, ಹೆಚ್ಚು ಮಾದರಿ ಚಾಟ್ ಲ್ಯಾಬ್ ಬೇಕಾದರೆ ಉತ್ತಮ LLaMA.cpp ಪರ್ಯಾಯ; ಪಾತ್ರಗಳು, ಡಾಕ್ಯುಮೆಂಟ್ ಗಳು, ಮತ್ತು ವಿಸ್ತಾರಗಳೊಂದಿಗೆ.
- ಪರ್ಯಾಯವಾಗಿರುವುದು: ಬ್ಯಾಕ್ಎಂಡ್ ಲವಚಿಕವಾಗಿರುತ್ತದೆ ಮತ್ತು ಬಹು-ಬಳಕೆದಾರ ಮುಂಭಾಗದ ಕಡ್ಡಾಯ ಬಳಕೆಯನ್ನು ಪಡೆಯುತ್ತೀರಿ.
- ಸೆಟ್ಅಪ್: ಡೋಕರ್ ಅಥವಾ ಒನ್-ಲೈನ್ ಇನ್ಸ್ಟಾಲ್ಗಳು. ನಿಮ್ಮ ಮಾದರಿ ಸರ್ವರ್ ಅನ್ನು ಸೂಚಿಸಿ.
- ಪ್ರದರ್ಶನ: ಬ್ಯಾಕ್ಎಂಡ್ ಮೇಲೆ ಅವಲಂಬಿತ - ವೇಗಕ್ಕಾಗಿ vLLM, ಸರಳತೆಗೆ Ollama.
- ಉತ್ತಮವಾಗಿರುವುದು: ಸಣ್ಣ ತಂಡಗಳು, ಲ್ಯಾಬ್ಗಳು, ಅಥವಾ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಪರೀಕ್ಷಿಸಲು, ಮಾದರಿಗಳನ್ನು ಹೋಲಿಸಲು ಮತ್ತು ಚಾಟ್ಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳಲು ಕೇಂದ್ರದ ಸ್ಥಳ ಬೇಕಾದರೆ.
ಟೆಕ್ಸ್ಟ್ ಜನರೇಶನ್ ವೆಬ್ಯುಐ: ಪ್ರಯೋಗಶೀಲರ ಉಪಕರಣಗಳು
ಇದು ಇನ್ನೂ ಇದೆ ಮತ್ತು ನಶ್ಪದ ಪರಿಣಾಮಕಾರಿಗಳಿಗೆ ಈಗಲೂ ಪ್ರೀತಿ ಪಡೆಯುತ್ತಿದೆ.
- ಪರ್ಯಾಯವಾಗಿರುವುದು: ಅನೇಕ ವಿಸ್ತಾರಣೆಗಳು, ಕ್ವಾಂಟೈಜೇಶನ್ ನಿಯಂತ್ರಣಗಳು, ಮತ್ತು ಮಾದರಿ ಬದಲಾವಣೆ.
- ಸೆಟ್ಅಪ್: ಸರಳವಲ್ಲ, ಆದರೆ ಚಾಲನೆ ಆದ ಮೇಲೆ ಅತ್ಯಂತ ಸರಿಪಡಿಸಬಹುದಾದ.
- ಉತ್ತಮವಾಗಿದೆ: ಪ್ರಯೋಗಾಲಯದ ಅನುಭವ, ಅನೇಕ ಮಾದರಿ ಫಾರ್ಮ್ಯಾಟ್ಗಳು, ಮತ್ತು ಪ್ಲಗಿನ್ ಶಕ್ತಿ.
WebLLM: ನಿಮ್ಮ ಬ್ರೌಸರ್ನಲ್ಲಿ ಮಾದರಿಗಳು
ನಿಜವಾಗಿಯೂ: WebGPU ಮೂಲಕ LLMಗಳು ನೇರವಾಗಿ Chrome ನಲ್ಲಿ ಚಾಲನೆ. ಇದು ನಿಮ್ಮ ಸರ್ವರ್ ಸ್ಟಾಕ್ ಬದಲಾಯಿಸುವುದಿಲ್ಲ. ಡೆಮೋ, ಶಿಕ್ಷಣ, ಮತ್ತು ಗೌಪ್ಯತೆ-ಪ್ರಥಮ ಪ್ರಯೋಗಗಳಿಗೆ ಅದ್ಭುತ.
- ಪರ್ಯಾಯವಾಗಿರುವುದು: ಬ್ಯಾಕ್ಎಂಡ್ ಇಲ್ಲದೆ, ಸ್ಯಾಂಡ್ಬಾಕ್ಸ್ ಬಳಕೆ ಮತ್ತು ಪ್ರಯೋಗಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳಲು ಉತ್ತಮ.
- ಸೆಟ್ಅಪ್: ವೆಬ್ ಪುಟ ತೆರೆಯಿರಿ. ಕೆಲವೊಮ್ಮೆ ಮಾದರಿ ಫೈಲ್ ಲೋಡ್ ಮಾಡಬೇಕು.
- ಉತ್ತಮವಾಗಿರುವುದು: ಲೈಟ್ವೆಟ್ ಚಾಟ್, ತರಗತಿ ಡೆಮೋಗಳು, ಗೌಪ್ಯತೆ ಬದ್ಧ ಸಂದರ್ಭಗಳು, ಮತ್ತು “ನವ್ವು, ಇಲ್ಲಿ ಚಾಲನೆ ಆಗುತ್ತಿದೆ?” ಕ್ಷಣಗಳು.
MLC/MLC-LLM: ಕ್ರಾಸ್ಪ್ಲಾಟ್ಫಾರ್ಮ್, ಹಾರ್ಡ್ವೇರ್ ವೇಗವಡ್ಡಿತ ನಿರ್ಮಾಣಗಳು
“ಒಮ್ಮೆ ಸಂಯೋಜಿಸಿ, ಹೆಚ್ಚುವರಿ ಸಾಧನಗಳಲ್ಲಿ ವೇಗವಾಗಿ ಚಾಲನೆ” ಎಂಬ ವಾಗ್ದಾನ ಇಷ್ಟವೇನಲ್ಲ?
- ಪರ್ಯಾಯವಾಗಿರುವುದು: Metal (Apple), Vulkan, CUDA ಗಾಗಿ ಒಬ್ಬ ಸ್ಟಾಕ್pipeline, ಜೊತೆಗೆ ಕ್ವಾಂಟೈಜೆಶನ್ ಮತ್ತು ನಿಯೋಜನ ಸಹಾಯಗಳು.
- ಸೆಟ್ಅಪ್: ಡೆವಲಪರ್ಗಳಲ್ಲಿ ಮುನ್ನುಗ್ಗುವವರಿಗಾಗಿ. ಒಮ್ಮೆ ನಿಮ್ಮನ್ನು ನಂಬಿಸಿದರೆ, ಪೋರ್ಟಬಿಲಿಟಿ ಬಹುಮಾನ.
- ಉತ್ತಮವಾಗಿದೆ: Mac, Windows ಮತ್ತು ಮೊಬೈಲ್ಗೆ ಅನ್ವಯಿಸುವ ಅಪ್ಲಿಕೇಶನ್ ತಂಡಗಳು, ಸಮಾನ ಪ್ರದರ್ಶನ ಮುಖ್ಯವಾದಲ್ಲಿ.
llama.cpp ವಿರುದ್ಧ ಜಗತ್ತು: ಏನು ನಿಜವಾಗಿಯೂ ವಿಭಿನ್ನ?
ಮಾನವರಾಗಿ ಭಾಷಾಂತರಿಸೋಣ:
- ಸೆಟ್ಅಪ್ ತೊಂದರೆ: LLaMA.cpp ಸರಳ ಇರಬಹುದು ಬೈನರಿಗಳ ಮೂಲಕ, ಆದರೆ ಕಸ್ಟಮ್ ಬಿಲ್ಡ್ಗಳು ಅಥವಾ GPU ನಿಖರತೆಗೆ ತೊಂದರೆ ಹೆಚ್ಚು. Ollama ಮತ್ತು LM Studio “ಇನ್ಸ್ಟಾಲ್ ಮಾಡಿ ಮರೆತುಬಿಡಿ” ಗೆ ಮೊದಲು.
- API ಮತ್ತು ಅಪ್: LLaMA.cpp ಗೆ ಸರ್ವರ್ಗಳು ಮತ್ತು ಬಿಂಧಾಗಣೆಗಳಿವೆ, ಆದರೆ Ollama/vLLM ಅಪ್ ಬ್ಯಾಕ್ಎಂಡ್ಗಳಿಗಾಗಿ ಕ್ಲೀನರ್ HTTP, ಬ್ಯಾಚಿಂಗ್, ಮತ್ತು OpenAI-ಅನುಕೂಲಿತ ಮಾರ್ಗಗಳಿವೆ.
- GPU ವೇಗ: vLLM ದೊಡ್ಡ GPUs ಆಹಾರವಾಗುತ್ತದೆ. LLaMA.cpp ಬಹುತೇಕ ಎಲ್ಲ್ಕೆ ಚಲಿಸುತ್ತದೆ, ಆದರೆ ಗರಿಷ್ಠ ಪ್ರವಾಹವು vLLM ವಿಶೇಷತೆ.
- GUI ಸೊಗಸು: LM Studio ಮತ್ತು Open WebUI ಆಧುನಿಕ ಮತ್ತು ಅನ್ವೇಷಣೀಯ ಅನುಭವ ನೀಡುತ್ತವೆ, ಮತ್ತು ಹರ್ಷವಾಗುವ ಸಂಗತಿಗಳು.
- ಬಹು-ಮಾದರಿ ಪರಿಣತಿ: Ollama ಮಾದರಿಗಳ ಬದಲಾವಣೆ ಮತ್ತು ಕ್ವಾಂಟೈಜೆಶನ್ ಸುಲಭ; Text Generation WebUI ವಿಶಿಷ್ಟ ನಿಯಂತ್ರಣವನ್ನು ನೀಡುತ್ತದೆ ಸಂವಿದ್ಯಾನ ಸಮಾರಂಭಕರಿಗೆ.
ಹಾರ್ಡ್ವೇರ್ ಮತ್ತು ಉಪಯೋಗದ ದೃಷ್ಟಿಯಿಂದ ಪರ್ಯಾಯ ಆಯ್ಕೆ
ಇಲ್ಲಿ ಸಾಮಾನ್ಯ ವ್ಯಕ್ತಿಗಳಿಗೆ ಬೇಕಾದ ಫ್ಲೋಚಾರ್ಟ್ ಇದೆ:
- ಮಾತ್ರ CPU ಲ್ಯಾಪ್ಟಾಪ್ ಇದೆಯೇ? Ollama ಅಥವಾ LM Studio ಬಳಸಿ. ಚಿಕ್ಕ ಪ್ರಮಾಣದಲ್ಲಿ ಕ್ವಾಂಟೈಜೆಡ್ ಮಾದರಿಗಳು (Q4/Q5) ಬಳಸಿ. 3–8 ಟೋಕನ್ಸ್/ಸೆಕೆಂಡ್ ಗುರಿ ಇಡಿ ಮತ್ತು ಶಾಂತಿಯಿಂದ ಅನುಭವಿಸಿರಿ.
- ಆಪಲ್ ಸಿಲಿಕಾನ್ ಮ್ಯಾಕ್? Ollama ಅಥವಾ LM Studio ಯನ್ನು Metal ಎಕ್ಸಲೆರೇಶನ್ ಜೊತೆ ಬಳಸಿ. Llama 3, Phi-3 ಅಥವಾ Mistral ಸೇರಿಸಿ. ವೇಗದ ಪ್ರತಿಕ್ರಿಯೆಗಳು ಮತ್ತು ಕಡಿಮೆ ಫ್ಯಾನ್ ಶಬ್ದ अपेಕ್ಷಿಸಿ.
- ಒಂದು ಗ್ರಾಹಕ NVIDIA GPU (ಉದಾ., 3060–4090)? ನೀವು ವೇಗ ಮತ್ತು API ಬೇಕಾದರೆ vLLM ಯತ್ನಿಸಿ; ಸರಳ ಸ್ಥಳೀಯ ಕಾರ್ಯಪ್ರವಾಹಕ್ಕಾಗಿ Ollama.
- ಬಹು-JPU ಅಥವಾ ಸರ್ವರ್? vLLM. ನೀವು ಬ್ಯಾಚಿಂಗ್, ಉದ್ದಕೊನೆಯನ್ನು ಮತ್ತು ಸುಖಕರ ಪ್ರವಾಹ ಗ್ರಾಫ್ ಪಡೆಯುತ್ತೀರಿ.
- ಹೆಚ್ಚು ಜನರಿಗಾಗಿ ಕಚೇರಿ UI ಬೇಕೆ? Open WebUI + Ollama ಅಥವಾ vLLM.
- ಅಧಿಕದುವ ಸಂಪೂರ್ಣ ನಿಯಂತ್ರಣ ಮತ್ತು ಸೆಟ್ಟಿಂಗ್ಗಳಿಗಾಗಿ ಬಯಸಿದರೆ Text Generation WebUI.
- ಬ್ರೌಸರ್-ಪ್ರಥಮ ಗೌಪ್ಯತೆ ಅಥವಾ ಡೆಮೋಗಳಿಗೆ? WebLLM.
ಮಾರ್ಕೆಟಿಂಗ್ ಮರುಕುಟ್ಟದೆ ಪ್ರದರ್ಶನ ನಿರೀಕ್ಷೆಗಳು
- ಚಿಕ್ಕ ಮಾದರಿಗಳು (3–8B): CPU ಗಳಲ್ಲಿಯೂ ಕೂಡ, ಕ್ವಾಂಟೈಜೆಡ್ ಮಾದರಿಗಳು ಆರಾಮದಾಯಕವಾಗಿ ಚಾಟ್ ಮಾಡಬಹುದು. M-ಮಾಲಿನ ಮ್ಯಾಕ್ಗಳು ಅಥವಾ ಮಧ್ಯಮ ಶ್ರೇಣಿಯ GPU ಗಳಲ್ಲಿ ತಕ್ಷಣದಂತೆ ಅನುಭವ.
- ಮಧ್ಯಮ ಮಾದರಿಗಳು (13–34B): ಜಿಪಿಯು VRAM (12–24GB+) ಬೇಕಾಗಿರುತ್ತದೆ. 24GB VRAM ನಲ್ಲಿ, 13B–14B ಮಾದರಿಗಳು 4/5-ಬಿಟ್ ಕ್ವಾಂಟಿಂದ ತ್ವರಿತವೇ ಆಗಿದೆ ಚಾಟ್ ಮತ್ತು ಕೋಡ್ ಗೆ.
- ದೊಡ್ಡ ಮಾದರಿಗಳು (70B+): ಕ್ಲಸ್ಟರ್ ಅಥವಾ A100/H100 ಪ್ರದೇಶದಲ್ಲಿ ಆರಾಮಕ್ಕಾಗಿಅಧಿಕ. ಸ್ಥಳೀಯವಾಗಿ ಬಳಸಿದರೆ, ವ್ಯವಹಾರಗಳು: ಕ್ವಾಂಟೈಜೆಶನ್, ನಿಧಾನ ಲಭ್ಯತೆ, ಅಥವಾ ಸನ್ನಿವೇಶ ಸರ್ವರ್ ತಂತ್ರಗಳನ್ನು ನಿರೀಕ್ಷಿಸಿ.
ಡೆವಲಪರ್ ಅನುಕೂಲತೆ: Modelfiles, ಅಡಾಪ್ಟರ್ಗಳು, ಮತ್ತು ಕ್ಯಾಶೆ ಮಾಯಾಜಾಲ
- Ollama ನ Modelfiles LLM ಗಳಿಗೆ Dockerfiles ಹಾಗೆ. ನೀವು ಒಂದು ಮೂಲ ಮಾದರಿ ನಿರ್ಧರಿಸಿ, ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ಗಳು ಸೇರಿಸಿ, ಕೇವಲ ಒಂದು ಅಡಾಪ್ಟರ್ ಸೇರಿಸಿ, ಮತ್ತು ಬೂಮ್—ಪೋರ್ಟಬಲ್ ರೆಸಿಪಿ.
- vLLM ನ OpenAI-ಸಮ್ಮತಿತ ಸರ್ವರ್ ನಿಮ್ಮ ಅಪ್ಲಿಕೇಷನ್ ಕೋಡ್ ಅನ್ನು ಬದಲಿಸುವ ಅಗತ್ಯವಿಲ್ಲದೆ ಕಾಣಿಸುತ್ತದೆ. ಅದು ದೊಡ್ಡ ಪಠ್ಯಗಳು ನಿಮ್ಮ ಜ್ಞಾಪಕವನ್ನು ಒZieCbಗಳು ಆಗದಂತೆ ಮೈತ್ರಿ ಪೋಷಿಸುತ್ತದೆ.
- Text Generation WebUI ಗೆ LoRA, ಕ್ವಾಂಟೈಜೇಶನ್, ಮತ್ತು ಶ್ಯಾಂಪ್ಲಿಂಗ್ ತಂತ್ರಗಳು ಮೇಲೆ ನೇರ ನಿಯಂತ್ರಣಗಳಿವೆ. ಪ್ರಾಂಪ್ಟ್ ಪ್ರಯೋಗಗಳು ಮತ್ತು ತಲೆಮೇಲೆ ಹೋಲಿಕೆಗಳಿಗೆ ಅದ್ಭುತ.
RAG ಮತ್ತು ಏಜೆಂಟ್ಗಳು: ಮೂಲವನ್ನು ಆರಿಸಿ, ಉಪಕರಣಗಳನ್ನು ತೊರೆಸಿರಿ
Retrieval-augmented generation (RAG) ಇಂದ ಹೆಚ್ಚು ಜನರು ಜೀವಿಸುತ್ತಿದ್ದಾರೆ—ನಿಮ್ಮ ಡಾಕ್ಸ್, ಟಿಕೆಟ್ಗಳು ಅಥವಾ PDF ಗಳಿಂದ ಕೇಳಲಪಟ್ಟ ಪ್ರಶ್ನೆಗಳಿಗೆ, ಡೇಟಾವನ್ನು ಕ್ಲೌಡ್ಗೆ ಕಳುಹಿಸದೇ.
- ಬ್ಯಾಕ್ಎಂಡ್: ನೀವು ವೇಗ ಮತ್ತು ಸಹಸಂಕರಣೆ ಬೇಡಿದರೆ vLLM ಬಳಸಿ, ಅಥವಾ ಸ್ಥಳೀಯ ಡೆವ್ ಮತ್ತು ಸಣ್ಣ ತಂಡ ನಿಯೋಜನೆಗೆ Ollama.
- ಫ್ರೇಮ್ವರ್ಕ್: LangChain ಅಥವಾ LlamaIndex ಪ್ಲಂಬಿಂಗ್ ನಿರ್ವಹಿಸಲು—ಡಾಕ್ಯುಮೆಂಟ್ ಕುಕ್, ಇಂಬೆಡ್ಡಿಂಗ್, ಕ್ಯಾಶಿಂಗ್.
- ಇಂಬೆಡ್ಡಿಂಗ್ಗಳು: ಅನೇಕ ರನ್ನರ್ಗಳು ಈಗ ಸ್ಥಳೀಯ ಇಂಬೆಡ್ಡಿಂಗ್ ಅಂತ್ಯದನ್ನ ತೆರೆದಿಡುತ್ತವೆ. ಇಲ್ಲದಿದ್ದರೆ, ಬೇರೆ ಸ್ಥಾನೀಯ ಇಂಬೆಡ್ಡಿಂಗ್ ಮಾದರಿಯನ್ನು ಜೋಡಿಸಿ.
- ಭದ್ರತೆ: ನಿಜವಾದ ಗ್ರಾಹಕ ಡೇಟಾಗೆ ಸಂಪರ್ಕಿಸಿದರೆ, PII ಮಸ್ಕಿಂಗ್ ಅಥವಾ ಮಿಗೂಡೇಶನ್ ಟೂಲ್ಗಳನ್ನು ಗಂಟಲೆ ಮೇಲೆ ಬೆಳೆಯಿರಿ.
ಕೋಸ್ಟ್, ಗೌಪ್ಯತೆ ಮತ್ತು ನಿಯಂತ್ರಣ: ಪರ್ಯಾಯಗಳು ಏಕೆ ಪ್ರಮುಖ
- ಖರ್ಚು: LLaMA.cpp ಮುಕ್ತ-ಮೂಲವಾಗಿದೆ, ಅನೇಕ ಪರ್ಯಾಯಗಳೂ ಹಾಗೆ. ನಿಮ್ಮ ಬಿಲ್ ಹಾರ್ಡ್ವೇರ್ ಮತ್ತು ವಿದ್ಯುತ್. vLLM ಜಿಪಿಯುಗಳನ್ನು ಹೆಚ್ಚು ಬಳಕೆ ಮಾಡಲು ಸಹಾಯ; Ollama ಕ್ಲೌಡ್ API ಕಾರ್ಯಚರಣೆ ತಪ್ಪಿಸಬಹುದು.
- ಗೌಪ್ಯತೆ: ಸ್ಥಳೀಯ ಚಾಲಕರು ನಿಮ್ಮ ಡೇಟಾವನ್ನು ಲೋಕಲ್ ನೇರವಾಗಿ ಗಡಿಪಾರು ಮಾಡುತ್ತವೆ. ಕಾನೂನು, ವೈದ್ಯಕೀಯ, ಅಥವಾ ”ನನ್ನ ಟಿಪ್ಪಣಿಗಳನ್ನು ತರಬೇತಿ ಸೆಟ್ಗಳಲ್ಲಿಟ್ಟುಕೊಳ್ಳಲು ಇಚ್ಛಿಸುವ” ಸಂದರ್ಭಗಳಿಗೆ ಇದಂ ಬಹುಮುಖ.
- ನಿಯಂತ್ರಣ: Modelfiles, ಅಡಾಪ್ಟರ್ಗಳು, ಮತ್ತು ಮುಕ್ತ ತೂಕಗಳು ಇವೆ, ನೀವು ಕಪ್ಪು ಬಾಕ್ಸ್ ಗೆ ಅಂಟಿಕೊಂಡಿಲ್ಲ. ಮಾದರಿಗಳನ್ನು ಬದಲಿಸಿ—ಇಂದು Mistral, ನಾಳೆ Llama 3, ಮತ್ತು Phi-3 ನಿಮಗೆ ಚಿಕ್ಕದು ಮತ್ತು ಚತುರ.
ಪ್ರೋಸ್ ಮತ್ತು ಕೊನ್ಸ್ ಸಾರಾಂಶ (ಕಿರು, ನಿಷ್ಠುರ, ಕಳ್ಳದಿಲ್ಲದೆ)
- ಪ್ರೋಸ್: ಅತಿಸರಳ, ಒಳ್ಳೆಯ ಪೂರ್ವನಿಯೋಜನೆಗಳು, ಲ್ಯಾಪ್ಟಾಪ್ಗೆ ಸೂಕ್ತ, ಸ್ವಚ್ಚ API.
- ಕಾನ್ಸ್: ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ತುಂಬಾ ವೇಗವಂತಿಕೆಯಲ್ಲ; ಪ್ರಯೋಗಾಲಯ ಉಪಕರಣಗಳಿಗೆ ಕಡಿಮೆ ಎಸೋಟೆರಿಕ್ ನಿಯಂತ್ರಣಗಳು.
- ಪ್ರೋಸ್: ಮೇಲ್ವಿಚಾರಣೆ GPU ಪ್ರವಾಹ, ಬ್ಯಾಚಿಂಗ್, ಉದ್ದಕೊನೆಯನ್ನು ಬೆಂಬಲಿಸಿ, ಉತ್ಪಾದನಾ ಸ್ನೇಹಿ.
- ಕಾನ್ಸ್: ಭಾರೀ ಸೆಟ್ಅಪ್, ಜಿಪಿಯು ಅಗತ್ಯ.
- ಪ್ರೋಸ್: ಮೆರೆದ GUI, ಸುಲಭ ಮಾದರಿ ಕಂಡುಹಿಡಿದು, ವೇಗದ ಸರ್ವರ್ ಸ್ವಿಚ್.
- ಕಾನ್ಸ್: ಶುದ್ದ CLI ಪರಿಹಾರಗಳಿಗಿಂತ ಕಡಿಮೆ ಸ್ಕೆ್ರಿಪ್ಟ್ ಸಾಧ್ಯತೆ.
- Open WebUI (+ Ollama/vLLM)
- ಪ್ರೋಸ್: ತಂಡಕ್ಕೆ ಸ್ನೇಹಪೂರ್ಣ ಇಂಟರ್ಫೇಸ್, ಪ್ಲಗಿನ್ ವ್ಯವಸ್ಥೆ, ಮಾದರಿ-ನಿರಪೇಕ್ಷ.
- ಕಾನ್ಸ್: ಎರಡು ಚಲಿಸುವ ಭಾಗಗಳನ್ನು ನಿರ್ವಹಿಸಬೇಕು; ಪರಿಣಾಮವಾದ ಬ್ಯಾಕ್ಎಂಡ್ ಮೇಲೆ ಅವಲಂಬಿತ.
- ಪ್ರೋಸ್: ಗರಿಷ್ಠ ನಿಯಂತ್ರಣ, ವಿಸ್ತೀರ್ಣ ಸಮುದಾಯ ವಿಸ್ತಾರಣೆಗಳು.
- ಕಾನ್ಸ್: ಹೆಚ್ಚು ಕಠಿಣ ಕಲಿಕೆ; ಪ್ರಯೋಗಾಲಯದ ಬ್ಯಾಚ್ಮೆಂಟ್ ಅನುಭವ.
- ಪ್ರೋಸ್: ಬ್ಯಾಕ್ಎಂಡ್ ಜಿರೋ, ಗೌಪ್ಯ-ಪ್ರಾಥಮಿಕ ಡೆಮೋಗಳು.
- ಕಾನ್ಸ್: ಬ್ರೌಸರ್/ಹೊರನಡೆ ಸಂಪನ್ಮೂಲಗಳಿಂದ ನಿಯಂತ್ರಿತ; ಭಾರೀ ಕೆಲಸಕ್ಕೆ ಸರಿಹೊಂದುತ್ತಿಲ್ಲ.
- ಪ್ರೋಸ್: ಕ್ರಾಸ್ಪ್ಲಾಟ್ಫಾರ್ಮ್ ವೇಗವರ್ಧನೆ, ಅನೇಕ ಗುರಿಗಳನ್ನು ನಿಯೋಜಿಸಬಹುದಾದ.
- ಕಾನ್ಸ್: ಹೆಚ್ಚಿನ ಡೆವ್ ಪ್ರಯತ್ನ; ಉತ್ಪನ್ನ ನಿರ್ಮಾಣ ತಂಡಗಳು.
ನಿಜಜೀವನ ಮಿನಿ-ಪರಿಸ್ಥಿತಿಗಳು ನಿಮ್ಮನ್ನು ಅತಿಸೂಕ್ಷ್ಮ ಮಾಡಬಾರದು
- ಪ್ರತ್ಯೇಕ ಅಭಿವೃದ್ಧಿಪರನ MacBook Air ನಲ್ಲಿನ ಸ್ಥಳೀಯ ಟಿಪ್ಪಣಿ ಸಹಾಯಕ ನಿರ್ಮಿಸುವ ಸಿಂಗಲ್ ಡೆವಲಪರ್: Ollama ಸ್ಥಾಪಿಸಿ, Q4 ನಲ್ಲಿ 7B ಮಾದರಿಯನ್ನು ಚಾಲನೆ ಮಾಡಿ, ಇಂಬೆಡ್ಡಿಂಗ್ ಅಂತ್ಯವನ್ನು ಸೇರಿಸಿ ಮತ್ತು ಸರಳ RAG ಸರಪಳಿಗೆ ಸಂಪರ್ಕಿಸಿ. ನಿಮ್ಮ ಕಾಫಿ ತಣ್ಣನೆಯಾಗುವ ಮೊದಲು ಮುಗಿದುಹೋಗುತ್ತೀರಿ.
- 4090 ಬಾಕ್ಸ್ ಮತ್ತು Slack ಬಾಟ್ ಹೊಂದಿದ ಸ್ಟಾರ್ಟಪ್: ವೇಗಕ್ಕಾಗಿ vLLM ನೊಂದಿಗೆ ಮಾದರಿಗಳನ್ನು ಸರ್ವ್ ಮಾಡಿ. ಒಳನಾಡಿನಲ್ಲಿ Open WebUI ಬಳಸಿ ತೆಕ್ನೀಶಿಯಲ್ಲದವರು ಪ್ರಾಂಪ್ಟ್ ಪರೀಕ್ಷೆ ಮಾಡಬಹುದು. OpenAI-ಅನುಕೂಲಿತ ಮಾರ್ಗವನ್ನು ಸೇರಿಸಿ ನಿಮ್ಮ ಅಪ್ಲಿಕೇಶನ್ ಕೋಡ್ ಶುಭ್ರವಾಗಿರಲೆಂದು ಈಡೇರಿಸಿ.
- ಪೇಪರ್ ಗೆ 10 ಮಾದರಿಗಳನ್ನು ಹೋಲಿಸುತ್ತಿರುವ ಸಂಶೋದಕ: LM Studio ತ್ವರಿತ ಸ್ಪಿನ್ ಮತ್ತು ಲಾಗ್ಗಳಿಗಾಗಿ ಅಥವಾ ಜಟಿಲ ಶ್ಯಾಂಪ್ಲಿಂಗ್ ನಿಯಂತ್ರಣಗಳು ಮತ್ತು ದೃಶ್ಯ-ವೀಕ್ಷಣೆ ಬೇಕಾದರೆ Text Generation WebUI.
- ಶ್ಯಾಸ್ತ್ರಿಗೆ, ವಿದ್ಯಾರ್ಥಿ ದತ್ತಾಂಶ ಹೊರಹೋಗದೆ AI ಡೆಮೋ ಮಾಡಲು: WebLLM ಬ್ರೌಸರ್ನಲ್ಲಿ ಸಣ್ಣ ಮಾದರಿಯೊಂದಿಗೆ. ಮಾಯಾಜಾಲ ಅನ್ಲಾಕ್ಡ್.
ಗಮನಿಸಲು ಯೋಗ್ಯ: Sider.AI ನಿಮ್ಮ AI ಸಹాయకರಾದ್ಹಾಗಿರಬಹುದು ಇಲ್ಲಿ
ಗಮನಿಸಿ: ನೀವು ಆಯ್ಕೆಗಳನ್ನು ನಿಯಂತ್ರಿಸುತ್ತಿದ್ದರೆ, Sider.AI ನಿಮಗೆ ಪ್ರಾಂಪ್ಟ್ ಮತ್ತು ಕಾರ್ಯಪ್ರವಾಹಗಳನ್ನು ವೇಗವಾಗಿ ಪರೀಕ್ಷಿಸಲು ಸಹಾಯ ಮಾಡಬಹುದು, ನಂತರ ಬ್ಯಾಕ್ಎಂಡ್ಗಳನ್ನು ಬದಲಾಯಿಸಿ ನಿಮ್ಮ ಜೀವನ ಕಥೆಯನ್ನು ಪುನರ್ವರಾಯಿಸುವ ಅಗತ್ಯವಿಲ್ಲದೆ. ಇದನ್ನು ಮನಃಶಾಂತಿ ಪರಿಶೀಲನ ಪದರವೆಂದು ಭಾವಿಸಿ: ಸ್ಥಳೀಯ Ollama ಮಾದರಿಯನ್ನುೊಂದಿಗೆ ಪ್ರೋಟೋಟೈಪ್ ಮಾಡಿ, vLLM ಅಂತ್ಯದೊಡನೆ ಹೋಲಿಸಿ, ಮತ್ತು ನಿಮ್ಮ ಪ್ರಾಂಪ್ಟ್ ಮತ್ತು ಡಾಕ್ಸ್ ಒಂದೇ ಸ್ಥಳದಲ್ಲಿ ಇಟ್ಟುಕೊಳ್ಳಿ. ಇದು ನಿಮ್ಮ GPU ಆಯ್ಕೆ ಮಾಡುವುದಿಲ್ಲ, ಆದರೆ ನಿಮ್ಮ ಪ್ರಯೋಗಗಳನ್ನು “final-final-v3” ಎಂಬ 19 ವಿಭಿನ್ನ ಫೋಲ್ಡರ್ಗಳಿಗೆ ಹರಡದಂತೆ ಸಹಾಯ ಮಾಡಬಹುದು. ಸೆಟ್ಅಪ್ ಸнэಪ್ಷಾಟ್ಗಳು: “ಹೇಲೋ, ಮಾದರಿ” ಗೆ 얼마나 ಬೇಗ ತಲುಪಬಹುದು?
ollama run mistral (ಅಥವಾ llama3, phi3, ಇತ್ಯಾದಿ)
- OpenAI-ಹೋಲಿದ ಕ್ಲೈಯೆಂಟ್ ಮೂಲಕ ಕರೆ ಮಾಡಿ
- ನಿಮ್ಮ HF ಮಾದರಿ ಪಥ ಮತ್ತು ಜಿಪಿಯು ಸಂರಚನೆಗಳೊಂದಿಗೆ ಸರ್ವರ್ ಪ್ರಾರಂಭಿಸಿ
- ಅಪ್ಲಿಕೇಶನ್ ನಿಂದ OpenAI-ಅನುಕೂಲಿತ API ಮಾರ್ಗವನ್ನು ಕರೆ ಮಾಡಿ
- ಅಪ್ಲಿಕೇಶನ್ ಡೌನ್ಲೋಡ್ ಮಾಡಿ
- ಲೈಬ್ರೆರಿಯಿಂದ ಮಾದರಿ ಆಯ್ಕೆ ಮಾಡಿ
- ರನ್ ಕ್ಲಿಕ್ ಮಾಡಿ; ಐಚ್ಛಿಕವಾಗಿ ಸ್ಥಳೀಯ ಸರ್ವರ್ ಟೋಗಲ್ ಮಾಡಿ
docker run ಚಿತ್ರವನ್ನು ಚಾಲನೆ ಮಾಡಿ
- Ollama ಅಥವಾ vLLM ನ್ನು ಬ್ಯಾಕ್ಎಂಡ್ ಆಗಿ ಸೂಚಿಸಿ
- ತಂಡದ ಸದಸ್ಯರನ್ನು招待 ಮಾಡಿ ಮತ್ತು ಪ್ರಾಂಪ್ಟ್ ಹೋಲಿಕೆ ಪ್ರಾರಂಭಿಸಿ
ಇಲ್ಲ, ನಾನು ಡ್ರೈವರ್ ತಲೆನೋವುಗಳನ್ನು ಮರೆತಿಲ್ಲ. ನೀವು Windows ನಲ್ಲಿ NVIDIA ಇದ್ದರೆ ಡ್ರೈವರ್ ಮತ್ತು CUDA ನವೀಕರಣ ಮಾಡಿ. macOS ನಲ್ಲಿ Metal ಭಾರವಾದ ಕಾರ್ಯವನ್ನು ನಿಭಾಯಿಸುತ್ತದೆ. ಲಿನಕ್ಸಿನಲ್ಲಿ, ನೀವು ಈಗಾಗಲೇ ತಿಳಿದಿರುವಿರಿ ಅಥವಾ ಫೋರಮ್ಗಳನ್ನು ಆಸ್ವಾದಿಸುತ್ತೀರಿ.
ನಿಮ್ಮ ರನ್ನರ್ ಜೊತೆ ಸರಿಯಾದ ಮಾದರಿ ಕುಟುಂಬಗಳನ್ನು ಆರಿಸುವುದು
- Llama 3 ಮತ್ತು ಸ್ನೇಹಿತರು: ಅತ್ಯುತ್ತಮ ಸಾಮಾನ್ಯ ಚಾಟ್ ಮತ್ತು ತರ್ಕ, ರನ್ನರ್ ಗಳು ಮತ್ತು ಕ್ವಾಂಟ್ ಫಾರ್ಮ್ಯಾಟುಗಳಿಗೆ ಬಲವಾದ ಬೆಂಬಲ.
- Mistral/Mixtral: ವೇಗ ಮತ್ತು ಸಾಮರ್ಥ್ಯದ ಉತ್ಕೃಷ್ಟ ಸಮತೋಲನ; Ollama ಮತ್ತು vLLM ಲೋಕದಲ್ಲಿ ಜನಪ್ರಿಯ.
- Phi-3: ಚಿಕ್ಕದಾಗಿದರೂ ಶಕ್ತಿಶಾಲಿ. CPU/Mac ಸೆಟ್ಅಪ್ ಗಾಗಿ ಮತ್ತು ತ್ವರಿತ ಪ್ರತಿಕ್ರಿಯೆಗಳಿಗಾಗಿ ಪರಿಪೂರ್ಣ.
- Qwen, Gemma, DeepSeek ಬದಲಾಗುವಿಕೆಗಳು: ಕೋಡ್ ಮತ್ತು ವಾಸ್ತವಿಕ ಪ್ರಶ್ನೆ-ಉತ್ತರಕ್ಕಾಗಿ ಪರೀಕ್ಷಿಸಲು ಬುದ್ಧಿವಂತಿಕೆ; ಅನೇಕ instruct-tuned ತೂಕಗಳನ್ನು ಒಳಗೊಂಡಿವೆ.
ಪ್ರೊ ಟಿಪ್: ಪ್ರತಿ ಉಪಯೋಗದ ಬಗ್ಗೆ ಎರಡು ಅಥವಾ ಮೂರು ಮಾದರಿಗಳನ್ನು ಪ್ರಯತ್ನಿಸಿ. ಕೋಡಿಂಗ್ ಗೆ “code” ಟ್ಯೂಂಡ್ ಬದಲಾಗುವುದನ್ನು. ಪ್ರಶ್ನೆ-ಉತ್ತರಕ್ಕೆ “instruct” ಟ್ಯೂಂಡ್. ಸೃಜನಶೀಲತೆಗೆ, ಚಿಕ್ಕ ಮಾದರಿಗಳು ತ್ವರಿತ ಪುನರಾವರ್ತನೆಗೆ ಆಶ್ಚರ್ಯಕಾರಿ ಆಗಬಹುದು.
ಟ್ರಬಲ್ಶೂಟಿಂಗ್ ಕುಂಠಿತ ಇಲ್ಲದೆ
- CPU ಮೇಲೆ ನಿಧಾನ ಟೋಕನ್? ಸಣ್ಣ ಕ್ವಾಂಟ(Q4) ಅಥವಾ ಸಣ್ಣ ಮಾದರಿ (7B) ಬಳಸಿ. ಅಗತ್ಯವಿದ್ದರೆ ಮಾತ್ರ ಸಂಧರ್ಭವನ್ನು ಹೆಚ್ಚಿಸಿ.
- GPU ಮೇಲೆ VRAM ದೋಷ? ಕಡಿಮೆ ನಿಖರತೆಯ (4-ಬಿಟ್), ಲಾಂಗ್ ಕಾನ್ಟೆಕ್ಸ್ಟ್ ಬದಲು ರೋಪ್ ಸ್ಕೇಲಿಂಗ್ ಬಳಸಿ, ಅಥವಾ ಸಣ್ಣ ಮೂಲ ಮಾದರಿ ಪ್ರಯತ್ನಿಸಿ.
- ಚಪ್ಪಟೆ ಹರಿವು? ಬ್ಯಾಚಿಂಗ್ ಅಥವಾ KV ಕ್ಯಾಶ್ ಗಾತ್ರಗಳನ್ನು ಪರಿಶೀಲಿಸಿ; vLLM ಇಲ್ಲಿ ಅದ್ಭುತ. Ollama ನಲ್ಲಿ, ಸಹವಿನಂತಿಗಳ ಸಂಖ್ಯೆ ಕಡಿಮೆ ಇಡಿ.
- ವಿಚಿತ್ರ ಔಟ್ಪುಟ್ಗಳು? ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಮರುಹೊಂದಿಸಿ, ಮತ್ತೊಂದು instruct-ಟ್ಯೂಂಡ್ ಮಾದರಿಯನ್ನು ಪ್ರಯತ್ನಿಸಿ, ಅಥವಾ ಟೋಕನೈಜೇಶನ್ ಸೆಟ್ಟಿಂಗ್ಗಳನ್ನು ಪರಿಶೀಲಿಸಿ.
ಕುದEvaluೇ: LLaMA.cpp ಬದಲಾಗಿ ಏನೇ ಆಯ್ಕೆಮಾಡುವುದು
- ಸ್ಥಳೀಯ ಅನುಭವ ಮೃದುವಾಗಿದ್ದು, ಕನಿಷ್ಠ ಸೆಟ್ಅಪ್ ಇರುವ ಸ್ವಚ್ಚ API ಬೇಕಾದರೆ Ollama ಆಯ್ಕೆಮಾಡಿ.
- ವೇಗ, ವ್ಯಾಪ್ತಿ ಮತ್ತು ಉತ್ಪಾದನಾ-ತಯಾರ ಸರ್ವರ್ ಬೇಕಾದರೆ vLLM.
- ನೋಟ-ಒಳಗೊಂಡ ಡೆಸ್ಕ್ಟಾಪ್ ಅಪ್ಲಿಕೇಶನ್ ಅನುಭವ ಮತ್ತು ದ್ರುತ ಮಾದರಿ ಕಂಡುಹಿಡಿತಿಗೆ LM Studio.
- ಒಟ್ಟುಗೂಡಿಸಿಕೊಂಡು ಕೆಲಸ ಅಥವಾ ಅನೇಕ ಪ್ರಾಂಪ್ಟ್ ಹೋಲಿಕೆಗಳಿಗೆ Open WebUI ಸೇರಿಸಿ.
- ಪರಿಹಾರಕಾರಿ ನಿಯಂತ್ರಣಗಳು ಮತ್ತು ಆಳವಾದ ಪ್ರಯೋಗಕ್ಕಾಗಿ Text Generation WebUI ಬಳಸಿ.
- ಬ್ರೌಸರ್-ಪ್ರಥಮ ಮತ್ತು ಗೌಪ್ಯತೆ ಡೆಮೋಗಳಿಗೆ WebLLM.
ನೀವು ಮಧ್ಯರಾತ್ರಿ ಕರ್ಣೆಲ್ ಸಂಯೋಜಿಸುವ ವ್ಯಕ್ತಿಯಾಗಬೇಕಾಗಿಲ್ಲ, ರಾತ್ರಿಭೋಜನಕ್ಕೆ ಚಾಟ್ಬಾಟ್ ಕೇಳಲು. LLaMA.cpp ಅದ್ಭುತ ಆದರೆ ಈ ಪರ್ಯಾಯಗಳು ಸಹ. ನಿಮ್ಮ ಸಮಯ, ಹಾರ್ಡ್ವೇರ್ ಮತ್ತು ಮಿದುಳಿಗೆ ಗೌರವಿಸುವುದನ್ನು ಆರಿಸಿ. ನಂತರ ಮುಖ್ಯ ಸಂಗತಿಗಳಿಗೆ ಮರು ಹಿಂತಿರುಗಿ. ನಿಮ್ಮ ಮಾದರಿಯನ್ನು “ನನ್ನ ಹಿಂದೆಗುಂಡ ಎರ್ರೂರು ತೆರೆದಿಟ್ಟ ಇಮೇಲ್ಗಳು” ಬದಲು “Kind regards” ಬರೆದಿದ್ದನ್ನು ನಿಲ್ಲಿಸುವಂತೆ ಕಲಿಸಿ.
ಅನೇಕ ಪ್ರಶ್ನೆಗಳು (FAQ)
Q1: ಹೊಸವರಿಗೆ ಅತ್ಯುತ್ತಮ LLaMA.cpp ಪರ್ಯಾಯ ಯಾವುದು?
Ollama ಅಥವಾ LM Studioಂದಿಂದ ಆರಂಭಿಸಿ. ಎರಡೂ ಸ್ಥಳೀಯ ಮಾದರಿಗಳನ್ನು ಸರಳ, ವೇಗವಾಗಿ, ಸ್ನೇಹಪೂರ್ವಕವಾಗಿ ಮಾಡುವಂತದ್ದು, ಕಡಿಮೆ ಸೆಟ್ಅಪ್ ಮತ್ತು ಬಲವಾದ ಮಾದರಿ ಲೈಬ್ರರಿ ಜೊತೆ. ನೀವು ಸ್ಥಳೀಯ AI ಶಕ್ತಿಯನ್ನೂ ಕಳೆದುಕೊಳ್ಳದೆ ಸುಲಭ ಪ್ರವೇಶ ಹೊಂದುವಿರಿ.
Q2: GPU ಕೆಲಸಗಳಿಗೆ vLLM LLaMA.cpp ಗಿಂತವೇ ಹೆಚ್ಚು ವೇಗವಿದೆಯೇ?
ಸಾಮಾನ್ಯವಾಗಿ ಹೌದು. vLLM ಹೆಚ್ಚಿನ ಪ್ರವಾಹದ ಜಿಪಿಯು ಇನ್ಫರೆನ್ಸ್ಗಾಗಿ ಬ್ಯಾಚಿಂಗ್ ಮತ್ತು ಸುಧಾರಿತ KV ಕ್ಯಾಶೆ ತಂತ್ರಗಳೊಂದಿಗೆ ನಿರ್ಮಿಸಲಾಗಿದ್ದು, ನೀವು ವೇಗ ಮತ್ತು ವ್ಯಾಪ್ತಿಯನ್ನು ಬಯಸಿದರೆ ಅದು ಶಕ್ತಿಯಂತಿರುವ LLaMA.cpp ಪರ್ಯಾಯ.
ಪ್ರಶ್ನೆ 3: RAG ಮತ್ತು ಸ್ಥಳೀಯ ಹುಡುಕಾಟಕ್ಕಾಗಿ ನಾನು LLaMA.cpp ಪರ್ಯಾಯಗಳನ್ನು ಬಳಸಬಹುದೇ?
ಖಂಡಿತವಾಗಿ. ಎಂಬೆಡಿಂಗ್ಗಳು ಮತ್ತು ರಿಟ್ರೈವಲ್ಗಾಗಿ LangChain ಅಥವಾ LlamaIndex ನೊಂದಿಗೆ Ollama ಅಥವಾ vLLM ಅನ್ನು ಜೋಡಿಸಿ. ನಿಮ್ಮ ಡಾಕ್ಯುಮೆಂಟ್ಗಳನ್ನು ಕ್ಲೌಡ್ಗೆ ಸಾಗಿಸದೆ ನೀವು ಖಾಸಗಿ, ಸ್ಥಳೀಯ RAG ಅನ್ನು ಪಡೆಯುತ್ತೀರಿ.
ಪ್ರಶ್ನೆ 4: Apple ಸಿಲಿಕಾನ್ನಲ್ಲಿ macOS ಗೆ ಯಾವ ಪರ್ಯಾಯವು ಉತ್ತಮವಾಗಿದೆ?
Ollama ಮತ್ತು LM ಸ್ಟುಡಿಯೋ ಎರಡೂ ಮೆಟಲ್ ವೇಗವರ್ಧನೆಯೊಂದಿಗೆ Apple ಸಿಲಿಕಾನ್ನಲ್ಲಿ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ. Mistral, Llama 3 ಮತ್ತು Phi-3 ನಂತಹ ಸಣ್ಣ ಮತ್ತು ಮಧ್ಯಮ ಗಾತ್ರದ ಮಾದರಿಗಳು ವೇಗವಾಗಿರುತ್ತವೆ ಮತ್ತು ನಿಮ್ಮ ಫ್ಯಾನ್ಗಳನ್ನು ಶಾಂತವಾಗಿರಿಸುತ್ತವೆ.
ಪ್ರಶ್ನೆ 5: ಈ ಪರ್ಯಾಯಗಳೊಂದಿಗೆ ಉತ್ತಮ ಫಲಿತಾಂಶಗಳನ್ನು ಪಡೆಯಲು ನನಗೆ GPU ಅಗತ್ಯವಿದೆಯೇ?
GPU ಸಹಾಯ ಮಾಡುತ್ತದೆ, ಆದರೆ ಅದು ಕಡ್ಡಾಯವಲ್ಲ. ಕ್ವಾಂಟೈಸ್ಡ್ 7B–8B ಮಾದರಿಗಳೊಂದಿಗೆ, CPU ನಲ್ಲಿರುವ Ollama ಅಥವಾ LM ಸ್ಟುಡಿಯೋ ಇನ್ನೂ ಘನ ಚಾಟ್ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡುತ್ತದೆ. ಭಾರೀ ಕೆಲಸದ ಹೊರೆ ಅಥವಾ ದೊಡ್ಡ ಮಾದರಿಗಳಿಗಾಗಿ, GPU ಹೊಂದಿರುವ vLLM ಅದ್ಭುತವಾಗಿದೆ.