รันคำสั่งบน GPU Nvidia แบบ dedicated ของคุณบน GNU/Linux (เช่น ollama)
เพื่อให้แน่ใจว่าคำสั่ง (CLI) ใช้ NVIDIA GPU ของคุณบน GNU/Linux คุณสามารถใส่ environment variable __NV_PRIME_RENDER_OFFLOAD=1 และ __GLX_VENDOR_LIBRARY_NAME=nvidia ไว้ข้างหน้าคำสั่งของคุณได้
ตัวอย่าง:
__NV_PRIME_RENDER_OFFLOAD=1 __GLX_VENDOR_LIBRARY_NAME=nvidia ollama run orca-mini
คุณยังสามารถตรวจสอบว่าใช้งานได้จริงด้วยการรัน:
__NV_PRIME_RENDER_OFFLOAD=1 __GLX_VENDOR_LIBRARY_NAME=nvidia glxinfo | grep vendor
ซึ่งควรแสดงผลลัพธ์ประมาณนี้:
server glx vendor string: NVIDIA Corporation
client glx vendor string: NVIDIA Corporation
OpenGL vendor string: NVIDIA Corporation
เริ่มต้นใช้งาน
ในการเริ่มต้นใช้งาน Ollama คุณต้องแน่ใจก่อนว่าระบบของคุณตรงตามข้อกำหนดที่จำเป็น ซึ่งรวมถึงการมีระบบปฏิบัติการที่รองรับ เช่น Linux, Windows หรือ macOS และการ์ดจอที่รองรับ เช่น NVIDIA GPU คุณสามารถตรวจสอบข้อกำหนดของระบบได้ที่เว็บไซต์ของ Ollama
เมื่อยืนยันแล้วว่าระบบของคุณตรงตามข้อกำหนด ก็ติดตั้ง Ollama ได้เลย โดยใช้สคริปต์ติดตั้งอย่างเป็นทางการ ซึ่งรันใน terminal ได้ด้วยคำสั่ง: curl -s https://raw.githubusercontent.com/ollama/ollama/master/install.sh | bash
รัน Ollama บน Nvidia GPU
ในการรัน Ollama บน NVIDIA GPU คุณต้องแน่ใจว่าได้ติดตั้ง driver ที่จำเป็นแล้ว คุณสามารถตรวจสอบ driver ของ NVIDIA ได้ด้วยคำสั่ง: nvidia-smi หรือ ubuntu-drivers list --gpgpu ถ้าพบ error คุณสามารถติดตั้ง driver ที่จำเป็นด้วยคำสั่ง: sudo ubuntu-drivers install เมื่อติดตั้ง driver เสร็จแล้ว คุณสามารถรัน Ollama บน NVIDIA GPU ของคุณด้วยคำสั่งต่อไปนี้: docker run -d --name ollama -p 11434:11434 -v /home/ollama:/home/ollama:z --gpus all ollama/ollama:gpu
Deploy Web UI (ไม่บังคับ)
ถ้าคุณอยากใช้งาน Ollama ผ่านหน้าเว็บ คุณสามารถ deploy Web UI ด้วย Open WebUI ได้ โดยติดตั้ง Open WebUI ผ่าน Docker ด้วยคำสั่งต่อไปนี้: docker run -d -p 8080:8080 open-webui/open-webui เมื่อติดตั้ง Open WebUI เสร็จแล้ว ให้เปิด web browser แล้วเข้าไปที่ http://localhost:8080 คุณสามารถสร้างบัญชีและเลือก model เพื่อโต้ตอบกับ LLM ได้
ปรับแต่งประสิทธิภาพ
ในการปรับแต่งประสิทธิภาพของ Ollama มีเทคนิคอยู่หลายอย่าง วิธีหนึ่งคือใช้ Ollama เวอร์ชันที่เร่งความเร็วด้วย GPU ซึ่งช่วยเพิ่มประสิทธิภาพได้อย่างมาก คุณยังสามารถปรับแต่งประสิทธิภาพของ Ollama ได้ด้วยการปรับ batch size และ sequence length
นอกจากนี้ คุณสามารถใช้เครื่องมืออย่าง nvidia-smi เพื่อดูประสิทธิภาพของ GPU แล้วปรับการตั้งค่าตามความเหมาะสม รวมถึงใช้ docker stats เพื่อดูประสิทธิภาพของ Docker container แล้วปรับการตั้งค่าตามความเหมาะสมได้เช่นกัน
ทำตามเคล็ดลับเหล่านี้แล้ว คุณจะสามารถปรับแต่งประสิทธิภาพของ Ollama และใช้งานระบบของคุณได้อย่างเต็มที่