在 GNU/Linux 的獨立 Nvidia GPU 上執行指令(例如 ollama)
要確保某個指令 (CLI) 使用的是你 GNU/Linux 中的 NVIDIA GPU, 可以在指令前加上環境變數 __NV_PRIME_RENDER_OFFLOAD=1 和 __GLX_VENDOR_LIBRARY_NAME=nvidia。
範例:
__NV_PRIME_RENDER_OFFLOAD=1 __GLX_VENDOR_LIBRARY_NAME=nvidia ollama run orca-mini
你也可以執行以下指令來驗證是否生效:
__NV_PRIME_RENDER_OFFLOAD=1 __GLX_VENDOR_LIBRARY_NAME=nvidia glxinfo | grep vendor
輸出應該會類似這樣:
server glx vendor string: NVIDIA Corporation
client glx vendor string: NVIDIA Corporation
OpenGL vendor string: NVIDIA Corporation
開始使用
要開始使用 Ollama,你需要先確認系統符合必要條件。這包括相容的作業系統(例如 Linux、Windows 或 macOS)以及相容的顯示卡(例如 NVIDIA GPU)。你可以在 Ollama 網站上查看系統需求。
確認系統符合需求之後,就可以安裝 Ollama。你可以使用官方安裝腳本,在終端機執行以下指令:curl -s https://raw.githubusercontent.com/ollama/ollama/master/install.sh | bash
在 Nvidia GPU 上執行 Ollama
要在 NVIDIA GPU 上執行 Ollama,你需要確認已安裝必要的驅動程式。你可以用這些指令檢查 NVIDIA 驅動程式:nvidia-smi 或 ubuntu-drivers list --gpgpu 如果出現錯誤,可以用這個指令安裝所需的驅動程式:sudo ubuntu-drivers install 安裝好驅動程式之後,就可以用以下指令在 NVIDIA GPU 上執行 Ollama:docker run -d --name ollama -p 11434:11434 -v /home/ollama:/home/ollama:z --gpus all ollama/ollama:gpu
部署 Web UI(選用)
如果你想透過網頁介面和 Ollama 互動,可以使用 Open WebUI 部署一個 Web UI。你可以用 Docker 執行以下指令來安裝 Open WebUI:docker run -d -p 8080:8080 open-webui/open-webui 安裝完成後,打開瀏覽器並輸入 http://localhost:8080 就能存取。你可以建立帳號並選擇一個模型,開始與 LLM 互動。
效能最佳化
要最佳化 Ollama 的效能,有幾種技巧可以使用。其中一種是使用 GPU 加速版本的 Ollama,可以大幅提升效能。你也可以透過調整 batch size 和 sequence length 來最佳化 Ollama 的效能。
此外,你可以使用 nvidia-smi 之類的工具監控 GPU 的效能並據此調整設定。你也可以使用 docker stats 監控 Docker 容器的效能並據此調整設定。
依照這些訣竅操作,你就能最佳化 Ollama 的效能,充分發揮系統的實力。