在 GNU/Linux 的独立 Nvidia GPU 上运行命令(例如 ollama)
要确保某个命令 (CLI) 使用的是你 GNU/Linux 中的 NVIDIA GPU, 可以在命令前加上环境变量 __NV_PRIME_RENDER_OFFLOAD=1 和 __GLX_VENDOR_LIBRARY_NAME=nvidia。
示例:
__NV_PRIME_RENDER_OFFLOAD=1 __GLX_VENDOR_LIBRARY_NAME=nvidia ollama run orca-mini
你也可以运行以下命令来验证是否生效:
__NV_PRIME_RENDER_OFFLOAD=1 __GLX_VENDOR_LIBRARY_NAME=nvidia glxinfo | grep vendor
输出应该会类似这样:
server glx vendor string: NVIDIA Corporation
client glx vendor string: NVIDIA Corporation
OpenGL vendor string: NVIDIA Corporation
开始使用
要开始使用 Ollama,你需要先确认系统符合必要条件。这包括兼容的操作系统(例如 Linux、Windows 或 macOS)以及兼容的显卡(例如 NVIDIA GPU)。你可以在 Ollama 网站上查看系统需求。
确认系统符合需求之后,就可以安装 Ollama。你可以使用官方安装脚本,在终端运行以下命令:curl -s https://raw.githubusercontent.com/ollama/ollama/master/install.sh | bash
在 Nvidia GPU 上运行 Ollama
要在 NVIDIA GPU 上运行 Ollama,你需要确认已安装必要的驱动程序。你可以用这些命令检查 NVIDIA 驱动:nvidia-smi 或 ubuntu-drivers list --gpgpu 如果出现错误,可以用这条命令安装所需的驱动:sudo ubuntu-drivers install 装好驱动之后,就可以用以下命令在 NVIDIA GPU 上运行 Ollama:docker run -d --name ollama -p 11434:11434 -v /home/ollama:/home/ollama:z --gpus all ollama/ollama:gpu
部署 Web UI(可选)
如果你想通过网页界面和 Ollama 交互,可以使用 Open WebUI 部署一个 Web UI。你可以用 Docker 运行以下命令来安装 Open WebUI:docker run -d -p 8080:8080 open-webui/open-webui 安装完成后,打开浏览器并输入 http://localhost:8080 就能访问。你可以创建账号并选择一个模型,开始与 LLM 交互。
性能优化
要优化 Ollama 的性能,有几种技巧可以使用。其中一种是使用 GPU 加速版本的 Ollama,可以大幅提升性能。你也可以通过调整 batch size 和 sequence length 来优化 Ollama 的性能。
此外,你可以使用 nvidia-smi 之类的工具监控 GPU 的性能并据此调整设置。你也可以使用 docker stats 监控 Docker 容器的性能并据此调整设置。
按照这些技巧操作,你就能优化 Ollama 的性能,充分发挥系统的潜力。