以下是如何在本地部署基于 ollama 的 deepseek 模型的详细步骤。ollama 是一个用于在本地运行大型语言模型(llm)的工具,支持包括 deepseek 在内的多种模型。
一. 安装 Ollama
Ollama 支持 macOS 和 Linux 系统。以下是安装步骤:
macOS
打开终端。
运行以下命令安装 Ollama:
或者下载文件(
https://www.php.cn/link/bed6efa1f192db7c30ede96dbb9d76ee
。
Linux
打开终端。
运行以下命令安装 Ollama:
Windows
Ollama 目前不支持原生 Windows,但可以通过 WSL(Windows Subsystem for Linux)在 Windows 上运行。安装 WSL 后,按照 Linux 的步骤操作。
二. 下载 DeepSeek 模型
Ollama 支持从 Hugging Face 或其他来源加载模型。以下是下载和加载 DeepSeek 模型的步骤:
Midjourney AI 提示词工具
PHP中文网提供Midjourney AI 提示词在线生成工具,专为解决 AI 绘画“词穷”痛点而生,用户只需输入“一只猫”等简单想法,工具便能利用 AI 智能扩展出包含艺术风格、光影构图、镜头参数及负面提示词的专业级英文 Prompt。它完美兼容 Midjourney V8.1 及 Niji 模型,支持一键复制与参数自动优化,大幅降低创作门槛,是提升出图质量与效率的必备辅助神器。
下载
确保 Ollama 已安装并运行。
使用以下命令下载 DeepSeek 模型:
如果 DeepSeek 不在默认模型列表中,可以手动指定模型文件的路径或 URL。
运行 DeepSeek 模型
下载完成后,可以通过以下命令运行 DeepSeek 模型:
运行后,Ollama 会启动一个交互式终端,您可以直接与 DeepSeek 模型对话。
四. 通过 API 调用 DeepSeek 模型
Ollama 提供了一个本地 API,可以通过 HTTP 请求与模型交互。
启动 API 服务
运行以下命令启动 Ollama 的 API 服务:
默认情况下,API 会在
上运行。
发送请求
使用
或编程语言(如 Python)发送请求。以下是一个示例:
Python 示例:
五. 优化性能
如果模型运行速度较慢,可以尝试以下优化方法:
使用 GPU:确保
系统安装
了 CUDA 或 ROCm,并配置 Ollama 使用 GPU。
量化模型:将模型量化为较低精度(如 8-bit 或 4-bit),以减少内存占用和提高速度。
调整参数:降低
或
以减少计算量。
六. 常见问题
模型无法下载
检查网络连接,确保可以访问 Hugging Face 或模型源。
手动下载模型文件并指定路径。
性能不足
确保硬件满足要求(如足够的内存和 GPU)。
尝试量化模型或使用更小的模型变体。
API 无法访问
检查 Ollama 服务是否正常运行。
确保端口
未被占用。
七. 图像化界面
使用 chatboxai:下载
https://www.php.cn/link/de487db7a08250a136f966ead11da262
选择模型提供方:OLLAMA API
选择模型:deepseek-r1:1.5b
brew install ollamacurl -fsSL https://ollama.com/install.sh | shollama pull deepseek-r1:1.5bollama run deepseek-r1:1.5bollama servehttp://localhost:11434curlcurl http://localhost:11434/api/generate -d '{ "model": "deepseek", "prompt": "你好,介绍一下你自己", "stream": false}'import requests
url = "http://localhost:11434/api/generate"
data = {
"model": "deepseek",
"prompt": "你好,介绍一下你自己",
"stream": False
}
response = requests.post(url, json=data)
print(response.json())max_tokenstemperature11434