如何用 Fasten Share 共享 Ollama 与本地大模型
从 Ollama 连通性、模型名和 OpenAI 兼容接口,到 Fasten Share 后端配置、健康检查和常见故障,完成本地模型共享。
Ollama 让本地运行大语言模型变得简单,而 Fasten Share 可以把你有权对外提供的 Ollama 能力发布为可发现节点。消费者不会直接访问你的 Ollama 端口,而是调用 Fasten Share 生成的服务地址;生产者客户端接收请求后再访问本机 Ollama。
本教程假设你已经安装 Ollama,并理解开放本地算力会占用 CPU、GPU、内存、网络和电力。请只共享你有权提供的模型,并根据设备能力设置保守并发。
准备 Ollama 和模型
先在生产者设备上确认 Ollama 正常运行。查看本地模型:
ollama list
如果还没有模型,可以按 Ollama 当前文档拉取一个适合设备的模型。模型名称必须与 ollama list 返回结果一致;标签也是名称的一部分,例如 qwen2.5:7b 与 qwen2.5 可能不是同一个可调用标识。
使用 Ollama 原生接口做一次简单测试:
curl http://127.0.0.1:11434/api/generate \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5:7b","prompt":"reply with OK","stream":false}'
只有直连成功后,才继续配置 Fasten Share。若这里已经出现模型不存在、内存不足或连接失败,平台转发无法修复后端本身的问题。
选择可用协议
Fasten Share 生产者表单以协议决定健康检查和请求路径。Ollama 提供自己的原生 API,也提供部分 OpenAI 兼容能力;具体选择应以当前客户端中可用的协议预设和你已经验证的接口为准。
如果你使用 OpenAI 兼容入口,可以先测试:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model":"qwen2.5:7b",
"messages":[{"role":"user","content":"reply with OK"}],
"stream":false
}'
本地 Ollama 默认可能不需要 API Key。不要为了填满表单而随意填写一个虚假密钥;以客户端字段是否允许为空以及实际后端鉴权配置为准。
在 Fasten Share 中添加后端
从官方下载页安装客户端并登录,进入生产者页面,添加一个后端。常见配置思路如下:
| 字段 | 示例 | 说明 |
|---|---|---|
| 基础 URL | http://127.0.0.1:11434 | 通常只写主机和端口 |
| 协议 | OpenAI 兼容预设 | 以已验证的 Ollama 接口为准 |
| 版本前缀 | /v1 | 不要在基础 URL 中再次写入 |
| 模型 | qwen2.5:7b | 与 Ollama 实际模型标识完全一致 |
| API Key | 留空或按代理配置填写 | 原生本地 Ollama 通常不需要 |
| 最大并发 | 1 | 从低并发开始,避免显存或内存不足 |
保存并启动共享后,观察客户端是否显示连接成功、节点已注册和健康正常。健康检查会使用你配置的模型;第一个模型写错往往会让整个后端无法上线。
Docker 和局域网地址为什么容易出错
如果 Fasten Share 客户端直接运行在宿主机,127.0.0.1:11434 通常指向正确的 Ollama。若客户端运行在 Docker 容器中,容器里的 127.0.0.1 是容器自身,不是宿主机。
此时需要使用容器能够访问的宿主机地址,例如环境支持的 host.docker.internal,或把两个服务放进同一个 Docker 网络并使用服务名。不要把 Ollama 端口直接暴露到公网来绕过网络配置;Fasten Share 生产者本身使用出站连接,不要求消费者访问你的本地端口。
如果 Ollama 只监听回环地址,而生产者客户端在另一台机器上,也需要调整监听范围、防火墙和局域网访问策略。开放范围越大,越要增加鉴权和网络隔离。
如何设置并发和资源边界
本地大模型的瓶颈通常是显存、内存和生成速度。最大并发不是越高越好:多个请求同时加载上下文可能造成显存不足、系统换页或响应时间骤增。
建议先使用并发 1,完成多次消费者测试后再调整。还应关注:
- 模型首次加载所需时间;
- 长上下文对显存和响应延迟的影响;
- 设备休眠、合盖和系统更新;
- Ollama 的模型保留与释放策略;
- 网络上行稳定性以及平台调用超时。
常见问题排查
健康检查返回 404
通常是基础 URL 和版本前缀拼接错误。基础 URL 推荐只写 http://127.0.0.1:11434,版本路径放在单独字段;不要产生 /v1/v1/...。
返回 model not found
用 ollama list 复制完整模型标识,包括标签。然后使用同一个模型名执行直连 curl。
客户端连接不上本机 Ollama
确认客户端是否运行在 Docker、虚拟机或另一台设备。分别从客户端所在环境访问 Ollama 地址,而不是只在宿主机浏览器里测试。
请求一多就失败
降低最大并发,选择更小模型,缩短上下文,检查显存和内存。平台只能路由请求,不能增加本地硬件容量。
节点上线但没有调用
节点是否被选择取决于真实需求、模型名称、协议、在线状态、评分和积分倍率。上线不等于平台承诺流量或收益。
下一步
上线后,用消费者角色搜索自己的模型节点并完成一次全链路请求。确认响应能够流式返回、生产者日志没有异常,再逐步调整并发和倍率。如果你接入的不是 Ollama,而是云端或自建兼容接口,请继续阅读OpenAI 兼容、Anthropic 与 Azure OpenAI API 接入指南。