单独使用
您可以使用 docker-compose 在算力舱中单独部署服务。请根据算力舱机型选择对应的配置。
AGX Orin
yml
services:
ollama:
image: registry.lazycat.cloud/catdogai/jetson-ollama:0.17.5
volumes:
- /etc/timezone:/etc/timezone:ro
- ./data:/root/.ollama
environment:
- LANGUAGE=en_US:en
- LANG=en_US.UTF-8
- LC_ALL=en_US.UTF-8
- OLLAMA_DEBUG=1
- OLLAMA_ORIGINS=*
- OLLAMA_HOST=0.0.0.0
- OLLAMA_FLASH_ATTENTION=1
- OLLAMA_NUM_PARALLEL=4
- OLLAMA_CONTEXT_LENGTH=8192
- OLLAMA_KV_CACHE_TYPE=q8_0
- OLLAMA_LLM_LIBRARY=cuda_jetpack6
- LD_LIBRARY_PATH=/usr/local/lib/ollama:/usr/local/lib/ollama/cuda_jetpack6:/usr/local/cuda/compat:/usr/local/cuda/lib64
ports:
- 11434:11434
mem_limit: 60G
memswap_limit: 60GThor
yml
services:
ollama:
image: registry.lazycat.cloud/catdogai/jetson-ollama:0.17.5
volumes:
- /etc/timezone:/etc/timezone:ro
- ./data:/root/.ollama
environment:
- LANGUAGE=en_US:en
- LANG=en_US.UTF-8
- LC_ALL=en_US.UTF-8
- OLLAMA_DEBUG=1
- OLLAMA_ORIGINS=*
- OLLAMA_HOST=0.0.0.0
- OLLAMA_FLASH_ATTENTION=1
- OLLAMA_NUM_PARALLEL=4
- OLLAMA_KV_CACHE_TYPE=q8_0
- LD_LIBRARY_PATH=/usr/local/lib/ollama:/usr/local/cuda/lib64:/usr/local/cuda-13.0/lib64:/usr/lib/aarch64-linux-gnu/tegra:/usr/lib/aarch64-linux-gnu
ports:
- 11434:11434
mem_limit: 60G
memswap_limit: 60G将对应机型的配置保存为 docker-compose.yml,然后在同目录下使用 docker-compose up -d 启动。
在启动成功后,可以通过局域网中的 11434 端口进行访问.
ollama 最新版本会根据内存大小自动决定上下文长度。AGX Orin 算力舱的内存为 64G,默认分配的上下文可能较大,示例通过 OLLAMA_CONTEXT_LENGTH=8192 将上下文长度限制为 8k。
附加说明
如果您的算力舱上不能访问到 registry.lazycat.cloud,您可以切换到 dockerhub 上,可以通过 docker pull catdogai/jetson-ollama:0.17.5
ollama 经常更新,可能文档上没有及时更新,新的 ollama 版本 tag 可以在 https://hub.docker.com/r/catdogai/jetson-ollama/tags 页面中查看.