# Установка
curl -fsSL https://ollama.com/install.sh | sh
# Запускаем сервер, слушая все интерфейсы
OLLAMA_HOST=0.0.0.0:11434 ollama serve
# Скачиваем легковесную модель (Qwen 3.5 на 2B параметров — отлично для тестов)
ollama pull qwen3.5:2b
curl http://localhost:11434/api/tags | jqcurl http://<IP-ВАШЕГО-СЕРВЕРА>:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5:2b",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Объясни, что такое квантование модели, простыми словами."}
],
"temperature": 0.7,
"max_tokens": 500
}'git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
mkdir build && cd build
# Указываем путь к CUDA компилятору
export CUDACXX=/usr/local/cuda/bin/nvcc
cmake .. \
-DCMAKE_BUILD_TYPE=Release \
-DGGML_CUDA=ON \
-DLLAMA_CURL=ON \
-DGGML_CUDA_FA=ON \ # Flash Attention для ускорения
-DCMAKE_CUDA_ARCHITECTURES=89 # Укажите вашу архитектуру (например, 89 для RTX 40xx)
cmake --build . --config Release --target llama-server --parallelmkdir -p ./models
wget -O ./models/Qwen3.5-9B_Q4_k_m.gguf \
"https://huggingface.co/SandLogicTechnologies/qwen3.5-9b-GGUF/resolve/main/Qwen3.5-9B_Q4_k_m.gguf"./bin/llama-server \
-m ./models/Qwen3.5-9B_Q4_k_m.gguf \
--host 0.0.0.0 \
--port 8089 \
-c 16384 \
-ngl 40 \
--jinja # Включаем поддержку шаблонов токенизацииcurl http://<IP-ВАШЕГО-СЕРВЕРА>:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5:2b",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Объясни, что такое квантование модели, простыми словами."}
],
"temperature": 0.7,
"max_tokens": 500
}'