คัดลอกแล้ว
Ubuntu Server 24.04 LTS

คู่มือติดตั้ง Ollama AI
แบบครบขั้นตอน

รัน LLM แบบ Local บนเครื่องคุณเอง ด้วย Ollama — ไม่ต้องพึ่ง Cloud, ไม่ต้องจ่ายเงินรายเดือน รองรับ Llama, Mistral, Gemma และอีกมากมาย

1
คำสั่งติดตั้ง
11434
พอร์ต API
0
บาท/เดือน
100%
Offline
1

ภาพรวม Ollama AI บน Ubuntu Server 24.04

Ollama คือระบบรัน LLM (เช่น Llama, Mistral, Gemma) แบบ Local บนเครื่องคุณ โดยไม่ต้องใช้ Cloud ทำงานได้ทันทีหลังติดตั้ง มี API พร้อมใช้งาน

รัน AI แบบ Offline

ไม่ต้องเชื่อมอินเทอร์เน็ตหลังดาวน์โหลด Model

API พร้อมใช้งาน

localhost:11434 รองรับ REST API เต็มรูปแบบ

รองรับ CPU / GPU

สลับไปใช้ GPU อัตโนมัติเมื่อตรวจพบ

ใช้ RAM เป็นหลัก

จำนวน RAM กำหนดขนาด Model ที่รันได้

2

ความต้องการระบบ (RAM Based Recommendation)

RAM เป็นตัวกำหนดความสามารถหลัก — สำคัญกว่า CPU อย่างมาก 8B model ใช้ RAM ประมาณ 6–10GB, 13B model ใช้ RAM ประมาณ 12–20GB

RAM ประเภทเครื่อง Model แนะนำ ความเร็ว การใช้งาน
8 GB Mini Server / VPS เล็ก llama3.2:1b / tiny models ช้า ทดลอง / Dev
12 GB Home Server mistral 7B Q4 ปานกลาง Chat bot ส่วนตัว
16 GB Standard Server llama3.1 8B ดี ใช้งานจริง
24 GB Advanced Server mixtral 8x7B (quantized) เร็ว AI Assistant
32 GB High Performance llama3.1 8B + 13B models เร็วมาก Production / Multi model

หมายเหตุสำคัญ: RAM = ตัวกำหนดความสามารถหลัก (สำคัญกว่า CPU) ถ้า RAM ไม่พอ Model จะรันไม่ได้ หรือระบบจะใช้ Swap ทำให้ช้ามากจนใช้งานไม่ได้

3

เตรียมระบบ Ubuntu Server 24.04

อัปเดตระบบและติดตั้งเครื่องมือที่จำเป็นก่อนเริ่มติดตั้ง Ollama

Bash
sudo apt update && sudo apt upgrade -y
sudo apt install -y curl wget git

ตรวจสอบปริมาณ RAM บนเครื่องเพื่อเลือก Model ที่เหมาะสม:

Bash
free -h

ดูที่คอลัมน์ available ในผลลัพธ์ — นั่นคือ RAM ที่ใช้งานได้จริง ไม่ใช่ total

4

ติดตั้ง Ollama (วิธีมาตรฐาน)

ใช้สคริปต์ติดตั้งอย่างเป็นทางการ — คำสั่งเดียวจบ:

Bash
curl -fsSL https://ollama.com/install.sh | sh

หลังติดตั้งเสร็จ เปิด service ให้ทำงานอัตโนมัติ:

Bash
sudo systemctl enable ollama
sudo systemctl start ollama

ข้อควรรู้: สคริปต์จะติดตั้ง Ollama ไว้ที่ /usr/local/bin/ollama และสร้าง systemd service ให้อัตโนมัติ

5

ตรวจสอบการทำงาน

ตรวจสอบเวอร์ชัน Ollama และสถานะ service:

Bash
ollama --version

systemctl status ollama

ทดสอบว่า API ทำงานหรือยัง (ควรได้รับ Ollama is running):

Bash
curl http://localhost:11434

ถ้าได้ผลลัพธ์กลับมาแสดงว่า Ollama ทำงานปกติ พร้อมรับ Model แล้ว

6

ดาวน์โหลด AI Model (เลือกตาม RAM)

เลือก Model ให้เหมาะกับ RAM ของเครื่อง — คำสั่ง ollama run จะดาวน์โหลด + รันในครั้งเดียว:

8 GB RAM

llama3.2:1b

Model เล็กที่สุด เหมาะทดลองระบบ

Bash
ollama run llama3.2:1b
ทดลอง / Dev
24–32 GB RAM

llama3.1:13b / mistral

คุณภาพสูง เหมาะ Production

Bash
ollama run mistral
ollama run llama3.1:13b
Production

ครั้งแรกจะช้า: Model ขนาด 8B ประมาณ 4.7 GB — หลังดาวน์โหลดแล้ว ครั้งต่อไปจะเร็วขึ้นมากเพราะมีในเครื่องแล้ว

7

ทดสอบใช้งาน AI (Chat Test)

เมื่อรัน Model ด้วย ollama run จะเข้าสู่โหมด REPL (พิมพ์สนทนาได้เลย):

REPL
>>> อธิบาย AI แบบง่าย ๆ

AI (Artificial Intelligence) คือระบบที่สามารถเรียนรู้...

>>> ช่วยเขียนโค้ด Python
แน่นอน! นี่คือตัวอย่าง...

หรือส่งคำถามผ่าน CLI แบบ one-shot (ไม่เข้า REPL):

Bash
ollama run llama3.1:8b "อธิบาย machine learning"

กด Ctrl + D เพื่อออกจากโหมด REPL

8

ทดสอบผ่าน API (สำหรับระบบจริง)

Ollama มี REST API พร้อมใช้งานที่ localhost:11434 — นี่คือหัวใจสำคัญที่ทำให้เชื่อมต่อกับแอปพลิเคชันอื่นได้:

Bash + JSON
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "เขียนโค้ด Python หาค่า factorial"
}'

จุดนี้สำคัญมาก: API นี้ใช้โครงสร้างเดียวกับ OpenAI API ทำให้สามารถเชื่อมต่อกับเฟรมเวิร์กต่าง ๆ เช่น LangChain, Open WebUI ได้ทันที

9

โครงสร้างโมดูลระบบ (Architecture)

ลักษณะการทำงานของ Ollama แบบเป็นชั้น ๆ:

Ubuntu 24.04 Server Ollama Service (systemd) Model Manager (LLM Models) ├── llama3.1 ├── mistral ├── gemma API Layer (:11434) ├── CLI (ollama run) ├── REST API └── Web UI (optional)
10

Module ทดสอบระบบ (Testing Checklist)

คลิกแต่ละรายการเพื่อทำเครื่องหมายว่าทดสอบแล้ว:

  • Test 1: Service ทำงานปกติ systemctl status ollama
  • Test 2: Model โหลดสำเร็จ ollama list
  • Test 3: Chat ทำงานได้ ollama run llama3.1:8b "hello"
  • Test 4: ตรวจสอบหน่วยความจำ htop — ดูว่า RAM ใช้ไปเท่าไร
11

Optimization (สำคัญมาก)

ลด RAM ที่ใช้โดยจำกัดจำนวน Model ที่โหลดพร้อมกัน:

Env
export OLLAMA_MAX_LOADED_MODELS=1
export OLLAMA_KEEP_ALIVE=5m

เพื่อเพิ่ม performance โดยรวม:

ใช้ SSD

Model โหลดเร็วขึ้นมากเทียบกับ HDD

RAM ≥ 16GB

สำหรับ production แนะนำอย่างยิ่ง

ปิด service ไม่จำเป็น

ปล่อย RAM ให้ Ollama ใช้มากที่สุด

เคล็ดลับ: ใส่ env ไว้ใน /etc/systemd/system/ollama.service.d/override.conf เพื่อให้คงอยู่ถาวรหลังรีบูต

12

Troubleshooting

RAM ไม่พอ

เปลี่ยนเป็น model ขนาดเล็กลง เช่น llama3.2:1b หรือ 3B แทน 8B — ตรวจสอบด้วย free -h

ช้าเกินไป

ใช้ quantized model (เช่น Q4) เพื่อลดขนาด ลด context length หรือเพิ่ม RAM

Service ไม่ start

ดู log จริงเพื่อหาสาเหตุ:

Bash
journalctl -u ollama -f

สรุปแบบเร็ว

8GB
ทดลอง
Model เล็ก ๆ
16GB
ใช้งานจริง
8B Model ลื่นไหล
32GB
Production
Multi-model พร้อมใช้
1 คำสั่ง
ติดตั้ง
curl | sh
API
พร้อมใช้ทันที
:11434

ขั้นต่อไป

หลังจากติดตั้งเสร็จแล้ว สามารถต่อยอดได้หลายทางเลือก:

ติดตั้ง Open WebUI

หน้าตาเหมือน ChatGPT ใช้งานง่าย

ทำ AI Server ใน LAN

เปิดให้เครื่องอื่นในเน็ตเวิร์คเรียกใช้ได้

API สำหรับ Python / Node.js

เชื่อมต่อกับแอปของคุณเอง

Docker + Ollama

แบบ Production พร้อม orchestration