งาน LLM inference ภายในองค์กรของคุณ
LLM Server สำหรับ Qwen, Llama, DeepSeek
LLM server คือเครื่องที่รันโมเดลภาษาไว้ในองค์กร ให้พนักงานใช้งานพร้อมกันโดยข้อมูลไม่ออกนอกบริษัท เหมาะกับทีมที่ต้องการ AI ของตัวเอง ต้องใช้ VRAM ตามสองตัวเลข คือ ขนาดโมเดลคูณกับ precision และ KV cache ต่อผู้ใช้พร้อมกันหนึ่งคน หน้านี้อธิบายวิธีคำนวณทั้งสองส่วน ก่อนจะพูดถึงฮาร์ดแวร์
งานที่เรารองรับ
LLM server ทำอะไรให้องค์กรได้บ้าง
ก่อนเลือก GPU ต้องรู้ก่อนว่าจะใช้โมเดลทำอะไร งานแต่ละแบบดันทรัพยากรคนละด้าน แชทดันจำนวนผู้ใช้พร้อมกัน ส่วนการสรุปเอกสารดันความยาว context
แชทภายในองค์กร
พนักงานถามเรื่องงาน ร่างอีเมล สรุปการประชุม และค้นคำตอบจากโมเดลที่รันอยู่ในองค์กรเอง
สรุปเอกสารยาว
ย่อสัญญา รายงาน หรือรายงานการประชุมหลายสิบหน้า ให้เหลือเฉพาะประเด็นที่ต้องตัดสินใจ
แปลไทยและอังกฤษ
แปลเอกสารและข้อความภายใน โดยไม่ต้องส่งออกไปยังบริการภายนอก
ผู้ช่วยเขียนโค้ด
ผู้ช่วยเขียนโค้ดสำหรับทีมพัฒนา ที่อ่าน source code ภายในได้โดยโค้ดไม่ออกจากเครือข่าย
API ให้ระบบอื่นเรียกใช้
ระบบหลังบ้าน เว็บแอปภายใน หรือ workflow อัตโนมัติ เรียกโมเดลผ่าน API ที่เข้ากันได้กับ OpenAI
วิธีที่เราคำนวณ VRAM
VRAM ที่ต้องใช้คือการคำนวณสามส่วน
ไม่ต้องเดาจากชื่อ GPU เราคำนวณให้จากโมเดลที่คุณจะรันจริง แล้วเลือกการ์ดที่มี VRAM พอสำหรับโมเดลนั้น
01
weights
จำนวน parameter คูณกับจำนวน byte ต่อ parameter FP16 คือ 2 byte, INT8 คือ 1 byte, INT4 คือ 0.5 byte ส่วนนี้ต้องอยู่ใน VRAM ตลอดเวลา
02
KV cache
หน่วยความจำที่กันไว้ให้ผู้ใช้พร้อมกันแต่ละคน ขนาดโตตามความยาว context และตามโครงสร้างของโมเดล บทสนทนายาวจึงใช้มากกว่าคำถามสั้นหลายเท่า
03
overhead
เผื่อไว้ 10 ถึง 20% ให้ runtime ให้ activation ระหว่างประมวลผล และให้การแตกกระจายของหน่วยความจำ เครื่องที่พอดีเป๊ะคือเครื่องที่ล้ม
| โมเดล | จำนวน parameters | FP16 | INT4 |
|---|---|---|---|
| Qwen 7B | 7B | ~14 GB | ~4 GB |
| Llama 8B | 8B | ~16 GB | ~5 GB |
| Qwen 32B | 32B | ~64 GB | ~18 GB |
| DeepSeek R1 distill 32B | 32B | ~64 GB | ~18 GB |
| Llama 70B | 70B | ~140 GB | ~38 GB |
| Qwen 72B | 72B | ~144 GB | ~40 GB |
| DeepSeek V3 | 671B MoE | FP8 ~700 GB | ~350 GB |
ผู้ใช้พร้อมกัน
นับผู้ใช้พร้อมกัน ไม่ใช่จำนวนพนักงานทั้งบริษัท
engine สมัยใหม่รวมหลาย request เข้าเป็น batch เดียว GPU ตัวเดียวจึงตอบคนหลายคนพร้อมกันได้โดยไม่ต้องโหลดโมเดลหลายชุด ทุกบทสนทนาที่เปิดค้างไว้ถือ KV cache ของตัวเอง ความเร็วที่ผู้ใช้รู้สึกจึงขึ้นกับ context และจำนวนผู้ใช้พร้อมกัน ไม่ใช่ขนาดโมเดลอย่างเดียว
| รูปแบบการใช้งาน | ผู้ใช้พร้อมกัน | ขนาดเครื่อง | headroom ของ KV cache | หมายเหตุ |
|---|---|---|---|---|
| ทีมเดียว | 1 ถึง 10 | ระดับ Workstation | เหลือ VRAM ว่าง 20 ถึง 30% หลังโหลด weights แล้ว | โมเดล 32B ที่ INT4 ทำงานได้สบาย งานเอกสารยาวต้องการ headroom มากกว่านี้ |
| หลายทีมในฝ่ายเดียวกัน | 10 ถึง 40 | Server 1 GPU | เหลือ VRAM 30 ถึง 40% ไว้ให้ KV cache | การทำ batching เริ่มคุ้ม โมเดล 70B ที่ INT4 พอดีกับ 96 GB |
| หลายฝ่ายรวมกัน | 40 ถึง 150 | Server 4 GPU | กันการ์ดทั้งใบไว้ให้ KV cache ได้ | รันหลายโมเดลพร้อมกัน หรือรันโมเดลเดียวที่ FP16 เพื่อคุณภาพสูงสุด |
| ทั้งองค์กร | 150 ถึง 500 | Server 8 GPU | คำนวณจากโหลดช่วงพีค ไม่ใช่จากค่าเฉลี่ย | ต้องมีระบบคิวและ monitoring จริงจัง ไม่ใช่แค่เครื่องที่ใหญ่ขึ้น |
ซอฟต์แวร์ที่เราติดตั้งให้
เครื่องมาพร้อมสิ่งที่ทำให้ใช้งานได้จริง
ฮาร์ดแวร์อย่างเดียวยังไม่ใช่ระบบ AI เราติดตั้งชั้นซอฟต์แวร์ทั้งหมดให้ พนักงานจึงเปิดใช้และเริ่มทำงานได้ตั้งแต่วันแรก
- การเสิร์ฟโมเดล
- vLLM หรือ engine เทียบเท่า ตั้งค่า batching, paged KV cache และ quantization ให้ตรงกับ GPU ที่มีอยู่
- API ที่เข้ากันได้กับ OpenAI
- endpoint มาตรฐานภายในเครือข่ายของคุณ ระบบที่เคยเรียกบริการภายนอกเปลี่ยนมาชี้ที่นี่ได้ด้วยการเปลี่ยน URL และ key
- สิทธิผู้ใช้และแอปหน้าบ้าน
- ล็อกอิน สิทธิรายฝ่าย ประวัติบทสนทนา และการเลือกโมเดลตามกลุ่มผู้ใช้ ส่งมอบพร้อม Mimir Suites
- การมอนิเตอร์
- การใช้งาน GPU, VRAM, คิว request และเวลาตอบ เพื่อให้รู้ล่วงหน้าว่าเมื่อไรต้องเพิ่ม GPU
คำถามที่พบบ่อย
คำถามที่มักเกิดขึ้นก่อนสั่งเครื่อง
- มีโมเดลที่ใช้ภาษาไทยได้ดีไหม
- มี และเราเลือกจากงานจริงของคุณ ตระกูล Qwen ใช้ภาษาไทยได้ดีในหลายงาน และโมเดลที่ปรับมาสำหรับภาษาไทยอย่าง Typhoon ก็ควรนำมาเทียบด้วย เราทดสอบกับเอกสารและคำถามของคุณเองก่อนเลือกโมเดล แทนที่จะตัดสินจากคะแนนสาธารณะอย่างเดียว
- ถ้าจะย้ายไปใช้โมเดลรุ่นใหม่ต้องทำอย่างไร
- โมเดลเป็นไฟล์ที่อยู่บนเครื่องของคุณเอง เมื่อมีรุ่นใหม่ออกมา เราโหลดขึ้นมาคู่กับรุ่นที่ใช้อยู่ ทดสอบด้วยชุดคำถามเดิม แล้วเปลี่ยนเมื่อผลดีกว่าเท่านั้น รุ่นเดิมยังอยู่จนกว่าคุณจะพอใจ ดาวน์โหลดครั้งเดียวก็พอ และยังใช้งานต่อได้แม้ตัดอินเทอร์เน็ต
- ต้องต่ออินเทอร์เน็ตตลอดเวลาไหม
- ไม่ต้อง เมื่อโมเดลอยู่บนเครื่องแล้ว การทำ inference เกิดขึ้นภายในเครือข่ายของคุณทั้งหมด อินเทอร์เน็ตใช้เฉพาะตอนดาวน์โหลดโมเดลใหม่หรืออัปเดตซอฟต์แวร์ และคุณเป็นคนกำหนดว่าจะทำเมื่อไรและผ่านเส้นทางใด
- ขยายเครื่องภายหลังได้ไหม
- ได้ เราเลือกเคส power supply และเมนบอร์ดที่เหลือ slot GPU ไว้ตั้งแต่ต้น การเพิ่ม GPU ในเครื่องเดิมมักคุ้มกว่าการซื้อเครื่องใหม่ จนถึงจุดที่ต้องใช้ 8 GPU หรือหลายเครื่อง ซึ่งเราวางเส้นทางนั้นไว้ในข้อเสนอแรกอยู่แล้ว
บอกโมเดลและจำนวนผู้ใช้มา แล้วเราคำนวณขนาดเครื่องให้
ส่งมาว่าอยากให้โมเดลทำอะไร มีคนใช้กี่คน และเอกสารของคุณยาวแค่ไหน เราตอบกลับพร้อมการคำนวณ VRAM และสเปกเครื่องที่เหมาะกับงานนั้น