จัดสเปค AI Workstation: เลือก GPU, VRAM, RAM และ PSU อย่างไร

สรุปสั้น: เลือก AI Workstation จากงาน โมเดล และขนาดข้อมูล ไม่ใช่เลือก GPU จากคำว่า AI อย่างเดียว VRAM มักเป็นข้อจำกัดหลัก แต่ CPU, RAM, SSD, PSU และระบบระบายความร้อนต้องสมดุลและเผื่ออัปเกรด
คำว่า “AI Workstation” ถูกใช้กับเครื่องตั้งแต่โน้ตบุ๊กที่มีการ์ดจอแยก ไปจนถึงเครื่องหลาย GPU ราคาหลักล้าน จึงไม่แปลกที่หลายคนจัดสเปคผิดทาง: บางคนซื้อการ์ดจอแพงสุดแต่ RAM ไม่พอโหลดข้อมูล บางคนได้การ์ดจอที่ VRAM ไม่พอกับโมเดลที่อยากรัน หรือ PSU และเคสรับการ์ดไม่ไหว บทความนี้ให้วิธีคิดแบบเริ่มจากงานจริงและตัวเลขที่วัดได้ ทั้ง VRAM, RAM, พื้นที่เก็บข้อมูล ความร้อน และไฟฟ้า เพื่อให้ได้เครื่องที่ใช้งานได้ทันทีและยังอัปเกรดต่อได้เมื่อโมเดลใหญ่ขึ้น โดยไม่ผูกกับรุ่นสินค้าหรือราคา ณ ช่วงเวลาใดเวลาหนึ่ง
เริ่มจาก Workload ที่วัดได้
ระบุว่าจะทำ Inference, Fine-tuning, Computer Vision, สร้างภาพ หรือพัฒนาซอฟต์แวร์ รวมถึง Framework และระบบปฏิบัติการที่ใช้ ตรวจ Compatibility จากเอกสารผู้ผลิตก่อนซื้อ เพราะซอฟต์แวร์บางชุดรองรับฮาร์ดแวร์และไดรเวอร์ไม่เหมือนกัน งานแต่ละแบบใช้ทรัพยากรต่างกันชัดเจน
Inference: รันโมเดลที่ฝึกมาแล้ว
- ตัวตัดสินคือ VRAM ต้องพอใส่น้ำหนักโมเดล (weights) พร้อม Context ที่ใช้ ส่วนความเร็วขึ้นกับแบนด์วิดท์หน่วยความจำของการ์ด
- LLM ท้องถิ่นขนาดเล็กถึงกลางแบบ Quantized รันบนการ์ดจอระดับผู้ใช้ทั่วไปได้ ถ้า VRAM พอ
- ถ้าให้บริการหลายคนพร้อมกัน ต้องเผื่อ VRAM สำหรับ Batch และ KV Cache เพิ่มจากตัวโมเดล
Fine-tuning และ Training
- ใช้ VRAM มากกว่า Inference หลายเท่า เพราะต้องเก็บ Gradient, Optimizer State และ Activation
- เทคนิคอย่าง LoRA/QLoRA ลดความต้องการ VRAM ลงมาก ทำให้ปรับโมเดลขนาดกลางบนการ์ดเดียวได้
- งานที่ต้องฝึกนาน ๆ ต้องการระบบระบายความร้อนและ PSU ที่รับโหลดเต็มต่อเนื่องได้เป็นวัน
Computer Vision สร้างภาพ และวิดีโอ
- Dataset ภาพและวิดีโอกินพื้นที่มหาศาล SSD เร็วและใหญ่มีผลต่อเวลาโหลดพอ ๆ กับการ์ดจอ
- งานสร้างภาพความละเอียดสูงหรือวิดีโอ ใช้ VRAM เพิ่มตามความละเอียดและจำนวนเฟรม
- CPU มีผลกับการเตรียมข้อมูล เช่น Decode ภาพ Resize และ Augmentation ที่ทำก่อนส่งเข้า GPU
พัฒนาซอฟต์แวร์ที่เรียกใช้ AI
- ถ้าส่วนใหญ่เรียก API ภายนอก เครื่องทำงานทั่วไปที่ RAM 32GB ก็เพียงพอ ไม่ต้องลงทุน GPU แรง
- ถ้าต้องรันโมเดลท้องถิ่นเพื่อทดสอบ เลือกการ์ดที่ VRAM พอกับโมเดลที่ทีมใช้จริง ไม่ใช่โมเดลที่ใหญ่ที่สุดในตลาด
VRAM คือเพดานของงานบน GPU
น้ำหนักโมเดล (weights), Batch Size, ความยาว Context และความละเอียดของข้อมูล ล้วนใช้ VRAM หากไม่พอ งานอาจรันไม่ได้หรือต้อง Offload ไป RAM ซึ่งช้าลงหลายเท่า การเลือกควรอิงการทดสอบหรือ Requirement ของโมเดล พร้อมเผื่อพื้นที่อย่างสมเหตุผล ไม่ควรใช้ตัวเลขรุ่นเดียวแทนทุก Workflow
ประมาณ VRAM คร่าว ๆ ก่อนซื้อ
- น้ำหนักโมเดลโดยประมาณ = จำนวนพารามิเตอร์ × ขนาดต่อพารามิเตอร์ (FP16 ราว 2 ไบต์, 8-bit ราว 1 ไบต์, 4-bit ราวครึ่งไบต์)
- บวก Overhead สำหรับ Context, KV Cache และ Framework อีกราว 20–30% ขึ้นกับการใช้งาน
- ตัวอย่าง: โมเดล 7B แบบ FP16 ใช้ราว 14GB เฉพาะน้ำหนักโมเดล ส่วนแบบ 4-bit เหลือราว 4–5GB จึงรันบนการ์ด 8GB ได้ แต่ FP16 ต้องการการ์ด 16GB ขึ้นไป
- ตัวเลขข้างต้นเป็นการประมาณเพื่อวางแผน ควรทดสอบกับโมเดลและ Framework ที่ใช้จริงก่อนสั่งซื้อทุกครั้ง
หนึ่งการ์ดใหญ่ หรือหลายการ์ดเล็ก
- การ์ดเดียวที่ VRAM มากพอ ใช้งานง่ายที่สุด ซอฟต์แวร์ส่วนใหญ่รองรับดีโดยไม่ต้องตั้งค่าเพิ่ม
- หลายการ์ดช่วยเรื่องรันหลายงานพร้อมกันหรือแบ่งโมเดลใหญ่ แต่ต้องการเมนบอร์ด PSU และเคสที่รองรับ และซอฟต์แวร์ต้องรองรับ Multi-GPU
- ถ้าไม่แน่ใจ เริ่มจากการ์ดเดียวแล้ววางระบบให้เพิ่มการ์ดที่สองได้ภายหลัง คุ้มกว่าซื้อหลายการ์ดตั้งแต่แรก
ทำให้ทั้งระบบสมดุล
การ์ดจอทำงานได้เต็มที่ก็ต่อเมื่อชิ้นส่วนรอบข้างป้อนข้อมูลทัน เครื่องที่มีการ์ดแรงแต่ RAM น้อยหรือ SSD ช้า จะมีช่วงที่การ์ดจอรอข้อมูลเฉย ๆ ซึ่งเป็นการเสียเงินโดยไม่ได้ประโยชน์
RAM และ CPU
- RAM ควรมากกว่า Working Set ที่ต้องโหลดและรองรับ Data Pipeline โดยไม่ Swap บ่อย จุดเริ่มต้นที่ใช้กันคือ RAM อย่างน้อยเท่ากับหรือมากกว่า VRAM รวม และ 32–64GB สำหรับงานจริงจัง
- CPU มีผลกับการเตรียมข้อมูล Compile และงานที่ไม่ได้รันบน GPU เลือกรุ่นที่มีคอร์พอและ PCIe Lane เพียงพอกับจำนวนการ์ดและ SSD
พื้นที่เก็บข้อมูล
- NVMe SSD ช่วยโหลด Dataset และ Checkpoint ควรแยกระบบ งานปัจจุบัน และ Backup ตามความเหมาะสม
- Checkpoint ของโมเดลใหญ่ไฟล์ละหลายสิบ GB พื้นที่หมดเร็วกว่าที่คิด เผื่อไว้อย่างน้อย 2 เท่าของ Dataset
- ถ้าหลายเครื่องใช้ Dataset ชุดเดียวกัน NAS ที่ต่อด้วยสาย LAN ความเร็วสูงช่วยลดการก๊อปปี้ซ้ำ ดูแนวทางใน วางระบบเน็ตเวิร์กออฟฟิศเล็ก
เมนบอร์ด PSU และเคส
- เมนบอร์ดต้องมีสล็อต ระยะห่าง และ PCIe Lane พอกับแผน GPU ทั้งวันนี้และการ์ดที่สองในอนาคต
- PSU ต้องรองรับกำลังไฟและ Peak Load ของการ์ดจอรุ่นใหม่ที่กระชากไฟสูงชั่วขณะ พร้อมหัวต่อที่ถูกต้อง เผื่อวัตต์ตามหลักใน จัดสเปคคอมตามงบ
- เคสต้องมีความยาวและความหนารองรับการ์ดจอ รวมถึงพื้นที่ให้อากาศไหลผ่าน ไม่ใช่แค่ “ใส่ได้”
ความร้อน เสียง และไฟฟ้า
GPU ที่ทำงานต่อเนื่องปล่อยความร้อนสูงเทียบเท่าเครื่องทำความร้อนขนาดเล็ก เคสต้องมี Airflow และพื้นที่จริง ห้องทำงานต้องระบายอากาศได้ ตรวจวงจรไฟและปลั๊กสำหรับเครื่องกำลังสูง อย่าดัดแปลงสายไฟหรือใช้หัวแปลงที่ไม่ได้มาตรฐาน
- วางเครื่องในจุดที่อากาศเข้าและออกได้ ไม่ชิดผนังหรือใต้โต๊ะที่ปิดทึบ
- ห้องที่เปิดเครื่อง AI ทั้งวัน อุณหภูมิห้องสูงขึ้นชัดเจน เครื่องปรับอากาศต้องรับภาระเพิ่ม
- การลด Power Limit ของการ์ดจอลงเล็กน้อยมักลดความร้อนและเสียงได้มาก โดยประสิทธิภาพลดเพียงเล็กน้อย แต่ควรทดสอบเสถียรภาพหลังปรับ
- ใช้ UPS ที่รับกำลังไฟของเครื่องได้จริง เพื่อปิดเครื่องอย่างปลอดภัยและไม่เสีย Checkpoint ที่กำลังเขียน
- ตรวจว่าเต้ารับและเบรกเกอร์ในห้องรองรับเครื่องกำลังสูงหลายเครื่องพร้อมกัน โดยเฉพาะเมื่อใช้ร่วมกับเครื่องปรับอากาศ
เมื่อไรควรใช้ Cloud แทน
หากใช้งานเป็นครั้งคราว ต้องลอง GPU หลายขนาด หรือโครงการยังอยู่ช่วงทดลอง Cloud ช่วยลดเงินก้อน แต่มีค่าใช้จ่ายตามเวลาและเรื่องการย้ายข้อมูล เครื่องในองค์กรเหมาะเมื่อใช้งานสม่ำเสมอ ต้องควบคุมข้อมูล หรือมีทีมดูแล ควรเทียบต้นทุนรวม 1–3 ปีแทนการดูราคาเครื่องอย่างเดียว
- Cloud เหมาะเมื่อ ใช้ไม่กี่ชั่วโมงต่อสัปดาห์ ต้องการ GPU รุ่นใหญ่ชั่วคราว หรือยังไม่แน่ใจว่าจะใช้ขนาดไหน
- เครื่องเองเหมาะเมื่อ รันงานทุกวัน ข้อมูลออกนอกองค์กรไม่ได้ หรือค่า Cloud รายเดือนใกล้เคียงค่าเครื่องหารด้วยอายุใช้งาน
- ผสมกันได้ ใช้เครื่องเองสำหรับพัฒนาและ Inference ประจำวัน แล้วใช้ Cloud เฉพาะช่วงฝึกโมเดลใหญ่
- อย่าลืมคิดค่าไฟ ค่าดูแล และเวลาที่ทีมต้องใช้ดูแลเครื่องเองเข้าไปในต้นทุนรวมด้วย
ข้อมูลและ Backup ของงาน AI
Dataset ที่ทำความสะอาดแล้ว Checkpoint ที่ฝึกมาหลายวัน และสคริปต์ที่ปรับจนได้ผล คือทรัพย์สินที่แพงกว่าตัวเครื่อง ควรมีสำเนาอยู่นอกเครื่องทำงานตามหลัก 3-2-1 และแยกพื้นที่ทดลองออกจากพื้นที่เก็บผลลัพธ์ที่ใช้จริง เพราะเครื่องที่รันงานหนักต่อเนื่องมีโอกาสที่ SSD จะเสื่อมเร็วกว่าเครื่องทั่วไป
เช็กลิสต์ก่อนสั่งประกอบ
- บันทึกชื่อ Software, Version, OS และ Driver ที่รองรับ พร้อมโมเดลที่จะใช้จริง
- ประมาณ VRAM, RAM, Storage และระยะเวลาใช้งานต่อเนื่องต่อวัน
- ตรวจขนาด GPU, PSU, สายไฟ, Airflow และน้ำหนักเครื่องกับโต๊ะที่จะวาง
- วาง Backup, UPS และแผนอัปเกรด (การ์ดที่สอง RAM เพิ่ม SSD เพิ่ม) ตั้งแต่แรก
- ทดสอบ Burn-in อุณหภูมิ Memory และรันงานตัวอย่างจริงก่อนรับเครื่อง