รัน AI บน NAS UGREEN DXP4800 Pro ด้วย CPU อย่างเดียว ที่ 5 token/วินาที

ที่มาภาพ: XDA Developers

AI-อ่าน 7 นาทีXDA Developers

รัน AI บน NAS UGREEN DXP4800 Pro ด้วย CPU อย่างเดียว ที่ 5 token/วินาที

⚡ สรุป 30 วิ

ผู้ใช้ทดลองรันโมเดล AI บน NAS รุ่น UGREEN DXP4800 Pro โดยไม่มี GPU พบอัตราการสร้าง token ประมาณ 5 token ต่อวินาที…

Lead paragraph ผู้ใช้ได้ทดลองรันโมเดล AI บนเครื่อง NAS รุ่น UGREEN DXP4800 Pro ที่ไม่มี GPU แยก และพบว่าการทำงานด้วยการประมวลผลบน CPU อย่างเดียวให้ความเร็วประมาณ 5 token ต่อวินาที แม้ต้องรอคอยนานกว่าที่คาดหวัง แต่ก็พิสูจน์ได้ว่าเทคโนโลยี AI สามารถใช้งานได้จริงในสภาพแวดล้อมที่ไม่ออกแบบมาสำหรับการประมวลผลเชิงลึกนี้

Overview

NAS (Network‑Attached Storage) มักถูกใช้เพื่อเก็บข้อมูลและให้บริการไฟล์เครือข่ายเป็นหลัก การนำ NAS มาใช้เป็นแพลตฟอร์มสำหรับ AI inference จึงถือเป็นการทดลองที่ค่อนข้างแปลกใหม่ ผู้เขียนระบุว่าเครื่อง UGREEN DXP4800 Pro ไม่มี GPU แยก ซึ่งตามแนวคิดทั่วไปแล้ว AI โมเดลโดยเฉพาะรุ่นใหญ่ต้องอาศัยกราฟิกการ์ดเพื่อให้ได้ประสิทธิภาพที่เหมาะสม อย่างไรก็ตาม การทดลองนี้มุ่งเน้นไปที่ความเป็นไปได้และประโยชน์เชิงปฏิบัติของการใช้ CPU เพียงอย่างเดียว

จากบทความ ผู้เขียนเลือกติดตั้งซอฟต์แวร์ Ollama ซึ่งเป็น runtime สำหรับโมเดลภาษาเปิด‑source และต่อด้วย Open WebUI เพื่อให้มีอินเตอร์เฟซเว็บที่ใช้งานง่าย ขั้นตอนเหล่านี้ทำให้ NAS สามารถดึงโมเดลขนาดเล็ก (ประมาณ 4 billion parameters) มารันได้โดยไม่ต้องพึ่งพา GPU

Setup

การเตรียมระบบเริ่มต้นด้วยการติดตั้ง Ollama บน NAS ซึ่งรองรับสถาปัตยกรรม x86_64 ของ CPU ที่มีอยู่ จากนั้นผู้ใช้ทำการเชื่อมต่อ Open WebUI เข้ากับ Ollama ผ่าน API endpoint ภายในเครือข่ายท้องถิ่น การตั้งค่านี้ไม่จำเป็นต้องปรับแต่งพิเศษหรือเพิ่มฮาร์ดแวร์เสริมใด ๆ

  • ดาวน์โหลดและติดตั้งแพ็คเกจ Ollama จากที่จัดทำโดยผู้พัฒนา
  • ตั้งค่า Open WebUI ให้ชี้ไปยัง URL ของ Ollama บน NAS
  • ดึงโมเดลขนาด 4 B พารามิเตอร์ลงมาโดยใช้คำสั่งของ Ollama

ขั้นตอนเหล่านี้เสร็จสมบูรณ์ภายในไม่กี่นาที และทำให้ระบบพร้อมใช้งานทันที แม้จะเป็นการรันบน CPU เท่านั้น แต่กระบวนการตั้งค่าไม่ได้ซับซ้อนจนเกินความสามารถของผู้ใช้ระดับกลาง

Performance

ผลลัพธ์ที่ได้แสดงให้เห็นว่า อัตราการสร้าง token อยู่ที่ประมาณ 5 token/วินาที ซึ่งค่อนข้างช้าเมื่อเทียบกับ GPU‑accelerated inference ที่มักให้ค่ามากกว่าหลายสิบหรือหลายร้อย token ต่อวินาที อย่างไรก็ตาม ความเร็วนี้เพียงพอสำหรับการทดลองและการใช้งานที่ไม่ต้องการตอบสนองแบบเรียลไทม์

ผู้เขียนยอมรับว่าการรอคอยระหว่างคำสั่งต่อเนื่องนั้นยาวนานกว่าที่คาดหวัง แต่ก็ยังสามารถทำงานได้โดยไม่มีข้อผิดพลาดหรือความขัดข้องของระบบ นอกจากนี้ การใช้โมเดลขนาดเล็กช่วยลดภาระการใช้หน่วยความจำและเวลาในการโหลดโมเดล ทำให้ NAS สามารถทำงานต่อเนื่องเป็นชั่วโมงโดยไม่เกิดอาการหยุดทำงาน

Use Cases

แม้ว่าประสิทธิภาพจะไม่ได้สูงสุด แต่ก็มีกรณีการใช้งานที่เหมาะสมกับสภาวะนี้ ตัวอย่างเช่น การสร้างสรุปข้อมูลหรือบันทึกข้อความขนาดสั้น ๆ ที่ไม่ต้องการความเร็วสูง ผู้ใช้สามารถตั้งค่า prompt ที่สั้นและคาดหวังผลลัพธ์ในระดับหนึ่งได้โดยไม่มีค่าใช้จ่ายเพิ่มเติมจากคลาวด์

อีกด้านหนึ่งคือการใช้งานภายในองค์กรที่ต้องการเก็บข้อมูลสำคัญไว้บน NAS เท่านั้น เพื่อความเป็นส่วนตัว การรัน AI บนเครื่องเดียวกันกับที่จัดเก็บไฟล์ทำให้ไม่ต้องส่งข้อมูลออกไปยังบริการออนไลน์ใด ๆ ซึ่งลดความเสี่ยงด้านความปลอดภัยและช่วยปฏิบัติตามข้อกำหนดการคุ้มครองข้อมูลส่วนบุคคล

Analysis

จากมุมมองของเทคโนโลยี การทดลองนี้ชี้ให้เห็นว่า CPU‑only inference สามารถทำงานได้แม้บนอุปกรณ์ที่ไม่ได้ออกแบบมาเพื่อ AI อย่างเฉพาะเจาะจง ความสำเร็จขึ้นอยู่กับการเลือกโมเดลขนาดเล็กและซอฟต์แวร์ที่มีประสิทธิภาพเช่น Ollama ที่สามารถจัดการทรัพยากรระบบได้ดี

อย่างไรก็ตาม ประสิทธิภาพที่ 5 token/วินาที ยังคงเป็นข้อจำกัดสำคัญสำหรับงานที่ต้องการผลลัพธ์เร็วหรือโต้ตอบต่อผู้ใช้แบบเรียลไทม์ การใช้งานในระดับนี้จึงเหมาะกับงานเบื้องหลัง (batch) หรือสคริปต์อัตโนมัติที่ยอมรับเวลาในการประมวลผลเพิ่มขึ้น

อีกประเด็นหนึ่งคือ ต้นทุนพลังงาน เนื่องจาก NAS ทำงานตลอด 24 ชั่วโมง การรัน AI บน CPU เพิ่มภาระการใช้ไฟฟ้าโดยตรง ซึ่งผู้ใช้อาจต้องคำนึงถึงค่าใช้จ่ายด้านพลังงานในระยะยาว

Impact

ผลกระทบของการทดลองนี้อาจทำให้ผู้ใช้ NAS พิจารณาเพิ่มความสามารถ AI เข้าไปเป็นส่วนหนึ่งของโครงสร้างพื้นฐานที่มีอยู่แล้ว โดยไม่จำเป็นต้องลงทุนใน GPU หรือคลาวด์คอมพิวติ้ง นอกจากนี้ การเปิดเผยขั้นตอนและผลลัพธ์อย่างละเอียดยังช่วยกระตุ้นชุมชนโอเพ่นซอร์สให้พัฒนาเครื่องมือเพิ่มประสิทธิภาพการรันโมเดลบน CPU ต่อไป

สำหรับอุตสาหกรรมเทคโนโลยีสารสนเทศในประเทศไทย การใช้ NAS ร่วมกับ AI แบบ on‑premise สามารถเป็นทางเลือกที่เหมาะสมในการรักษาข้อมูลสำคัญภายในประเทศ ลดความเสี่ยงจากการส่งข้อมูลข้ามพรมแดน และสนับสนุนแนวคิด “Data sovereignty” อย่างต่อเนื่อง

Summary

ผู้ทดลองยืนยันว่า AI inference บน NAS UGREEN DXP4800 Pro สามารถทำงานได้แม้ไม่มี GPU โดยให้ความเร็วประมาณ 5 token ต่อวินาที แม้ต้องรอคอยมากกว่าที่คาดหวัง แต่ก็เพียงพอสำหรับการใช้งานบางประเภท การทดลองนี้แสดงศักยภาพของ CPU‑only AI ในสภาพแวดล้อมที่เน้นความเป็นส่วนตัวและต้นทุนต่ำ.

แชร์บทความนี้:

ชอบบทความแบบนี้?

สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม

แหล่งข่าวต้นฉบับ

ชื่อต้นฉบับ
I'm running AI on my NAS at 5 tokens per second, and it's surprisingly useful
ผู้เขียน
Jeff Butts
แหล่ง
XDA Developers
วันที่เผยแพร่
2 สิงหาคม 2569 เวลา 18:30

Related

บทความที่เกี่ยวข้อง

ทางเลือกใหม่ที่เร็วกว่าและเบากว่า LM Studio สำหรับผู้เริ่มต้นAI
24 กรกฎาคม 2569 เวลา 00:00

ทางเลือกใหม่ที่เร็วกว่าและเบากว่า LM Studio สำหรับผู้เริ่มต้น

LM Studio ยังคงเป็นเครื่องมือมือแรกยอดนิยม แต่มีทางเลือกใหม่ที่ใช้ RAM ต่ำกว่า 2 GB โหลดโมเดลในไม่กี่วินาที ทำงานผ่าน CLI เร็วและเบากว่า เหมาะกับอุปกรณ์สเปคต่ำ

XDA Developers5 นาที
ใส่สมอง AI ให้ NAS ผ่านแพลตฟอร์ม MCP เพื่อเปลี่ยนให้เป็นศูนย์กลางอัจฉริยะของบ้านAI
12 กรกฎาคม 2569 เวลา 07:00

ใส่สมอง AI ให้ NAS ผ่านแพลตฟอร์ม MCP เพื่อเปลี่ยนให้เป็นศูนย์กลางอัจฉริยะของบ้าน

ผู้เขียนติดตั้ง MCP บน NAS แล้วเชื่อมโมเดล AI เช่น GPT‑Neo ทำให้ระบบจัดการไฟล์และตอบคำสั่งเสียงได้แบบเรียลไทม์ การทำงานเพิ่มประสิทธิภาพในการค้นหา…

XDA Developers7 นาที
เปรียบเทียบเครื่องมือรัน LLM สี่ตัว พบว่า Ollama ทำงานเต็มศักยภาพAI
22 มิถุนายน 2569 เวลา 02:00

เปรียบเทียบเครื่องมือรัน LLM สี่ตัว พบว่า Ollama ทำงานเต็มศักยภาพ

ผู้เขียนทดสอบ LM Studio, Ollama, Text Generation WebUI และ llama.cpp บนคอมพิวเตอร์ระดับกลาง ผลการทดสอบพบว่า Ollama สามารถดึงศักยภาพของโมเดลได้เต็มที่ ทั้งด้าน…

XDA Developers7 นาที
AI บนเครื่องท้องถิ่นเข้าถึงง่ายขึ้น แต่ VRAM GPU ยังคงเป็นข้อจำกัดหลักAI
19 มิถุนายน 2569 เวลา 19:30

AI บนเครื่องท้องถิ่นเข้าถึงง่ายขึ้น แต่ VRAM GPU ยังคงเป็นข้อจำกัดหลัก

LM Studio และ Ollama ทำให้การรันโมเดลภาษาใหญ่บนคอมพิวเตอร์ส่วนบุคคลง่ายขึ้นโดยไม่ต้องมีความชำนาญ แม้โมเดล MoE ลดความต้องการ VRAM แต่ขนาด VRAM ของ GPU…

XDA Developers7 นาที
คัดลอกลิงก์แล้ว!