จากรายงานของ Gartner ในเดือนสิงหาคม 2026 คาดการณ์ค่าใช้จ่ายสำหรับโครงสร้างพื้นฐานคลาวด์ที่ปรับแต่งมาเพื่อ AI (AI-optimized IaaS) ดังนี้:
เพื่อให้เห็นภาพ ในช่วงแรกของยุค Generative AI Boom ค่าใช้จ่ายในการ Training (การสอนโมเดล) ถือเป็นส่วนแบ่งหลักของโครงสร้างพื้นฐาน แต่ตอนนี้สัดส่วนดังกล่าวกลับกันโดยสิ้นเชิง
การเติบโตไม่ได้จำกัดอยู่แค่ Inference เท่านั้น โดยรวมแล้ว ค่าใช้จ่าย AI-optimized IaaS ทั่วโลกมีแนวโน้มสูงถึง 4.23 หมื่นล้านเหรียญสหรัฐในปี 2026 ซึ่งเพิ่มขึ้น 96.4% จาก 2.15 หมื่นล้านเหรียญสหรัฐในปี 2025 และคาดว่าจะพุ่งขึ้นต่อไปเป็น 6.61 หมื่นล้านเหรียญสหรัฐในปี 2027 หรือเพิ่มขึ้น 56.5%
เมื่อเทียบกับภาพรวมของค่าใช้จ่าย IaaS ทั่วโลก (รวมถึงงานที่ไม่เกี่ยวกับ AI) คาดว่าจะอยู่ที่ 2.87 แสนล้านเหรียญสหรัฐในปี 2026 (เพิ่มขึ้น 29.3% จาก 2.22 แสนล้านเหรียญสหรัฐในปี 2025) และ 3.59 แสนล้านเหรียญสหรัฐในปี 2027
ตามรายงานของ Gartner มีแรงขับเคลื่อนหลักสองประการที่ทำให้ค่าใช้จ่าย Inference แซงหน้า Training:
Hardeep Singh นักวิเคราะห์จาก Gartner กล่าวว่า "การเปลี่ยนแปลงนี้กำลังเร่งรูปแบบการบริโภคคลาวด์ให้เร็วขึ้น และสร้างความต้องการที่ยั่งยืนสำหรับโครงสร้างพื้นฐานที่ปรับแต่งเพื่อ AI"
แนวโน้มนี้สอดคล้องกับการวิเคราะห์ของนักวิเคราะห์รายอื่นๆ เช่น Deloitte ในรายงาน Tech Trends 2026 ประมาณการว่าในปี 2026 Inference คิดเป็นสองในสามของปริมาณการประมวลผล AI ทั้งหมด ขณะที่ The Futurum Group คาดการณ์ว่า Managed Inference ในปี 2025 มีมูลค่าสูงถึง 2.31 หมื่นล้านเหรียญสหรัฐ (คิดเป็น 58.6% ของค่าใช้จ่ายด้านโครงสร้างพื้นฐาน) และ Inference ได้แซงหน้า Training ไปตั้งแต่ปี 2025 แล้ว
ตัวเลขค่าใช้จ่ายของ Gartner นี้เป็นส่วนหนึ่งของภาพรวมที่ใหญ่กว่านี้มาก:
แม้ว่าราคาจะลดลงอย่างรวดเร็ว — Deloitte ระบุว่าราคา API บนคลาวด์สำหรับ Inference ลดลงเกือบ 80% เมื่อเทียบปีต่อปี — แต่ค่าใช้จ่ายโดยรวมกลับพุ่งทะยานขึ้นสูงเพราะปริมาณการใช้งาน (Usage) เติบโตเร็วกว่าการลดลงของต้นทุนต่อหน่วยมาก
Gartner ออกคำเตือนสำคัญอีกประการหนึ่งคือ อย่างน้อย 50% ของโครงการ GenAI จะเกินงบประมาณที่วางไว้ภายในปี 2028 ซึ่งสาเหตุหลักมาจากการออกแบบสถาปัตยกรรมที่ไม่เหมาะสมและการขาดความเชี่ยวชาญในการดำเนินงาน
Inference คือตัวการหลักที่ทำให้ต้นทุนบานปลาย แตกต่างจากการ Training ซึ่งเป็นค่าใช้จ่ายก้อนใหญ่เพียงครั้งเดียว ค่าใช้จ่ายสำหรับ Inference จะเกิดขึ้นซ้ำๆ ทุกครั้งที่มีผู้ใช้หรือแอปพลิเคชันเรียกใช้โมเดล Gartner คาดการณ์ว่า Inference จะคิดเป็นอย่างน้อย 70% ของต้นทุนตลอดอายุการใช้งานของโมเดล
Gartner แนะนำให้ CIO ดำเนินการเชิงกลยุทธ์ดังนี้:
"การพลิกของ Inference" (Inference Flip) ไม่ใช่แค่สถิติค่าใช้จ่าย มันคือการปรับเปลี่ยนลำดับความสำคัญของโครงสร้างพื้นฐาน AI ครั้งใหญ่ ยุคที่การสร้างโมเดลที่ใหญ่ขึ้นเรื่อยๆ เป็นตัวขับเคลื่อนต้นทุนหลักกำลังจะสิ้นสุดลง และกำลังถูกแทนที่ด้วยยุคแห่งการนำโมเดลเหล่านั้นมาใช้งานในระบบ Production จริงในวงกว้าง สำหรับผู้ให้บริการคลาวด์ นั่นหมายถึงความต้องการ GPU และ ASIC ที่ยั่งยืน สำหรับองค์กรธุรกิจ นั่นหมายถึงการวางแผนโครงสร้างพื้นฐานต้องเน้นที่ต้นทุนการดำเนินงานของ AI ไม่ใช่แค่การลงทุนในครั้งแรกเพื่อสอนโมเดลอีกต่อไป
ดังที่รายงานของ Gartner ทำให้เห็นอย่างชัดเจน การเปลี่ยนแปลงจากการพัฒนาไปสู่การปรับใช้ (Deployment) ได้มาถึงแล้ว และรายการงบประมาณสำหรับ AI จะไม่มีวันเหมือนเดิมอีก