Deployment & Enterprise Integration
SageMaker endpoint แบบไหน, CI/CD สำหรับ GenAI, GenAI gateway และ hybrid/on-premises
| SageMaker inference | เหมาะกับ |
|---|---|
Real-time endpoint | latency ต่ำ traffic ต่อเนื่อง |
Serverless inference | traffic เป็นช่วงๆ ยอมรับ cold start ได้ (ไม่รองรับ GPU) |
Asynchronous inference | payload ใหญ่ (สูงสุด ~1 GB) / ประมวลผลนาน (สูงสุด ~1 ชม.) scale เป็น 0 ได้ |
Batch transform | ประมวลผล dataset ทั้งก้อนแบบ offline |
ความท้าทายเฉพาะของ LLM
LLM ต้องการ GPU memory สูง, โหลดโมเดลนาน, throughput วัดเป็น tokens/วินาที → ใช้ container ที่ optimize (เช่น Large Model Inference container), quantization, และ model cascading (ส่งคำถามง่ายไปโมเดลเล็กก่อน)
CI/CD สำหรับ GenAI
CodePipeline + CodeBuild: ทดสอบ prompt/โมเดลอัตโนมัติด้วย golden dataset → security scan → deploy แบบ canary → rollback อัตโนมัติถ้าคุณภาพตก
GenAI Gateway
ชั้นกลาง (API Gateway + Lambda) ที่ทุกทีมเรียกผ่าน เพื่อรวมศูนย์: auth, rate limiting, การเลือกโมเดล, guardrails, logging, cost allocation ต่อทีม
Hybrid / Data residency
ข้อมูลห้ามออกจาก on-premises หรือประเทศ → AWS Outposts (on-prem), AWS Wavelength (edge 5G), Local Zones; เชื่อมแบบ private ด้วย Direct Connect / VPN
งานวิเคราะห์วิดีโอขนาด 800 MB ด้วยโมเดลบน SageMaker ใช้เวลาประมวลผลราว 20 นาทีต่อไฟล์ และมาเป็นช่วงๆ ควรใช้ endpoint แบบไหน?
การดึงความรู้ออกมาใช้ทันทีหลังอ่าน (retrieval practice) ช่วยให้จำได้นานขึ้นมาก