AWS Exam Hub
AIP-C01
GenAI Developer Pro
ภาพรวมบทเรียนฝึกทำทบทวนFlashcardsMock Examคลังข้อสอบสถิติ
ภาพรวมบทเรียนฝึกทำทบทวน
บทเรียนทั้งหมด
ต้นทุน, Performance & Monitoringบทที่ 12/16 · ~13 นาที

Cost & Performance Optimization

ลด token, cache อย่างฉลาด, เลือกโมเดลตามความยาก และจัดการ throughput

เครื่องมือลดต้นทุน/เพิ่มความเร็ว
เทคนิคลดอะไรใช้เมื่อ

Prompt caching

ต้นทุน (สูงสุด ~90%) และ latency (สูงสุด ~85%) ของ prefix ที่ซ้ำ

system prompt/เอกสารยาวที่ใช้ซ้ำทุก request

Semantic caching

การเรียก FM ซ้ำสำหรับคำถามที่ความหมายเหมือนกัน

FAQ / คำถามซ้ำๆ — เก็บ embedding+คำตอบใน ElastiCache/MemoryDB/OpenSearch

Exact-match cache

request ที่เหมือนกันทุกตัวอักษร

hash ของ request → DynamoDB/ElastiCache

Model cascading / tiering

ต้นทุนต่อคำถาม

ส่งคำถามง่ายไปโมเดลเล็ก ยากค่อยใช้โมเดลใหญ่

Intelligent Prompt Routing

ต้นทุน โดยให้ Bedrock เลือกโมเดลในตระกูลเดียวกันให้

อยากได้ tiering แบบ managed

Batch inference

ราคา ~50%

งาน offline

Context pruning / summarize history

input tokens

แชตยาว context ล้น

max_tokens + สั่งให้ตอบกระชับ

output tokens

คำตอบยาวเกินจำเป็น

Latency-optimized inference

latency

แอปที่ time-sensitive (บางโมเดล/Region)

Provisioned Throughput

throttling, latency ไม่คงที่

traffic สูงคงที่ ต้องการ capacity การันตี

Semantic cache
Semantic cache
เทคนิคช่วยจำ

Prompt caching = จำ "ส่วนหัว" ของ prompt ที่ซ้ำ (ทำใน Bedrock) Semantic caching = จำ "คำตอบทั้งก้อน" ของคำถามที่คล้ายกัน (ทำเองนอก FM)

ออกสอบบ่อย
  • ทุก request แนบ เอกสารยาวชุดเดิม/system prompt ยาว → prompt caching
  • คำถามลูกค้า ซ้ำกันมากแต่พิมพ์ต่างกัน → semantic cache
  • คำถาม 80% ง่าย 20% ยาก → cascading / Intelligent Prompt Routing
  • Streaming ไม่ลดเวลารวม แต่ลด perceived latency (เห็นคำแรกเร็ว)
เช็กความเข้าใจ

แชตบอตส่ง system prompt + คู่มือยาว 20,000 tokens ทุก request ทำให้ค่าใช้จ่ายสูง ควรเปิดใช้อะไรก่อน?

อ่านจบแล้ว? ลองทำข้อสอบเรื่องนี้เลย

การดึงความรู้ออกมาใช้ทันทีหลังอ่าน (retrieval practice) ช่วยให้จำได้นานขึ้นมาก

ฝึกข้อสอบเรื่องนี้
บทก่อนหน้า
Governance, Responsible AI & Prompt Injection
บทถัดไป
Monitoring & Observability