กลับไป mock

POC โมเดลเสียง 5 แบบ

ต่อ API จริง · ตะกร้าเดียวกับหน้าลูกค้า
โครงเดิม (ถอดเสียง + LLM)
ยังไม่เริ่ม

เชื่อมต่อ

–

ตอบกลับเฉลี่ย (0 รอบ)

–

เวลา session

–

ต้นทุนประมาณ

฿0.000

กด "เริ่ม session" แล้วลองพูด เช่น "มาสามคน งบหกร้อย ไม่เผ็ด" หรือ "ขอกะเพราหมูกรอบสองจาน"

ถูกสุด ตอบเป็นข้อความ ไม่พูดกลับ ใช้ใน V1 · ต้นทุนประมาณจากราคาในชีต (เสียงออกประมาณจากความยาวข้อความ) ใช้เทียบกันเท่านั้น ตัวจริงดูจาก usage ของผู้ให้บริการ

ตะกร้าโต๊ะ 12
AI เติมได้ แต่ส่งเข้าครัวไม่ได้ ลูกค้าต้องกดยืนยันเอง

ยังว่าง

รวม฿0
เทียบสถาปัตยกรรม
ทุกแบบใช้ชุด tool เดียวกัน: search_menu, add_to_cart, remove_from_cart, get_cart, suggest_set (ไม่มี tool ส่งเข้าครัว)
โมเดลการรับส่งเสียงการยืนยันตัวตนจากเบราว์เซอร์ตอบกลับ฿/ออเดอร์ข้อจำกัด
โครงเดิม (ถอดเสียง + LLM)อัดเสียง → gpt-transcribe → LLM (JSON)key อยู่ฝั่ง serverข้อความ0.11ไม่พูดกลับ ต้องกดพูดทีละครั้ง
Gemini 3.8 LiveWebSocket PCM 16k เข้า / 24k ออกephemeral token ใช้ครั้งเดียว ล็อก tools ไว้ในโทเคนเสียง + ถอดความ0.74session เสียง 15 นาที, เชื่อมต่อ ~10 นาที (มี goAway)
gpt-realtime-2.1-miniWebRTC (SDP ตรงกับ OpenAI)client secret อายุ 10 นาทีเสียง + ถอดความ0.77session สูงสุด 60 นาที
Gemini 3.8 Live Extended Thinkingเหมือน 3.8 Live + thinkingLevelephemeral tokenเสียง (มีพูดคั่นระหว่างคิด)1.35tool ต้อง NON_BLOCKING, ดู interactionStatus
GPT-Live-1 + client delegationWebRTC, server แลก SDP ให้ไม่มี ephemeral key ต้องผ่าน serverเสียง1.76เรียก tool เองไม่ได้, Tier 1 พร้อมกัน 25 session