เชื่อมต่อ
–
ตอบกลับเฉลี่ย (0 รอบ)
–
เวลา session
–
ต้นทุนประมาณ
฿0.000
กด "เริ่ม session" แล้วลองพูด เช่น "มาสามคน งบหกร้อย ไม่เผ็ด" หรือ "ขอกะเพราหมูกรอบสองจาน"
ถูกสุด ตอบเป็นข้อความ ไม่พูดกลับ ใช้ใน V1 · ต้นทุนประมาณจากราคาในชีต (เสียงออกประมาณจากความยาวข้อความ) ใช้เทียบกันเท่านั้น ตัวจริงดูจาก usage ของผู้ให้บริการ
| โมเดล | การรับส่งเสียง | การยืนยันตัวตนจากเบราว์เซอร์ | ตอบกลับ | ฿/ออเดอร์ | ข้อจำกัด |
|---|---|---|---|---|---|
| โครงเดิม (ถอดเสียง + LLM) | อัดเสียง → gpt-transcribe → LLM (JSON) | key อยู่ฝั่ง server | ข้อความ | 0.11 | ไม่พูดกลับ ต้องกดพูดทีละครั้ง |
| Gemini 3.8 Live | WebSocket PCM 16k เข้า / 24k ออก | ephemeral token ใช้ครั้งเดียว ล็อก tools ไว้ในโทเคน | เสียง + ถอดความ | 0.74 | session เสียง 15 นาที, เชื่อมต่อ ~10 นาที (มี goAway) |
| gpt-realtime-2.1-mini | WebRTC (SDP ตรงกับ OpenAI) | client secret อายุ 10 นาที | เสียง + ถอดความ | 0.77 | session สูงสุด 60 นาที |
| Gemini 3.8 Live Extended Thinking | เหมือน 3.8 Live + thinkingLevel | ephemeral token | เสียง (มีพูดคั่นระหว่างคิด) | 1.35 | tool ต้อง NON_BLOCKING, ดู interactionStatus |
| GPT-Live-1 + client delegation | WebRTC, server แลก SDP ให้ | ไม่มี ephemeral key ต้องผ่าน server | เสียง | 1.76 | เรียก tool เองไม่ได้, Tier 1 พร้อมกัน 25 session |