แคตตาล็อก MeshTok แสดงรายการโมเดลที่มีหน้าต่างบริบทหนึ่งล้านโทเคนขึ้นไปมากกว่าสิบสองรายการ เกือบทั้งหมดต้องแลกสิ่งใดสิ่งหนึ่งเพื่อไปถึงจุดนั้น — ไม่มีการมองเห็น ไม่มีวิดีโอ ไม่มีเสียง เอาต์พุตสูงสุดที่น้อย หรือไม่มีแท็ก flagship Gemini 3.1 Pro เป็นข้อยกเว้น: หน้าต่างบริบท 1,048,576 โทเคน, เอาต์พุตสูงสุด 65,536 โทเคน, อินพุตภาพ+วิดีโอ+เสียงแบบเนทีฟ, พร้อมด้วย reasoning, tools, json และป้ายกำกับ flagship รวมอยู่ในไอดีโมเดลเดียว คำถามที่บทความนี้ตอบคือ ชุดคุณสมบัติแบบนี้คุ้มกับราคา $2 / $12 ต่อล้านโทเคนหรือไม่
นี่คือ การวิเคราะห์สเปกและราคา ไม่ใช่เกณฑ์วัดสังเคราะห์ เราไม่ได้รันการทดสอบเวลาตอบสนอง ไม่ได้วัดการเรียกคืนแบบ needle-in-a-haystack ที่ตำแหน่งบริบทแต่ละจุด และจะไม่เผยแพร่ตัวเลขใดที่เราไม่สามารถสำรองด้วยแคตตาล็อกสด ตัวเลขทุกตัวด้านล่างนี้เป็นเลขคณิตที่คุณสามารถทำซ้ำได้ด้วยเครื่องคิดเลขจาก src/data/models.ts เป้าหมายคือช่วยให้คุณตัดสินใจว่าหน้าต่างบริบทล้านโทเคนของ Gemini 3.1 Pro สมควรได้รับตำแหน่งในเลเยอร์ routing ของคุณหรือไม่ — โดยอ้างอิงจากข้อมูลที่สำคัญต่อการวางงบจริง ๆ: ขนาดหน้าต่างบริบท, เอาต์พุตสูงสุด, ความครอบคลุมมัลติโมดอล และราคาต่อล้านโทเคน
ข้อสังเกตหนึ่งก่อนเข้าสู่ตัวเลข: ไอดีโมเดลในแคตตาล็อกคือ google/gemini-3.1-pro-preview คำต่อท้าย -preview อยู่ในข้อมูลต้นฉบับ และเราจะไม่ปกปิดมัน ให้ถือว่าสเปกชีทมีความแม่นยำ แต่ควรตรวจสอบกับ https://meshtok.com/v1/models ก่อนล็อกการตัดสินใจ routing สำหรับ production
Gemini 3.1 Pro: สเปกชีท
พร้อมใช้งานวันนี้ผ่าน MeshTok unified API ที่ https://meshtok.com/v1 ภายใต้ไอดีโมเดล google/gemini-3.1-pro-preview
| ฟิลด์ | ค่า |
|---|---|
| ผู้จำหน่าย | Google (US) |
| หน้าต่างบริบท | 1,048,576 โทเคน (2²⁰, มากกว่า 1M เล็กน้อย) |
| เอาต์พุตสูงสุด | 65,536 โทเคน |
| ราคาอินพุต (ต่อ 1M) | $2.00 |
| ราคาเอาต์พุต (ต่อ 1M) | $12.00 |
| ความสามารถ | image, video, audio, reasoning, tools, json, flagship |
| วันวางจำหน่าย | 2026-06 |
| คัตออฟความรู้ | 2026-05 |
มีสามจุดที่โดดเด่นในระดับนี้:
- หน้าต่างบริบท+เอาต์พุตรวมกันใหญ่ที่สุดในบรรดาโมเดลมัลติโมดอลในแคตตาล็อก 1,048,576 อินพุต + 65,536 เอาต์พุต หมายความว่าการเรียกครั้งเดียวสามารถรับข้อมูลประมาณล้านโทเคนที่ผสมข้อความ ภาพ เสียง และวิดีโอ แล้วตอบกลับยาว 65K โทเคน ไม่มีโมเดลอื่นใน
models.tsที่ตรงทั้งสามข้อพร้อมกัน: บริบท 1M+, เอาต์พุตสูงสุด 65K+, และอินพุตภาพ+วิดีโอ+เสียง - มัลติโมดอลเนทีฟแบบเต็ม รวมวิดีโอและเสียง โมเดลคู่แข่งหน้าต่างบริบท 1M ส่วนใหญ่หยุดแค่
image(DeepSeek V4 Pro, Qwen3.7 Max, Doubao Seed 2.1 Pro) หรือทิ้งการมองเห็นไปเลย (GLM-5.2) Gemini 3.1 Pro เป็น flagship บริบท 1M เพียงรายเดียวในแคตตาล็อกที่รับวิดีโอและเสียงแบบเนทีฟควบคู่กับข้อความและภาพ - ติดป้าย
flagshipและreasoningGoogle ใช้แท็กความสามารถเดียวกับที่สงวนไว้สำหรับระดับแนวหน้า รุ่น Gemini Flash ที่ถูกกว่าจะมีfastแทนreasoningและflagship— นั่นคือเส้นแบ่งโครงสร้างภายในตระกูล
คำถามล้านโทเคน: 1M บริบทมีค่าใช้จ่ายจริงเท่าไหร่?
นี่คือส่วนที่หน้าการตลาดส่วนใหญ่ข้ามไป หน้าต่างบริบทล้านโทเคนเป็นงบประมาณ ไม่ใช่ของแถม ทุกโทเคนที่คุณใส่เข้าไปจะถูกเรียกเก็บในอัตราอินพุต วิธีที่ซื่อสัตย์ในการเปรียบเทียบโมเดล long-context คือคำนวณต้นทุนของการใช้หน้าต่างจริง ๆ
ต้นทุนของหนึ่งการเรียกเต็มหน้าต่าง (1M อินพุต + สรุปสั้น ๆ)
งาน long-context ที่พบบ่อย: ส่งเอกสาร ~1M โทเคนแล้วขอสรุปสั้น ๆ หรือรายการสิ่งที่ต้องทำไม่กี่ข้อ เราสมมติ 1,048,576 โทเคนอินพุตและ 1,000 โทเคนเอาต์พุต
| โมเดล | ต้นทุนอินพุต | ต้นทุนเอาต์พุต | รวมต่อการเรียก |
|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | $0.012 | $2.109 |
| Gemini 2.5 Pro | $1.311 | $0.010 | $1.321 |
| Gemini 3 Flash | $0.524 | $0.003 | $0.527 |
| DeepSeek V4 Pro | $0.449 | $0.001 | $0.450 |
| GLM-5.2 | $1.143 | $0.004 | $1.147 |
| Claude Sonnet 5 | $3.000 | $0.015 | $3.015 |
การเรียก Gemini 3.1 Pro เต็มหน้าต่างครั้งเดียวมีค่าประมาณ $2.11 รันแบบนั้นวันละพันครั้ง และคุณจะใช้ $2,109/วัน — ประมาณ $63K/เดือน — เฉพาะโทเคนอินพุต นั่นไม่ใช่เหตุผลให้หลีกเลี่ยงโมเดลนี้ แต่เป็นเหตุผลให้ระมัดระวังว่า เมื่อไหร่ ที่คุณต้องการใช้หน้าต่างเต็มจริง ๆ
ต้นทุนของการเรียก long-output เต็มรูปแบบ (1M อินพุต + เอาต์พุตสูงสุดเต็ม)
จุดที่ราคาของ Gemini 3.1 Pro แตกต่างกันโครงสร้างคือเมื่อคุณใช้เอาต์พุตสูงสุดที่ใหญ่ด้วย ที่นี่เราสมมติว่าบริบทถูกเติมเต็มและโมเดลได้รับอนุญาตให้ปล่อยเอาต์พุตสูงสุดเต็ม
| โมเดล | 1M อินพุต | เอาต์พุตสูงสุดที่ใช้ | ต้นทุนเอาต์พุต | รวมต่อการเรียก |
|---|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | 65,536 | $0.786 | $2.883 |
| GLM-5.2 | $1.143 | 128,000 | $0.512 | $1.655 |
| DeepSeek V4 Pro | $0.449 | 32,768 | $0.028 | $0.477 |
| Claude Sonnet 5 | $3.000 | 16,384 | $0.246 | $3.246 |
GLM-5.2 ถูกกว่าต่อการเรียกเต็มหน้าต่างเพราะเอาต์พุตสูงสุดอยู่ที่ 128K แต่ราคา $4/1M ไม่ใช่ $12/1M ปัจจัยตัดสินระหว่าง Gemini 3.1 Pro กับ GLM-5.2 ไม่ใช่ราคา — แต่เป็นว่าคุณต้องการ อินพุตวิดีโอและเสียง หรือไม่ ซึ่ง GLM-5.2 ไม่รับเลย
ต้นทุนของ 1 ล้านการเรียกแชตสั้น (1K อินพุต + 500 เอาต์พุตต่อครั้ง)
สำหรับการตรวจสอบความถูกต้องที่ปลายอีกด้านของสเปกตรัม: หนึ่งล้านการเรียกสั้น แต่ละครั้งใช้อินพุต 1,000 โทเคนและให้เอาต์พุต 500 โทเคน รวมเป็น 1 พันล้านโทเคนอินพุตและ 500 ล้านโทเคนเอาต์พุต
| โมเดล | ต้นทุนอินพุต (1B in) | ต้นทุนเอาต์พุต (500M out) | รวมสำหรับ 1M การเรียก |
|---|---|---|---|
| Gemini 3.1 Pro | $2,000 | $6,000 | $8,000 |
| Gemini 2.5 Pro | $1,250 | $5,000 | $6,250 |
| Gemini 3 Flash | $500 | $1,500 | $2,000 |
| DeepSeek V4 Pro | $429 | $429 | $857 |
| GLM-5.2 | $1,143 | $2,000 | $3,143 |
| Claude Sonnet 5 | $3,000 | $7,500 | $10,500 |
บนทราฟิกแชตสั้น Gemini 3.1 Pro แพงกว่า DeepSeek V4 Pro ประมาณ 9.3× และแพงกว่า GLM-5.2 ประมาณ 2.5× บทเรียนง่าย ๆ: หน้าต่างบริบทล้านโทเคนเป็นฟีเจอร์พรีเมียม และคุณไม่ควรจ่ายสำหรับมันบนทราฟิกที่ไม่เคยใช้มันเลย
ภายในตระกูล Gemini: เลือกรุ่นไหนดี?
แคตตาล็อก MeshTok มีโมเดล Gemini จำนวนเจ็ดรุ่นที่มีหน้าต่างบริบทระดับ 1M การเลือกรุ่นที่เหมาะสมเป็นการถ่วงระหว่าง ความลึกของการให้เหตุผล, ความครอบคลุมมัลติโมดอล และราคา เป็นหลัก
| โมเดล | บริบท | เอาต์พุตสูงสุด | อินพุต $/M | เอาต์พุต $/M | วิดีโอ | เสียง | Reasoning | Flagship |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1,048,576 | 65,536 | $2.00 | $12.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 2.5 Pro | 1,048,576 | — | $1.25 | $10.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 3.5 Flash | 1,048,576 | 65,536 | $1.50 | $9.00 | ✅ | ✅ | — | — |
| Gemini 3 Flash | 1,048,576 | 65,536 | $0.50 | $3.00 | ✅ | ✅ | — | — |
| Gemini 3.1 Flash Lite | 1,048,576 | — | $0.25 | $1.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash | 1,048,576 | — | $0.30 | $2.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash Lite | 1,000,000 | — | $0.10 | $0.40 | ✅ | ✅ | — | — |
การอ่านตาราง:
- Gemini 3.1 Pro เทียบ Gemini 2.5 Pro — 2.5 Pro เป็น flagship รุ่นเก่ากว่าและถูกกว่าทั้งสองแกน ($1.25/$10 เทียบ $2/$12) เหตุผลที่ควรจ่ายเพิ่มสำหรับ 3.1 Pro: เอาต์พุตสูงสุด 65,536 ที่กำหนดชัดเจน (รายการของ 2.5 Pro ไม่มี
maxOutputชัดเจนในแคตตาล็อก), คัตออฟความรู้ที่ใหม่กว่า (2026-05) และเจเนอเรชัน 3.1 ที่ใหม่กว่า เหตุผลที่ควรอยู่กับ 2.5 Pro: ถ้าคุณไม่ต้องการสิ่งเหล่านั้น มันถูกกว่าอย่างเคร่งครัด - Gemini 3.1 Pro เทียบ Gemini 3 Flash — Flash มีราคาเป็นหนึ่งในสี่และแชร์บริบท 1M, เอาต์พุตสูงสุด 65K และอินพุตมัลติโมดอลเต็มแบบเดียวกัน สิ่งที่คุณทิ้งไปคือ
reasoningและflagshipสำหรับการจำแนกมัลติโมดอลปริมาณมาก การถอดเสียง หรือ routing ที่ไม่ต้องการการคิดทีละขั้น Flash เป็นตัวเลือกที่เหมาะสม สำหรับสิ่งใดที่ได้ประโยชน์จากห่วงโซ่การให้เหตุผล — การวิเคราะห์หลายขั้นตอน ถาม-ตอบเอกสารยาวพร้อมสังเคราะห์ — 3.1 Pro คือการอัปเกรด - Gemini 3.1 Pro เทียบ Gemini 3.1 Flash Lite / 2.5 Flash Lite — รุ่น Lite เป็นด้านงบประมาณ พวกมันคงบริบท 1M และอินพุตมัลติโมดอลไว้ แต่ทิ้งการให้เหตุผลและขีดจำกัดเอาต์พุตสูงสุดที่ชัดเจน ใช้เมื่อคุณต้องการรับโทเคนจำนวนมากในราคาถูกและมาตรฐานคุณภาพคำตอบอยู่ในระดับปานกลาง
Gemini 3.1 Pro เทียบ flagship บริบท 1M รุ่นอื่น
Gemini 3.1 Pro เทียบกับ flagship บริบท 1M ที่มีชื่อเสียงกว่าจากแล็บอื่น ๆ อย่างไร?
| โมเดล | บริบท | เอาต์พุตสูงสุด | อินพุต $/M | เอาต์พุต $/M | วิดีโอ | เสียง | วันวางจำหน่าย |
|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1,048,576 | 65,536 | $2.00 | $12.00 | ✅ | ✅ | 2026-06 |
| DeepSeek V4 Pro | 1,000,000 | 32,768 | $0.4286 | $0.8571 | — | — | 2026-04 |
| GLM-5.2 | 1,000,000 | 128,000 | $1.1429 | $4.0000 | — | — | 2026-07 |
| Qwen3.7 Max | 1,000,000 | 8,192 | $0.8571 | $2.5714 | — | — | 2026-06 |
| Claude Sonnet 5 | 1,000,000 | 16,384 | $3.0000 | $15.0000 | — | — | 2026-05 |
| Claude Opus 4.8 | 1,000,000 | 32,000 | $5.0000 | $25.0000 | — | — | 2026-06 |
ข้อสังเกตโครงสร้างสองข้อ:
- Gemini 3.1 Pro เป็นโมเดลเดียวในตารางนี้ที่มีอินพุตวิดีโอและเสียงแบบเนทีฟ flagship บริบท 1M อื่นทุกรุ่นรับได้มากสุดก็แค่ภาพ ถ้างานของคุณคือการทำความเข้าใจวิดีโอ การถอดเสียงประชุม หรือไปป์ไลน์ใดก็ตามที่รับเสียง/วิดีโอควบคู่ข้อความ Gemini 3.1 Pro ไม่ใช่ตัวเลือกที่ถูกที่สุด — แต่เป็นตัวเลือกเดียวในระดับบริบท 1M
- GLM-5.2 มีเอาต์พุตสูงสุดใหญ่ที่สุด (128K) แต่ไม่มีมัลติโมดอลเลย ถ้างานของคุณต้องสร้างคำตอบข้อความเดี่ยวยาวมากจากอินพุตเฉพาะข้อความ GLM-5.2 ทั้งถูกกว่าและมีหน้าต่างเอาต์พุตยาวกว่า ในวินาทีที่คุณต้องการภาพ วิดีโอ หรือเสียง GLM-5.2 ตกออกจากโต๊ะและ Gemini 3.1 Pro กลับเข้ามาในบทสนทนา
การถ่วงระหว่าง long-context กับ RAG (คำตอบตรง ๆ)
คำถาม “หน้าต่างบริบทล้านโทเคนคุ้มไหม?” แทบจะลดเหลือเป็นคำถามเรื่องต้นทุนเสมอ ไม่ใช่คำถามเรื่องความสามารถ บริบท 1M ให้คุณข้ามไปป์ไลน์ retrieval แล้วโยนทุกอย่างเข้า prompt ได้เลย มันสะดวก แต่ที่ $2/1M อินพุต มันก็แพงในทุก ๆ การเรียก — และคุณต้องจ่ายซ้ำในการเรียกถัดไป เพราะหน้าต่างบริบทไม่ได้แคชฟรี
กฎง่าย ๆ ที่อนุมานจากการกำหนดราคาข้างต้นล้วน ๆ:
- ถ้าคลังข้อมูลขนาดใหญ่ชุดเดียวกันถูกค้นหาหลายครั้ง retrieval ถูกกว่า ส่ง 5K โทเคนที่ retrieve มาที่ $2/1M = $0.01 ต่อการเรียก แทน 1M โทเคนที่ $2/1M = $2.00 ต่อการเรียก คุณจะคุ้มทุนหลังการเรียกแบบ retrieve-only ประมาณ 200 ครั้งต่อหนึ่งการเรียก full-context หนึ่งครั้ง
- ถ้าคลังข้อมูลถูกค้นหาครั้งเดียวหรือสองครั้งแล้วทิ้ง (สรุปแบบ one-shot ของ transcript ใหม่, การอ่านลึกครั้งเดียวของสัญญา, การสำรวจ codebase แบบ ad-hoc) long context เป็นเครื่องมือที่เหมาะสม ระบบ retrieval จะมีต้นทุนสร้างสูงกว่าโทเคนที่มันช่วยประหยัด
- ถ้าคุณต้องการความเข้าใจเสียงหรือวิดีโอในช่วงเวลายาว (บันทึกการประชุม 2 ชั่วโมง, วิดีโอยาว) Gemini 3.1 Pro เป็นโมเดลเดียวในแคตตาล็อกที่รวมโมดอลิตีอินพุตนั้นกับหน้าต่าง 1M ไม่มีทดแทนที่ถูกกว่าภายในระดับ 1M — การถ่วงเป็นระหว่าง Gemini 3.1 Pro กับโมเดลบริบทสั้นกว่าบวกกับการตัดเป็นชิ้น
เมื่อไหร่ควรเลือก Gemini 3.1 Pro (และเมื่อไหร่ไม่ควร)
ไม่มี “โมเดลที่ดีที่สุด” — มีแค่โมเดลที่เหมาะกับงานและงบประมาณที่กำหนด ใช้ตารางนี้เป็นจุดเริ่มต้นแล้วตรวจสอบด้วย eval ของคุณเอง
| งาน | แนะนำ | เหตุผล |
|---|---|---|
| ความเข้าใจวิดีโอหรือเสียงยาว (สื่อ 1M+ โทเคน) | Gemini 3.1 Pro | โมเดลบริบท 1M เดียวในแคตตาล็อกที่มีอินพุต video และ audio เนทีฟ ไม่มีทดแทนที่ถูกกว่าในระดับนี้ |
| การวิเคราะห์ long-context มัลติโมดอลผสม (ข้อความ + ภาพ + เสียง) | Gemini 3.1 Pro | flagship เดียวที่รวมบริบท 1M, เอาต์พุตสูงสุด 65K และอินพุตมัลติโมดอลเต็ม |
| long-context เฉพาะข้อความ ที่มีเอาต์พุตยาวมาก (>65K, สูงสุด 128K) | GLM-5.2 | เอาต์พุตสูงสุด 128K ของ GLM-5.2 เป็นเอกลักษณ์เฉพาะ ถูกกว่าในการเรียก long-output เต็มหน้าต่าง ไม่มีการมองเห็น |
| มัลติโมดอลบริบท 1M ปริมาณมากในงบจำกัด | Gemini 3 Flash | ราคาเป็นหนึ่งในสี่ของ 3.1 Pro, บริบท 1M เท่ากัน, อินพุตมัลติโมดอลเท่ากัน ทิ้งการให้เหตุผล |
| บริบท 1M ที่ถูกที่สุดเท่าที่เป็นไปได้ (ข้อความหรือภาพ) | DeepSeek V4 Pro | $0.43/1M อินพุต — ถูกกว่า Gemini 3.1 Pro 4.7× ในอินพุต ไม่มีวิดีโอ/เสียง |
| คุณภาพโค้ดระดับสูงสุด ต้นทุนเป็นรอง | Claude Sonnet 5 | การวางตำแหน่งของ Anthropic และ eval จากชุมชนถือว่า Sonnet 5 อยู่อันดับสูงสุดสำหรับโค้ด ใช้ Gemini 3.1 Pro ถ้า long context มัลติโมดอลสำคัญกว่า |
| การให้เหตุผลเชิงวิเคราะห์ long-context ที่ไม่ต้องการมัลติโมดอล | GLM-5.2 หรือ DeepSeek V4 Pro | ทั้งสองถูกกว่าสำหรับงาน long-context เฉพาะข้อความ เลือก GLM-5.2 สำหรับเอาต์พุตยาว, V4 Pro สำหรับต้นทุนต่ำสุด |
นโยบาย routing เริ่มต้นที่สมเหตุสมผล: route การเรียกที่มีวิดีโอหรือเสียงไปยัง Gemini 3.1 Pro; route การรีแฟกเตอร์ข้อความยาวอย่างเดียวที่มีเอาต์พุตยาวไปยัง GLM-5.2; route ทราฟิกข้อความ+ภาพปริมาณมากที่ถูกไปยัง DeepSeek V4 Pro; สงวน Claude Sonnet 5 สำหรับงานโค้ดที่มีความเสี่ยงสูง Gemini 3.1 Pro เป็นผู้เชี่ยวชาญ long-context มัลติโมดอล ไม่ใช่ค่าเริ่มต้นสำหรับทุกอย่าง
วิธีเรียก Gemini 3.1 Pro (โค้ดจริงที่รันได้)
MeshTok เปิด endpoint เดียวที่ compatible กับ OpenAI ที่ https://meshtok.com/v1 การสลับระหว่าง Gemini 3.1 Pro กับโมเดลอื่น ๆ ในบทความนี้เป็นการเปลี่ยนบรรทัดเดียวในฟิลด์ model — ใช้ SDK เดียวกัน, API key เดียวกัน, รูปแบบคำขอเดียวกัน ตัวอย่างด้านล่างแสดงรูปแบบ long-context มัลติโมดอล: prompt ข้อความยาวบวกกับ URL ภาพ ส่งเป็นการเรียกครั้งเดียว
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str, image_url: str | None = None) -> str:
"""Same call, different model and modality — switch with one string."""
content = [{"type": "text", "text": prompt}]
if image_url:
content.append({"type": "image_url", "image_url": {"url": image_url}})
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": content}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
multimodal_long = ask("google/gemini-3.1-pro-preview",
"Summarize this 800K-token transcript and extract action items.",
image_url="https://example.com/chart.png")
text_only_long = ask("bigmodel/glm-5.2",
"Rewrite this 50K-token file with the new API.")
cheap_long = ask("deepseek/deepseek-v4-pro",
"Summarize this 200K-token document.")
coding_flagship = ask("anthropic/claude-sonnet-5",
"Refactor this Python function and add tests.")
Streaming, tool calling, JSON mode และอินพุตภาพทำงานเหมือนกันทั้งหมด — เปลี่ยนสตริง model แล้วเพิ่มพารามิเตอร์ที่เกี่ยวข้อง สำหรับการตอบกลับแบบ streaming ให้ส่ง stream=True; สำหรับ tool calling ให้ส่งอาร์กิวเมนต์ tools; สำหรับเอาต์พุตแบบมีโครงสร้าง ใช้ response_format={"type": "json_object"} ดู เอกสาร streaming ของ MeshTok และ เอกสาร tool-calling สำหรับตัวอย่างเต็มใน Python, JavaScript และ cURL
คำถามที่พบบ่อย
Gemini 3.1 Pro เป็นโมเดลบริบท 1M เดียวจริง ๆ ที่มีอินพุตวิดีโอและเสียงหรือไม่?
ณ 2026-07-21 ใช่ โมเดลอื่นทุกรุ่นใน src/data/models.ts ที่มีหน้าต่างบริบท 1M+ — DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.2, Qwen3.7 Max/Plus, Qwen3.5 Plus/Flash, Qwen3.6 Plus, Claude Sonnet 5, Claude Opus 4.6/4.7/4.8, MiniMax M3, Longcat 2.0, Mimo V2 Pro/V2.5 — รับได้เฉพาะข้อความ หรือข้อความบวกภาพ ไม่มีรุ่นใดที่มีแท็กความสามารถ video หรือ audio โมเดลเดียวที่มีอินพุตวิดีโอ/เสียงเนทีฟคือตระกูล Gemini เอง
ทำไมไม่มีเกณฑ์วัดเวลาตอบสนองหรือการเรียกคืนในบทความนี้? เพราะเราไม่ได้รันสักเกณฑ์ และเราจะไม่เผยแพร่ตัวเลขที่เราสำรองไม่ได้ด้วย log ดิบ การเรียกคืน long-context (คำถาม “needle in a haystack”) ขึ้นอยู่กับรูปร่าง prompt, ตำแหน่ง, ภาษา และพฤติกรรมการใส่ใจของโมเดลที่แต่ละความลึก — เปอร์เซ็นต์การเรียกคืนเดี่ยวโดยไม่มี test harness, prompt และเอาต์พุตดิบคือการตลาด ไม่ใช่ข้อมูล ถ้าคุณต้องการตัวเลขการเรียกคืนสำหรับงานของคุณ รันด้วยตัวเองบน MeshTok กับคลังข้อมูลของคุณ ข้อมูลราคาและความสามารถข้างต้นคือส่วนที่เสถียรและตรวจสอบได้
คำต่อท้าย -preview ในไอดีโมเดลเป็นปัญหาหรือไม่?
มันเป็นสัญญาณ ไม่ใช่อุปสรรค Google ส่ง 3.1 Pro ออกมาเป็นโมเดล preview ในแคตตาล็อก (google/gemini-3.1-pro-preview) โดยทั่วไปหมายความว่าสเปกชีทแม่นยำ แต่โมเดลอาจเปลี่ยนพฤติกรรมโดยไม่เพิ่มเวอร์ชัน สำหรับ routing production ที่ความเสถียรสำคัญกว่าความสามารถล่าสุด Gemini 2.5 Pro เป็นทางเลือก flagship ที่ไม่ใช่ preview ในราคาที่ต่ำกว่า
Gemini 3.1 Pro เปรียบเทียบกับ Gemini 2.5 Pro อย่างไร?
2.5 Pro เป็น flagship รุ่นเก่าของ Google มันถูกกว่า ($1.25/$10 เทียบ $2/$12) มีแท็ก flagship + reasoning + มัลติโมดอลเต็มเหมือนกัน และมีหน้าต่างบริบท 1,048,576 เท่ากัน เหตุผลที่ควรจ่ายเพิ่มสำหรับ 3.1 Pro: เอาต์พุตสูงสุด 65,536 ที่กำหนดชัดเจน, คัตออฟความรู้ที่ใหม่กว่า (2026-05) และเจเนอเรชัน 3.1 ที่ใหม่กว่า เหตุผลที่ควรอยู่กับ 2.5 Pro: มันถูกกว่าอย่างเคร่งครัดถ้าคุณไม่ต้องการสามสิ่งนั้น
Gemini 3.1 Pro รองรับ tool calling และเอาต์พุตแบบมีโครงสร้างหรือไม่?
ใช่ ฟิลด์ capabilities ระบุ tools และ json หมายความว่าการเรียกฟังก์ชันเนทีฟและเอาต์พุตแบบมีโครงสร้างในโหมด JSON รองรับทั้งคู่ผ่าน endpoint compatible กับ OpenAI ของ MeshTok รูปแบบคำขอเหมือนกับของ OpenAI ทุกประการ — เปลี่ยนเพียงฟิลด์ model
หน้าต่างบริบท 1M เป็นของจริงหรือเป็นแค่การตลาด?
มันคือหน้าต่างบริบทที่ประกาศใน src/data/models.ts สะท้อนจากโมเดลการ์ดของ Google เอง บริบทที่ใช้งานได้จริงขึ้นอยู่กับรูปร่าง prompt กลยุทธ์ retrieval และวิธีที่โมเดลจัดการการใส่ใจในบริบทยาว — ทั้งหมดที่คุณควรทดสอบกับข้อมูลของคุณเอง ตัวเลขในแคตตาล็อกเป็นขอบเขตบนที่โมเดลรับ ไม่ใช่การรับประกันคุณภาพที่ทุกตำแหน่ง
ทำไม Gemini 3.1 Pro แพงกว่า DeepSeek V4 Pro มาก? โครงสร้างต้นทุนและความสามารถที่ต่างกัน DeepSeek V4 Pro ตั้งราคาเพื่อปริมาณข้อความ+ภาพอย่างก้าวร้าวและไม่รับวิดีโอหรือเสียง Gemini 3.1 Pro ตั้งราคาเป็น flagship มัลติโมดอลเต็มรูปแบบพร้อมการรองรับวิดีโอและเสียงเนทีฟ — นั่นคือพื้นผิวอินพุตที่ต่างกัน ไม่ใช่การเปรียบเทียบข้อความแบบเทียบเท่า MeshTok ไม่เพิ่มมาร์กอปใด ๆ คุณเห็นสิ่งที่แต่ละแล็บเผยแพร่ทุกประการ
ราคาเหล่านี้เสถียรหรือไม่?
ผู้จำหน่ายโมเดลอัปเดตราคา list เป็นระยะ ตัวเลขในบทความนี้สะท้อนแคตตาล็อก MeshTok ณ 2026-07-21 updatedDate ที่ด้านบนของหน้าบอกคุณว่าบทความได้รับการตรวจทานครั้งล่าสุดเมื่อใด; แหล่งความจริงสดคือ https://meshtok.com/models เสมอ
ตรวจทานล่าสุด 2026-07-21 โดยทีม MeshTok ราคาและความสามารถทั้งหมดนำมาจากแคตตาล็อกโมเดล MeshTok สด (src/data/models.ts) ในวันตรวจทาน ไม่มีการวัดเวลาตอบสนอง จำนวนโทเคน การเรียกคืน หรือคุณภาพสำหรับบทความนี้ — ตัวเลขที่แสดงเป็นการฉายภาพเลขคณิตจากราคา list ที่เผยแพร่ ไม่ใช่เกณฑ์วัดเชิงประจักษ์