เปรียบเทียบโมเดล AI
วางโมเดลเทียบกันได้สูงสุดสี่ตัว: ระดับและ Elo ในทุกตารางอันดับ ราคา หน้าต่างบริบท และวันที่เปิดตัว
อัปเดตเมื่อ · แหล่งที่มา: models.dev
| ตัวชี้วัด | Claude Opus 4.1 Anthropic |
|---|---|
| ข้อความ | A 1,419 1,416–1,423 |
| เขียนโค้ด | S 1,479 1,473–1,486 |
| พัฒนาเว็บ | B 1,389 1,379–1,400 |
| อินพุต / เอาต์พุต ต่อ 1 ล้าน | US$13 / US$64 |
| หน้าต่างบริบท | 197K |
| เอาต์พุตสูงสุด | 32K |
| วันที่เปิดตัว | 5 สิงหาคม 2025 |
| ข้อมูลความรู้ถึง | 2025-03 |
| สัญญาอนุญาต | — |
| อินพุต | ข้อความ, รูปภาพ, ไฟล์ |
| แอป | — |
เปรียบเทียบโมเดลได้อย่างไร
หน้านี้วางโมเดลเทียบกันเป็นคอลัมน์ได้สูงสุด 4 ตัว แต่ละคอลัมน์แสดงระดับและคะแนนในทุกตารางอันดับที่โมเดลนั้นมีชื่ออยู่ ราคาต่อหน่วย หน้าต่างบริบท เอาต์พุตสูงสุด รูปแบบข้อมูลที่รองรับ สถานะโอเพนเวต และวันที่เปิดตัว ข้อมูลอันดับมาจาก LMArena ส่วนราคาและรายละเอียดทางเทคนิคมาจาก models.dev และ LiteLLM
ขั้นตอน
- พิมพ์ชื่อโมเดลในช่อง แล้วเลือกจากรายการที่ขึ้นมา
- หรือติ๊กช่อง “เปรียบเทียบ” ในตารางอันดับใดก็ได้ แล้วเปิดหน้านี้
- เลือกอย่างน้อยสองโมเดล จากนั้นกด “เปรียบเทียบ”
- ถ้าต้องการเริ่มใหม่ กด “ล้าง”
อ่านผลให้ถูก
ให้เทียบคะแนนภายในตารางเดียวกันเท่านั้น Elo ของตารางข้อความกับ “คะแนน” ของตารางเอเจนต์เป็นคนละสเกล ตัวเลขที่ดูใกล้กันจึงเอามาเทียบข้ามตารางไม่ได้ ช่องที่ว่างหมายความว่าแหล่งข้อมูลไม่มีค่านั้นสำหรับโมเดลนั้น ไม่ได้แปลว่าเป็นศูนย์ เช่น โมเดลที่ไม่เคยเข้าอารีนาวิดีโอจะไม่มีระดับในแถววิดีโอ
ตัวอย่างการใช้
ถ้าคุณกำลังเลือกระหว่างโมเดลโอเพนเวตที่รันเองได้กับโมเดลคลาวด์ที่ระดับสูงกว่า ให้วางทั้งสองตัวเทียบกัน ดูว่าระดับต่างกันจริงแค่ไหนในตารางที่ตรงกับงาน แล้วเทียบกับราคาและหน้าต่างบริบท บางครั้งตัวที่ระดับต่ำกว่าหนึ่งขั้นแต่ราคาถูกกว่ามากก็คุ้มกว่าสำหรับงานประจำ
ลิงก์เปรียบเทียบที่มีโมเดลเลือกไว้แล้วใช้สำหรับแชร์ให้เพื่อนร่วมทีม เครื่องมือค้นหาจะเก็บเฉพาะหน้าเปล่าที่ยังไม่ได้เลือกโมเดล
อย่าลืมว่าอันดับเป็นภาพของวันที่ดึงข้อมูล ถ้าคุณแชร์ลิงก์ให้คนอื่นดูในวันหลัง ตัวเลขอาจเปลี่ยนไปแล้ว ให้ระบุวันที่ไว้ในข้อความที่แชร์ด้วย หากใช้ผลเปรียบเทียบประกอบการตัดสินใจของทีม ให้บันทึกภาพหน้าจอเก็บไว้พร้อมวันที่ เพื่อย้อนดูเหตุผลภายหลังได้ และทดสอบโมเดลที่เลือกกับงานจริงของทีมอย่างน้อยหนึ่งชุดก่อนตัดสินใจขั้นสุดท้าย