ข้ามไปยังเนื้อหา
fedi.software

เอเจนต์

โมเดลที่จัดอันดับจากงานแบบเอเจนต์ ทั้งการเรียกใช้เครื่องมือและงานหลายขั้นตอน ตามตารางอันดับเอเจนต์ของ LMArena คะแนนนี้มีศูนย์เป็นจุดกึ่งกลาง ไม่ใช่ Elo

อัปเดตเมื่อ · แหล่งที่มา: LMArena, LiteLLM, models.dev

ค่าใช้จ่ายต่อเดือน
ระดับ โมเดล คะแนน อินพุต / เอาต์พุต ต่อ 1 ล้าน ต่อเดือน บริบท แอป เปรียบเทียบ
B0.025US$0.338 / US$1.01 1M
B-0.007US$0.10 / US$0.20 262K
C-0.017US$0.045 / US$0.32 262K
C-0.051US$0.825 / US$2.48 1M
C-0.072US$0.282 / US$1.13 1M
D-0.103US$0.45 / US$1.20 524K
D-0.109US$0.95 / US$4.05ฟรี 262K
D-0.124US$1.50 / US$7.50 256K

ระดับเป็นของเราเอง: ตำแหน่งของโมเดลในตาราง โดยนับเฉพาะโมเดลที่ช่วงความเชื่อมั่นทั้งช่วงอยู่สูงกว่า S — 10% แรก, A — ถึง 30%, B — ถึง 60%, C — ถึง 85%, D — ที่เหลือ

คุณภาพเทียบราคา แกนตั้งคือคะแนน แกนนอนคือราคาผสม (อินพุต 3 : เอาต์พุต 1), USD ต่อ 1 ล้านโทเค็น
-0.2 -0.1 0.0 0.1 0.2 US$0.01 US$0.10 US$1 US$10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

ก่อนอ่าน: คะแนนนี้ไม่ใช่ Elo

ตารางเอเจนต์ใช้ข้อมูลจากตารางอันดับเอเจนต์ของ LMArena ซึ่งให้คนประเมินงานหลายขั้นตอนที่โมเดลต้องเรียกใช้เครื่องมือเอง ตัวชี้วัดของตารางนี้เป็นคะแนนที่มีศูนย์เป็นจุดกึ่งกลาง มีได้ทั้งค่าติดลบและค่าบวก คอลัมน์ชื่อ “คะแนน” และแสดงทศนิยมสามตำแหน่ง ส่วนจำนวนโหวตนับเป็นจำนวนเซสชัน ไม่ใช่จำนวนคำตอบ

คะแนนเหนือศูนย์หมายความว่าคนเลือกโมเดลนั้นบ่อยกว่าโมเดลเฉลี่ยของตารางนี้ ต่ำกว่าศูนย์คือน้อยกว่า ให้เทียบโมเดลกันภายในตารางนี้เท่านั้น อย่านำไปเทียบกับตัวเลข Elo ของตารางข้อความหรือตารางอื่น เพราะเป็นคนละสเกล

ระดับยังใช้กฎเดียวกัน

แม้ตัวชี้วัดต่างออกไป ระดับ S ถึง D ยังคิดแบบเดียวกับทุกตาราง: นับเฉพาะโมเดลที่มีโหวตอย่างน้อย 300 เซสชัน ดูว่ามีกี่ตัวที่ช่วงความเชื่อมั่น 95% ทั้งช่วงอยู่สูงกว่า แล้วแบ่งที่ 10%, 30%, 60% และ 85%

ใช้ตารางนี้ตอนไหน

  • เมื่อเลือกโมเดลให้เอเจนต์เขียนโค้ด บอต หรือระบบอัตโนมัติที่ต้องทำหลายขั้นตอน
  • เมื่ออยากรู้ว่าโมเดลใช้เครื่องมือและทำงานต่อเนื่องได้ดีแค่ไหน ไม่ใช่แค่ตอบแชต
  • ดูคู่กับราคาต่อหนึ่งล้านโทเค็น เพราะงานเอเจนต์ใช้โทเค็นจำนวนมาก

ตัวอย่างการอ่านค่า

ถ้าโมเดลหนึ่งมีคะแนนบวกและอีกตัวติดลบ แต่แถบช่วงความเชื่อมั่นของทั้งคู่ยังซ้อนกัน ความต่างนั้นยังไม่ชัดทางสถิติ ให้ดูราคาและหน้าต่างบริบทประกอบ ส่วนโมเดลที่คะแนนใกล้ศูนย์ไม่ได้แย่ แค่อยู่ระดับเดียวกับค่าเฉลี่ยของโมเดลในตารางนี้

ข้อจำกัด

ตารางนี้ยังใหม่และมีโมเดลน้อยกว่าตารางข้อความ เฟรมเวิร์กเอเจนต์ที่อารีนาใช้ก็ไม่ใช่ตัวเดียวกับที่คุณจะใช้ ผลจริงจึงขึ้นกับเครื่องมือและงานของคุณด้วย ราคามาจาก models.dev และ LiteLLM เครื่องมือสำหรับนำโมเดลไปใช้งานดูได้ที่ เอเจนต์เขียนโค้ด และ ระบบอัตโนมัติ