เอเจนต์
โมเดลที่จัดอันดับจากงานแบบเอเจนต์ ทั้งการเรียกใช้เครื่องมือและงานหลายขั้นตอน ตามตารางอันดับเอเจนต์ของ LMArena คะแนนนี้มีศูนย์เป็นจุดกึ่งกลาง ไม่ใช่ Elo
อัปเดตเมื่อ · แหล่งที่มา: LMArena, LiteLLM, models.dev
ระดับเป็นของเราเอง: ตำแหน่งของโมเดลในตาราง โดยนับเฉพาะโมเดลที่ช่วงความเชื่อมั่นทั้งช่วงอยู่สูงกว่า S — 10% แรก, A — ถึง 30%, B — ถึง 60%, C — ถึง 85%, D — ที่เหลือ
ก่อนอ่าน: คะแนนนี้ไม่ใช่ Elo
ตารางเอเจนต์ใช้ข้อมูลจากตารางอันดับเอเจนต์ของ LMArena ซึ่งให้คนประเมินงานหลายขั้นตอนที่โมเดลต้องเรียกใช้เครื่องมือเอง ตัวชี้วัดของตารางนี้เป็นคะแนนที่มีศูนย์เป็นจุดกึ่งกลาง มีได้ทั้งค่าติดลบและค่าบวก คอลัมน์ชื่อ “คะแนน” และแสดงทศนิยมสามตำแหน่ง ส่วนจำนวนโหวตนับเป็นจำนวนเซสชัน ไม่ใช่จำนวนคำตอบ
คะแนนเหนือศูนย์หมายความว่าคนเลือกโมเดลนั้นบ่อยกว่าโมเดลเฉลี่ยของตารางนี้ ต่ำกว่าศูนย์คือน้อยกว่า ให้เทียบโมเดลกันภายในตารางนี้เท่านั้น อย่านำไปเทียบกับตัวเลข Elo ของตารางข้อความหรือตารางอื่น เพราะเป็นคนละสเกล
ระดับยังใช้กฎเดียวกัน
แม้ตัวชี้วัดต่างออกไป ระดับ S ถึง D ยังคิดแบบเดียวกับทุกตาราง: นับเฉพาะโมเดลที่มีโหวตอย่างน้อย 300 เซสชัน ดูว่ามีกี่ตัวที่ช่วงความเชื่อมั่น 95% ทั้งช่วงอยู่สูงกว่า แล้วแบ่งที่ 10%, 30%, 60% และ 85%
ใช้ตารางนี้ตอนไหน
- เมื่อเลือกโมเดลให้เอเจนต์เขียนโค้ด บอต หรือระบบอัตโนมัติที่ต้องทำหลายขั้นตอน
- เมื่ออยากรู้ว่าโมเดลใช้เครื่องมือและทำงานต่อเนื่องได้ดีแค่ไหน ไม่ใช่แค่ตอบแชต
- ดูคู่กับราคาต่อหนึ่งล้านโทเค็น เพราะงานเอเจนต์ใช้โทเค็นจำนวนมาก
ตัวอย่างการอ่านค่า
ถ้าโมเดลหนึ่งมีคะแนนบวกและอีกตัวติดลบ แต่แถบช่วงความเชื่อมั่นของทั้งคู่ยังซ้อนกัน ความต่างนั้นยังไม่ชัดทางสถิติ ให้ดูราคาและหน้าต่างบริบทประกอบ ส่วนโมเดลที่คะแนนใกล้ศูนย์ไม่ได้แย่ แค่อยู่ระดับเดียวกับค่าเฉลี่ยของโมเดลในตารางนี้
ข้อจำกัด
ตารางนี้ยังใหม่และมีโมเดลน้อยกว่าตารางข้อความ เฟรมเวิร์กเอเจนต์ที่อารีนาใช้ก็ไม่ใช่ตัวเดียวกับที่คุณจะใช้ ผลจริงจึงขึ้นกับเครื่องมือและงานของคุณด้วย ราคามาจาก models.dev และ LiteLLM เครื่องมือสำหรับนำโมเดลไปใช้งานดูได้ที่ เอเจนต์เขียนโค้ด และ ระบบอัตโนมัติ