ข้ามไปยังเนื้อหา
fedi.software

เขียนโค้ด

โมเดลที่จัดอันดับจากพรอมต์ด้านการเขียนโปรแกรม: ระดับ, Elo พร้อมช่วงความเชื่อมั่น, ราคาต่อหนึ่งล้านโทเค็น และหน้าต่างบริบท

อัปเดตเมื่อ · แหล่งที่มา: LMArena, LiteLLM, models.dev

ค่าใช้จ่ายต่อเดือน
ระดับ โมเดล Elo อินพุต / เอาต์พุต ต่อ 1 ล้าน ต่อเดือน บริบท แอป เปรียบเทียบ
S1,506US$0.03 / US$0.10ฟรี 1M
S1,497US$0.40 / US$1.40ฟรี 1M
S1,486US$0.45 / US$2.15 200K
S1,484US$0.30 / US$1.05ฟรี 1M
A1,461US$0.40 / US$1.75 205K
A1,454US$0.2740 / US$1.10 205K
A1,449US$0.2740 / US$1.10 205K
A1,447US$0.50 / US$1.50 262K
A1,434US$0.286 / US$1.14 131K
A1,434US$0.40 / US$2 262K
B1,397US$0.1165 / US$0.2911 131K
B1,390US$0.137 / US$0.411 128K
B1,386US$0.36 / US$1.22 131K
B1,383US$0.06 / US$0.40 200K
B1,363US$0.075 / US$0.20 128K
B1,347US$0.29 / US$0.86 64K
B1,309US$0.10 / US$0.30 128K
C1,276US$0.50 / US$1.50 131K
C1,246US$0.05 / US$0.08 33K
C1,202US$0.10 / US$0.10 128K
C1,166US$0.60 / US$0.60 66K
C1,126US$0.15 / US$0.15 32K
D1,082US$0.05 / US$0.25 32K
D1,018US$0.07 / US$0.28 33K

ระดับเป็นของเราเอง: ตำแหน่งของโมเดลในตาราง โดยนับเฉพาะโมเดลที่ช่วงความเชื่อมั่นทั้งช่วงอยู่สูงกว่า S — 10% แรก, A — ถึง 30%, B — ถึง 60%, C — ถึง 85%, D — ที่เหลือ

คุณภาพเทียบราคา แกนตั้งคือคะแนน แกนนอนคือราคาผสม (อินพุต 3 : เอาต์พุต 1), USD ต่อ 1 ล้านโทเค็น
1,000 1,200 1,400 1,600 US$0.01 US$0.10 US$1 US$10 US$100 MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

ตารางนี้วัดอะไร

ตารางเขียนโค้ดคือหมวด coding ของอารีนาข้อความ LMArena ใช้วิธีโหวตแบบปิดตาเหมือนตารางข้อความ แต่นับเฉพาะพรอมต์ที่เกี่ยวกับโค้ด เช่น ขอให้อธิบายฟังก์ชัน หาบั๊ก หรือเขียนสคริปต์ คนที่ถามเห็นคำตอบสองแบบโดยไม่รู้ชื่อโมเดล แล้วเลือกแบบที่ช่วยได้มากกว่า ผลโหวตกลายเป็นคะแนน Elo พร้อมช่วงความเชื่อมั่น 95%

ต่างจากตารางพัฒนาเว็บและเอเจนต์อย่างไร

ตารางนี้ให้คะแนนคำตอบในแชตเรื่องโค้ด ถ้าคุณสนใจโมเดลที่สร้างเว็บแอปทั้งตัวจากพรอมต์เดียว ให้ดู ตารางพัฒนาเว็บ และถ้าสนใจงานหลายขั้นตอนที่โมเดลต้องเรียกใช้เครื่องมือเอง ให้ดู ตารางเอเจนต์ ทั้งสามตารางมีชุดโมเดลและสเกลของตัวเอง จึงควรเทียบกันภายในตารางเดียว

คอลัมน์ไหนสำคัญกับงานเขียนโปรแกรม

  • ระดับและ Elo บอกว่าคนชอบคำตอบของโมเดลบ่อยแค่ไหนเมื่อเทียบกับตัวอื่น
  • หน้าต่างบริบท สำคัญเมื่อต้องส่งโค้ดทั้งโปรเจกต์หรือหลายไฟล์ให้โมเดลอ่าน ควรดูคู่กับราคา
  • ราคาต่อหนึ่งล้านโทเค็น และแนวโน้มราคา 30 วัน ช่วยประเมินค่าใช้จ่ายเมื่อใช้บ่อย
  • เครื่องคิดเลขและกราฟ ช่วยดูว่าคุณภาพที่เพิ่มขึ้นคุ้มกับราคาหรือไม่ และติ๊กเปรียบเทียบได้สูงสุด 4 โมเดล

อันดับสูงแปลว่าโค้ดจะใช้ได้แน่หรือ

ไม่แน่เสมอ คำตอบในแชตที่คนชอบไม่เหมือนกับการรันเทสต์บนโปรเจกต์จริง โมเดลอาจเขียนโค้ดที่อ่านดีแต่ไม่ผ่านกรณีขอบของระบบคุณ กฎการจัดระดับเหมือนตารางข้อความ: ต้องมีโหวตอย่างน้อย 300 ครั้งจึงจะได้ระดับ ตัวที่ยังไม่ถึงจะขึ้นว่า “ยังไม่จัดระดับ” ราคามาจาก models.dev และ LiteLLM ในวันของข้อมูล

ถ้าคุณจะใช้โมเดลผ่านเครื่องมืออย่างเอเจนต์ในเทอร์มินัลหรือส่วนขยายของโปรแกรมแก้ไขโค้ด ดูรายการได้ที่ เอเจนต์เขียนโค้ด

เคล็ดลับเล็ก ๆ: เลือกโมเดลสองตัวที่ระดับใกล้กันแต่ราคาต่างกัน แล้วให้แก้บั๊กเดียวกันจากโค้ดจริงของคุณ ถ้าผลพอ ๆ กัน ตัวที่ถูกกว่ามักคุ้มกว่าสำหรับงานประจำวัน