ข้ามไปยังเนื้อหา
fedi.software

เขียนโค้ด

โมเดลที่จัดอันดับจากพรอมต์ด้านการเขียนโปรแกรม: ระดับ, Elo พร้อมช่วงความเชื่อมั่น, ราคาต่อหนึ่งล้านโทเค็น และหน้าต่างบริบท

อัปเดตเมื่อ · แหล่งที่มา: LMArena, LiteLLM, models.dev

ค่าใช้จ่ายต่อเดือน
ระดับ โมเดล Elo อินพุต / เอาต์พุต ต่อ 1 ล้าน ต่อเดือน บริบท แอป เปรียบเทียบ
S1,510US$1 / US$4ฟรี 1M
S1,489US$0.275 / US$1.10ฟรี 262K
S1,483US$0.30 / US$1.90 262K
A1,464US$0.95 / US$4.05ฟรี 262K
A1,453US$1.15 / US$8 262K
A1,453US$0.45 / US$1.20 524K
B1,399US$0.40 / US$1.80 256K
B1,381— —
B1,375— —
B1,312— —
B1,312— —
C1,267— —
C1,230— —
C1,190— —
C1,169— —
C1,165— —
C1,159— —
C1,154— —
C1,143— —
C1,132— —
C1,129— —
C1,116— —
C1,113— —
C1,112— —
C1,098— —
C1,089— —
C1,080— —
D1,078— —
D1,067— —
D1,064— —
–1,053— —
D1,048— —
D1,045— —
D1,041— —
–1,039— —
D1,010— —
D1,001— —
–996— —
D945— —
D928— —
D913— —
D900— —
D886— —
D799— —
D776— —
D764— —

ระดับเป็นของเราเอง: ตำแหน่งของโมเดลในตาราง โดยนับเฉพาะโมเดลที่ช่วงความเชื่อมั่นทั้งช่วงอยู่สูงกว่า S — 10% แรก, A — ถึง 30%, B — ถึง 60%, C — ถึง 85%, D — ที่เหลือ

คุณภาพเทียบราคา แกนตั้งคือคะแนน แกนนอนคือราคาผสม (อินพุต 3 : เอาต์พุต 1), USD ต่อ 1 ล้านโทเค็น
1,000 1,200 1,400 1,600 US$0.01 US$0.10 US$1 US$10 US$100 MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

ตารางนี้วัดอะไร

ตารางเขียนโค้ดคือหมวด coding ของอารีนาข้อความ LMArena ใช้วิธีโหวตแบบปิดตาเหมือนตารางข้อความ แต่นับเฉพาะพรอมต์ที่เกี่ยวกับโค้ด เช่น ขอให้อธิบายฟังก์ชัน หาบั๊ก หรือเขียนสคริปต์ คนที่ถามเห็นคำตอบสองแบบโดยไม่รู้ชื่อโมเดล แล้วเลือกแบบที่ช่วยได้มากกว่า ผลโหวตกลายเป็นคะแนน Elo พร้อมช่วงความเชื่อมั่น 95%

ต่างจากตารางพัฒนาเว็บและเอเจนต์อย่างไร

ตารางนี้ให้คะแนนคำตอบในแชตเรื่องโค้ด ถ้าคุณสนใจโมเดลที่สร้างเว็บแอปทั้งตัวจากพรอมต์เดียว ให้ดู ตารางพัฒนาเว็บ และถ้าสนใจงานหลายขั้นตอนที่โมเดลต้องเรียกใช้เครื่องมือเอง ให้ดู ตารางเอเจนต์ ทั้งสามตารางมีชุดโมเดลและสเกลของตัวเอง จึงควรเทียบกันภายในตารางเดียว

คอลัมน์ไหนสำคัญกับงานเขียนโปรแกรม

  • ระดับและ Elo บอกว่าคนชอบคำตอบของโมเดลบ่อยแค่ไหนเมื่อเทียบกับตัวอื่น
  • หน้าต่างบริบท สำคัญเมื่อต้องส่งโค้ดทั้งโปรเจกต์หรือหลายไฟล์ให้โมเดลอ่าน ควรดูคู่กับราคา
  • ราคาต่อหนึ่งล้านโทเค็น และแนวโน้มราคา 30 วัน ช่วยประเมินค่าใช้จ่ายเมื่อใช้บ่อย
  • เครื่องคิดเลขและกราฟ ช่วยดูว่าคุณภาพที่เพิ่มขึ้นคุ้มกับราคาหรือไม่ และติ๊กเปรียบเทียบได้สูงสุด 4 โมเดล

อันดับสูงแปลว่าโค้ดจะใช้ได้แน่หรือ

ไม่แน่เสมอ คำตอบในแชตที่คนชอบไม่เหมือนกับการรันเทสต์บนโปรเจกต์จริง โมเดลอาจเขียนโค้ดที่อ่านดีแต่ไม่ผ่านกรณีขอบของระบบคุณ กฎการจัดระดับเหมือนตารางข้อความ: ต้องมีโหวตอย่างน้อย 300 ครั้งจึงจะได้ระดับ ตัวที่ยังไม่ถึงจะขึ้นว่า “ยังไม่จัดระดับ” ราคามาจาก models.dev และ LiteLLM ในวันของข้อมูล

ถ้าคุณจะใช้โมเดลผ่านเครื่องมืออย่างเอเจนต์ในเทอร์มินัลหรือส่วนขยายของโปรแกรมแก้ไขโค้ด ดูรายการได้ที่ เอเจนต์เขียนโค้ด

เคล็ดลับเล็ก ๆ: เลือกโมเดลสองตัวที่ระดับใกล้กันแต่ราคาต่างกัน แล้วให้แก้บั๊กเดียวกันจากโค้ดจริงของคุณ ถ้าผลพอ ๆ กัน ตัวที่ถูกกว่ามักคุ้มกว่าสำหรับงานประจำวัน