ข้ามไปยังเนื้อหา
fedi.software

เขียนโค้ด

โมเดลที่จัดอันดับจากพรอมต์ด้านการเขียนโปรแกรม: ระดับ, Elo พร้อมช่วงความเชื่อมั่น, ราคาต่อหนึ่งล้านโทเค็น และหน้าต่างบริบท

อัปเดตเมื่อ · แหล่งที่มา: LMArena, LiteLLM, models.dev

ค่าใช้จ่ายต่อเดือน
ระดับ โมเดล Elo อินพุต / เอาต์พุต ต่อ 1 ล้าน ต่อเดือน บริบท แอป เปรียบเทียบ
S1,497US$0.75 / US$6 1M
S1,496US$2 / US$10 1M
S1,494US$1.50 / US$12 1M
S1,489US$8 / US$40 1M
S1,483US$1.50 / US$2 1M
S1,482US$2 / US$10 1M
A1,466US$0.06 / US$0.37 1M
A1,454US$1 / US$8 400K
A1,448US$1.60 / US$8 1M
A1,447US$0.25 / US$2 128K
A1,444US$0.08 / US$0.40 1M
A1,438US$0.375 / US$4 400K
A1,436US$1 / US$8 400K
B1,413US$4.50 / US$14 128K
B1,408US$1.80 / US$7.20 200K
B1,407US$1.75 / US$14 128K
B1,406US$0.04 / US$0.29 400K
B1,405US$0.16 / US$1 400K
B1,397US$75 / US$150 128K
B1,391US$0.25 / US$0.75 128K
B1,391US$1.60 / US$6.40 1M
B1,380US$0.032 / US$0.14 131K
B1,378US$0.99 / US$4 200K
B1,368US$0.99 / US$4 200K
B1,367US$0.32 / US$1.28 1M
B1,367US$14 / US$54 200K
B1,363US$0.99 / US$4 200K
B1,362US$1.10 / US$4.40 128K
B1,357US$0.25 / US$0.80 262K
B1,351US$0.04 / US$0.32 400K
B1,323— —
B1,307US$0.009 / US$0.045ฟรี 131K
B1,306US$0.08 / US$0.26 1M
B1,297US$5 / US$15 128K
B1,290US$0.15 / US$0.60 128K
B1,284US$2.50 / US$10 128K
C1,268US$9 / US$27 128K
C1,254US$10 / US$30 8K
C1,136US$0.45 / US$1.40 16K

ระดับเป็นของเราเอง: ตำแหน่งของโมเดลในตาราง โดยนับเฉพาะโมเดลที่ช่วงความเชื่อมั่นทั้งช่วงอยู่สูงกว่า S — 10% แรก, A — ถึง 30%, B — ถึง 60%, C — ถึง 85%, D — ที่เหลือ

คุณภาพเทียบราคา แกนตั้งคือคะแนน แกนนอนคือราคาผสม (อินพุต 3 : เอาต์พุต 1), USD ต่อ 1 ล้านโทเค็น
1,000 1,200 1,400 1,600 US$0.01 US$0.10 US$1 US$10 US$100 MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

ตารางนี้วัดอะไร

ตารางเขียนโค้ดคือหมวด coding ของอารีนาข้อความ LMArena ใช้วิธีโหวตแบบปิดตาเหมือนตารางข้อความ แต่นับเฉพาะพรอมต์ที่เกี่ยวกับโค้ด เช่น ขอให้อธิบายฟังก์ชัน หาบั๊ก หรือเขียนสคริปต์ คนที่ถามเห็นคำตอบสองแบบโดยไม่รู้ชื่อโมเดล แล้วเลือกแบบที่ช่วยได้มากกว่า ผลโหวตกลายเป็นคะแนน Elo พร้อมช่วงความเชื่อมั่น 95%

ต่างจากตารางพัฒนาเว็บและเอเจนต์อย่างไร

ตารางนี้ให้คะแนนคำตอบในแชตเรื่องโค้ด ถ้าคุณสนใจโมเดลที่สร้างเว็บแอปทั้งตัวจากพรอมต์เดียว ให้ดู ตารางพัฒนาเว็บ และถ้าสนใจงานหลายขั้นตอนที่โมเดลต้องเรียกใช้เครื่องมือเอง ให้ดู ตารางเอเจนต์ ทั้งสามตารางมีชุดโมเดลและสเกลของตัวเอง จึงควรเทียบกันภายในตารางเดียว

คอลัมน์ไหนสำคัญกับงานเขียนโปรแกรม

  • ระดับและ Elo บอกว่าคนชอบคำตอบของโมเดลบ่อยแค่ไหนเมื่อเทียบกับตัวอื่น
  • หน้าต่างบริบท สำคัญเมื่อต้องส่งโค้ดทั้งโปรเจกต์หรือหลายไฟล์ให้โมเดลอ่าน ควรดูคู่กับราคา
  • ราคาต่อหนึ่งล้านโทเค็น และแนวโน้มราคา 30 วัน ช่วยประเมินค่าใช้จ่ายเมื่อใช้บ่อย
  • เครื่องคิดเลขและกราฟ ช่วยดูว่าคุณภาพที่เพิ่มขึ้นคุ้มกับราคาหรือไม่ และติ๊กเปรียบเทียบได้สูงสุด 4 โมเดล

อันดับสูงแปลว่าโค้ดจะใช้ได้แน่หรือ

ไม่แน่เสมอ คำตอบในแชตที่คนชอบไม่เหมือนกับการรันเทสต์บนโปรเจกต์จริง โมเดลอาจเขียนโค้ดที่อ่านดีแต่ไม่ผ่านกรณีขอบของระบบคุณ กฎการจัดระดับเหมือนตารางข้อความ: ต้องมีโหวตอย่างน้อย 300 ครั้งจึงจะได้ระดับ ตัวที่ยังไม่ถึงจะขึ้นว่า “ยังไม่จัดระดับ” ราคามาจาก models.dev และ LiteLLM ในวันของข้อมูล

ถ้าคุณจะใช้โมเดลผ่านเครื่องมืออย่างเอเจนต์ในเทอร์มินัลหรือส่วนขยายของโปรแกรมแก้ไขโค้ด ดูรายการได้ที่ เอเจนต์เขียนโค้ด

เคล็ดลับเล็ก ๆ: เลือกโมเดลสองตัวที่ระดับใกล้กันแต่ราคาต่างกัน แล้วให้แก้บั๊กเดียวกันจากโค้ดจริงของคุณ ถ้าผลพอ ๆ กัน ตัวที่ถูกกว่ามักคุ้มกว่าสำหรับงานประจำวัน