ข้ามไปยังเนื้อหา
fedi.software

พัฒนาเว็บ

โมเดลที่จัดอันดับจากการสร้างเว็บแอปที่ใช้งานได้จริงจากพรอมต์ในอารีนา WebDev ของ LMArena พร้อมราคาและบริบท

อัปเดตเมื่อ · แหล่งที่มา: LMArena, LiteLLM, models.dev

ค่าใช้จ่ายต่อเดือน
ระดับ โมเดล Elo อินพุต / เอาต์พุต ต่อ 1 ล้าน ต่อเดือน บริบท แอป เปรียบเทียบ
S1,623US$0.40 / US$1.40ฟรี 1M
A1,616US$0.03 / US$0.10ฟรี 1M
A1,605US$0.30 / US$1.05ฟรี 1M
B1,508US$0.45 / US$2.15 200K
B1,434US$0.2740 / US$1.10 205K
B1,434US$0.40 / US$1.75 205K
B1,413US$0.95 / US$4.05ฟรี 262K
B1,408US$0.45 / US$1.20 524K
B1,400US$0.7042 / US$3.10 200K
C1,339US$0.2740 / US$1.10 205K
C1,255— —

ระดับเป็นของเราเอง: ตำแหน่งของโมเดลในตาราง โดยนับเฉพาะโมเดลที่ช่วงความเชื่อมั่นทั้งช่วงอยู่สูงกว่า S — 10% แรก, A — ถึง 30%, B — ถึง 60%, C — ถึง 85%, D — ที่เหลือ

คุณภาพเทียบราคา แกนตั้งคือคะแนน แกนนอนคือราคาผสม (อินพุต 3 : เอาต์พุต 1), USD ต่อ 1 ล้านโทเค็น
1,000 1,200 1,400 1,600 1,800 2,000 US$0.01 US$0.10 US$1 US$10 Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

อารีนา WebDev ทำงานอย่างไร

ตารางพัฒนาเว็บใช้ข้อมูลจากอารีนา WebDev ของ LMArena โมเดลสองตัวได้รับพรอมต์เดียวกัน เช่น ขอหน้าเว็บจองคิวหรือเกมเล็ก ๆ แล้วต่างคนต่างสร้างเว็บแอปที่ใช้งานได้จริงออกมา ผู้ใช้เปิดดูทั้งสองแอปโดยไม่รู้ว่าเป็นโมเดลไหน แล้วโหวตให้แอปที่ดีกว่า คะแนนสะท้อนผลลัพธ์ทั้งชิ้น ทั้งการจัดหน้า โค้ดที่ทำงานได้ และการทำตามคำขอ ไม่ได้ดูแค่สไตล์ของโค้ด

โมเดลชุดไหนอยู่ในตาราง

อารีนานี้มีชุดโมเดลของตัวเอง ต่างจากตารางข้อความและตารางเขียนโค้ด โมเดลที่เก่งแชตเรื่องโค้ดจึงอาจอยู่คนละตำแหน่งในตารางนี้ คอลัมน์เหมือนตารางอื่น ได้แก่ ระดับ, Elo พร้อมช่วงความเชื่อมั่น 95%, ราคาต่อหนึ่งล้านโทเค็น และหน้าต่างบริบท ราคามาจาก models.dev และ LiteLLM

ใช้ข้อมูลนี้อย่างไรให้เกิดประโยชน์

  • ใช้หาโมเดลสำหรับทำต้นแบบเว็บ หน้าแลนดิ้ง หรือเครื่องมือเล็ก ๆ จากคำอธิบาย
  • ดูช่วงความเชื่อมั่น ถ้าสองโมเดลซ้อนกัน ให้เลือกจากราคาหรือบริบทแทน
  • ตัวกรอง “ราคาถูก” หมายถึงราคาผสมต่ำกว่า 1 USD ต่อหนึ่งล้านโทเค็น
  • เทียบโมเดลที่สนใจสูงสุด 4 ตัวได้ใน หน้าเปรียบเทียบ

ตัวอย่างการใช้งาน

สมมติว่าคุณต้องการหน้าเว็บแสดงเมนูร้านกาแฟพร้อมปุ่มสั่งซื้อ ให้เขียนคำขอสั้น ๆ ที่ระบุส่วนประกอบและสไตล์ แล้วส่งให้โมเดลสองตัวจากระดับบนของตาราง เปิดผลลัพธ์ในเบราว์เซอร์ ตรวจว่าปุ่มทำงานและหน้าจอแสดงผลบนมือถือได้ วิธีนี้คล้ายกับที่อารีนาใช้ให้คะแนน แต่ใช้กับงานของคุณเอง

ข้อจำกัด

แอปในอารีนามีขนาดเล็ก โครงการใหญ่ที่มีหลายหน้า ระบบหลังบ้าน และฐานข้อมูลจริงไม่ได้ถูกให้คะแนน ผลในตารางจึงบอกได้ว่าโมเดลเริ่มงานเว็บได้ดีแค่ไหน แต่ไม่ได้รับประกันว่าจะดูแลโปรเจกต์ขนาดใหญ่ได้ กฎการจัดระดับเหมือนตารางข้อความ: โมเดลที่ได้โหวตไม่ถึง 300 ครั้งยังไม่มีระดับ ถ้าคุณจะให้โมเดลแก้โปรเจกต์จริง ลองดู ตารางเอเจนต์ และ เครื่องมือเอเจนต์เขียนโค้ด ประกอบ