Naar de inhoud
fedi.software

AI-modellen van 2023: wie bracht wat uit

Elke belangrijke modelrelease maand voor maand: aanbieder en zijn land, open of gesloten weights, type, contextvenster, grootte van open modellen — en bij welke taken de modellen van elk jaar vandaag aan kop staan.

2023 9 releases · 5 met open weights

Modellen van 2023 die nu bij elke taak aan kop staan

December

  1. Mistral 7B Instruct v0.2 HFMistral AIFrankrijkOpen weightsLLM7.2B
  2. C mixtral-8x7b-instruct-v0.1Mistral AIFrankrijkOpen weightsLLM32K

November

  1. Qwen 72B HFAlibabaChinaOpen weightsLLM72.3B
  2. D dall-e-3OpenAIVerenigde StatenGeslotenBeeld
  3. C GPT 4OpenAIVerenigde StatenGeslotenLLM8K
  4. C GPT-4 TurboOpenAIVerenigde StatenGeslotenVision (VLM)128K

Juli

  1. Llama 2 7b hf HFMetaVerenigde StatenOpen weightsLLM6.7B

Maart

  1. C GPT-3.5 TurboOpenAIVerenigde StatenGeslotenLLM16K

Februari

  1. pythia-6.9b HFEleutherAIVerenigde StatenOpen weightsLLM7B

De releasedata komen uit de modelcatalogi (models.dev, LiteLLM, Hugging Face); modellen waarvan alleen het releasejaar bekend is, worden niet getoond. De koplopers van een jaar zijn de modellen uit dat jaar die vandaag het hoogst staan in onze ranglijsten.

Bijgewerkt · Bronnen: models.dev (MIT), LiteLLM (MIT), LMArena (CC BY 4.0), Hugging Face

Arena (LMArena) scores: Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (filtered, re-ranked, aggregated). Not endorsed by LMArena.

Wat deze tijdlijn laat zien

De grafiek zet modelreleases op één tijdas: het nieuwste jaar staat bovenaan, en binnen elk jaar zijn de releases per maand gegroepeerd. Elke regel is één model, met de aanbieder, het land waar dat bedrijf zijn hoofdkantoor heeft, open of gesloten gewichten, het type en het contextvenster. Bij open modellen staat ook het aantal parameters. Gaat het om een mixture-of-experts-model (MoE), dan geeft het tweede getal het actieve deel aan: de parameters die per token echt meerekenen.

Niet elk model komt erin. We tonen modellen van AI-labs die een rating hebben op onze ranglijsten of waarvan de gewichten op Hugging Face staan. Doorverkopers, routers en fine-tunes uit de community laten we weg, zodat de lijst laat zien wie een model werkelijk heeft gebouwd.

De labels lezen

  • „Open weights” — de modelbestanden zijn te downloaden en draaien op je eigen machine; welk open model past op jouw hardware laat zien wat daarvoor nodig is.
  • „Gesloten” — het model is alleen bereikbaar via de app of de API van de aanbieder.
  • LLM staat voor een taalmodel dat met tekst werkt, „Vision (VLM)” leest daarnaast afbeeldingen, en een model met het label „Redeneren” denkt stap voor stap na voordat het antwoordt. Dat maakt elk antwoord trager en duurder, maar sterker bij wiskunde, code en planning. Beeld-, video- en audiogeneratoren hebben hun eigen label.

Aanbieders van gesloten modellen maken het aantal parameters niet bekend. Daarom blijft dat vakje bij hen leeg, in plaats van dat we een gok invullen.

De koplopers van elk jaar

Boven elk jaar staat een strook met de modellen uit dat jaar die nu aan kop staan bij tekst, programmeren, webontwikkeling, agents, beeld en video. Let op het woord „nu”. Het is geen reconstructie van hoe de ranglijst er toen uitzag, maar een blik van vandaag: een model dat in het voorjaar verscheen, kan in het najaar al zijn ingehaald, en de strook toont hoe die generatie het nu doet op de ranglijsten, gemeten met de ratings van LMArena.

Filteren en per jaar bekijken

Je kunt de tijdlijn beperken tot één aanbieder, één land, alleen open weights of één type, of gewoon op een naam zoeken. Elk jaar heeft ook een eigen pagina, een jaareditie waar je rechtstreeks naar kunt linken.

Bronnen en kanttekeningen

Releasedata en contextvensters komen uit de modelcatalogi models.dev en LiteLLM, parameters en licenties van Hugging Face; de landen van de aanbieders houden we zelf bij. De datum is de dag waarop een model in die catalogi verscheen, en die kan een paar dagen afwijken van de aankondiging. Modellen waarvan de bronnen alleen het jaar geven, staan er niet in. Het land is dat van het hoofdkantoor, niet van de datacenters of de gebruikers.