AI-modellen van 2023: wie bracht wat uit
Elke belangrijke modelrelease maand voor maand: aanbieder en zijn land, open of gesloten weights, type, contextvenster, grootte van open modellen — en bij welke taken de modellen van elk jaar vandaag aan kop staan.
2023 9 releases · 5 met open weights
- Tekst C GPT-4 TurboOpenAI
- Programmeren C GPT-4 TurboOpenAI
- Afbeelding D dall-e-3OpenAI
December
- Mistral 7B Instruct v0.2 HFMistral AIFrankrijkOpen weightsLLM7.2B
- C mixtral-8x7b-instruct-v0.1Mistral AIFrankrijkOpen weightsLLM32K
November
- Qwen 72B HFAlibabaChinaOpen weightsLLM72.3B
- D dall-e-3OpenAIVerenigde StatenGeslotenBeeld
- C GPT 4OpenAIVerenigde StatenGeslotenLLM8K
- C GPT-4 TurboOpenAIVerenigde StatenGeslotenVision (VLM)128K
Juli
- Llama 2 7b hf HFMetaVerenigde StatenOpen weightsLLM6.7B
Maart
- C GPT-3.5 TurboOpenAIVerenigde StatenGeslotenLLM16K
Februari
- pythia-6.9b HFEleutherAIVerenigde StatenOpen weightsLLM7B
De releasedata komen uit de modelcatalogi (models.dev, LiteLLM, Hugging Face); modellen waarvan alleen het releasejaar bekend is, worden niet getoond. De koplopers van een jaar zijn de modellen uit dat jaar die vandaag het hoogst staan in onze ranglijsten.
Bijgewerkt · Bronnen: models.dev (MIT), LiteLLM (MIT), LMArena (CC BY 4.0), Hugging Face
Arena (LMArena) scores: Arena Leaderboard Dataset by LMArena, CC BY 4.0. Modified by fedi.software (filtered, re-ranked, aggregated). Not endorsed by LMArena.
Wat deze tijdlijn laat zien
De grafiek zet modelreleases op één tijdas: het nieuwste jaar staat bovenaan, en binnen elk jaar zijn de releases per maand gegroepeerd. Elke regel is één model, met de aanbieder, het land waar dat bedrijf zijn hoofdkantoor heeft, open of gesloten gewichten, het type en het contextvenster. Bij open modellen staat ook het aantal parameters. Gaat het om een mixture-of-experts-model (MoE), dan geeft het tweede getal het actieve deel aan: de parameters die per token echt meerekenen.
Niet elk model komt erin. We tonen modellen van AI-labs die een rating hebben op onze ranglijsten of waarvan de gewichten op Hugging Face staan. Doorverkopers, routers en fine-tunes uit de community laten we weg, zodat de lijst laat zien wie een model werkelijk heeft gebouwd.
De labels lezen
- „Open weights” — de modelbestanden zijn te downloaden en draaien op je eigen machine; welk open model past op jouw hardware laat zien wat daarvoor nodig is.
- „Gesloten” — het model is alleen bereikbaar via de app of de API van de aanbieder.
- LLM staat voor een taalmodel dat met tekst werkt, „Vision (VLM)” leest daarnaast afbeeldingen, en een model met het label „Redeneren” denkt stap voor stap na voordat het antwoordt. Dat maakt elk antwoord trager en duurder, maar sterker bij wiskunde, code en planning. Beeld-, video- en audiogeneratoren hebben hun eigen label.
Aanbieders van gesloten modellen maken het aantal parameters niet bekend. Daarom blijft dat vakje bij hen leeg, in plaats van dat we een gok invullen.
De koplopers van elk jaar
Boven elk jaar staat een strook met de modellen uit dat jaar die nu aan kop staan bij tekst, programmeren, webontwikkeling, agents, beeld en video. Let op het woord „nu”. Het is geen reconstructie van hoe de ranglijst er toen uitzag, maar een blik van vandaag: een model dat in het voorjaar verscheen, kan in het najaar al zijn ingehaald, en de strook toont hoe die generatie het nu doet op de ranglijsten, gemeten met de ratings van LMArena.
Filteren en per jaar bekijken
Je kunt de tijdlijn beperken tot één aanbieder, één land, alleen open weights of één type, of gewoon op een naam zoeken. Elk jaar heeft ook een eigen pagina, een jaareditie waar je rechtstreeks naar kunt linken.
Bronnen en kanttekeningen
Releasedata en contextvensters komen uit de modelcatalogi models.dev en LiteLLM, parameters en licenties van Hugging Face; de landen van de aanbieders houden we zelf bij. De datum is de dag waarop een model in die catalogi verscheen, en die kan een paar dagen afwijken van de aankondiging. Modellen waarvan de bronnen alleen het jaar geven, staan er niet in. Het land is dat van het hoofdkantoor, niet van de datacenters of de gebruikers.