Ga naar inhoud
Bronnen/Evaluatiekader
Strategisch kader

Selectiematrix voor AI-leveranciers en -modellen

Een compleet beslissingskader om AI-leveranciers te beoordelen over 8 dimensies. Van het patroon van de fout van 2 miljoen dollar via 25 RFP-vragen, 12 waarschuwingssignalen tot een echte casestudy — alles wat u nodig hebt om de juiste AI-leverancier te kiezen en kostbare lock-in te vermijden.

11 secties
Dekking van begin tot eind
35 min leestijd
Met sjablonen en tabellen
25 RFP-vragen
Klaar om te versturen
Bijgewerkt in maart 2026
Grote en middelgrote ondernemingen
Evaluatieproces van 2 weken

Waarom de selectie van AI-leveranciers mislukt — het patroon van de fout van 2 miljoen dollar

Een Europese fintech koos zijn LLM-leverancier op basis van een demo van 45 minuten en een gunstige blogpost over een benchmark. Achttien maanden later gaf het bedrijf 2,1 miljoen $ uit om ervan weg te migreren. Het model was uitgefaseerd, het complianceteam wees de verwerkersovereenkomst van de leverancier af, en de kosten per token waren verdrievoudigd ten opzichte van het oorspronkelijke budget. Niets hiervan was onvoorzienbaar. Alles zou door een gestructureerde evaluatie zijn opgevangen.

Dit verhaal is niet ongewoon. In gesprekken met meer dan 80 engineeringleiders in heel Europa duiken steeds dezelfde faalpatronen op. De grondoorzaak is bijna nooit de technologie. Het is het proces — of het ontbreken daarvan.

Lock-inrisico

Leverancierspecifieke promptformaten, function-callingschema's en SDK-patronen stapelen zich op tot onzichtbare migratieschuld. Gemiddelde engineeringkosten om midden in een project van LLM-leverancier te wisselen: 50.000 tot 200.000 $ en 3 tot 6 maanden. De meeste teams ontdekken de afhankelijkheid pas wanneer ze een uitfaseringsmelding of een prijsverhoging ontvangen.

Hype versus realiteit

Openbare benchmarks (MMLU, GPQA, HumanEval) meten algemene academische capaciteit. Uw productiebelasting is niet algemeen. Een model dat nr. 1 staat op MMLU kan op uw specifieke taak voor contractextractie of klantenondersteuning op nr. 4 staan. Beslissingen op basis van benchmarks zonder domeinspecifieke pilot stellen geregeld teleur.

De verborgen 60%

API-prijsstelling per token is slechts 40 tot 60% van de werkelijke uitgaven aan AI-infrastructuur. Egresskosten, rekenkracht voor fine-tuning, compliance-audits, upgrades van ondersteuningsniveaus en migratie-engineering vormen de onzichtbare meerderheid. Teams die alleen voor tokens budgetteren, zien in het tweede jaar geregeld kostenoverschrijdingen van 2 tot 3 keer.

De drie faalpatronen, naar frequentie

47%
Compliancemismatch
De leverancier kan niet voldoen aan de eisen voor dataresidentie of regelgeving die tijdens de juridische toetsing worden ontdekt, na de toezegging
31%
Kostenoverschrijding
Verborgen kosten, prijswijzigingen of gebruiksgroei die niet in de oorspronkelijke TCO-analyse zijn gemodelleerd, leiden tot budgetoverschrijding
22%
Prestatiekloof
Modelkwaliteit of latentie in productie komt niet overeen met de demo of benchmark, wat een kostbare migratie vereist

De 8 evaluatiedimensies

Elke selectie van een AI-leverancier moet worden beoordeeld over deze acht dimensies. De standaardgewichten hieronder passen bij een grote onderneming die LLM-infrastructuur uitrolt in een gereguleerde Europese context — pas de gewichten aan op uw specifieke prioriteiten. Een CISO in de zorg weegt beveiliging op 35%. Een start-up in een race naar de markt weegt technische prestaties misschien op 40%.

De gewichten moeten optellen tot 100. Secties 3, 4 en 5 gaan dieper in op de drie zwaarst gewogen dimensies.

D1

Technische prestaties

Modelkwaliteit op uw specifieke taken, latentie, doorvoer en nauwkeurigheid onder realistische omstandigheden.

25%
D2

Beveiliging en compliance

Certificeringen (SOC 2, ISO 27001, HIPAA), dataresidentie, GDPR-houding, afstemming op de EU AI Act.

20%
D3

Totale eigendomskosten

API-prijsstelling, trainingskosten, verborgen kosten, egress, ondersteuningsniveaus en migratie-engineeringkosten.

15%
D4

Ondersteuning en SLA's

Beschikbaarheidsgaranties, reactietijden van de ondersteuning, toegewijde CSM, beschikbaarheid van een enterprise-niveau.

10%
D5

Integratie en ecosysteem

SDK-kwaliteit, frameworkcompatibiliteit (LangChain, LlamaIndex), CI/CD-integratie, documentatie.

10%
D6

Roadmap en stabiliteit van de leverancier

Financiële reserves, releasecadans van modellen, uitfaseringsbeleid, afstemming op uw productroadmap.

10%
D7

Compliance en regelgevingsgeschiktheid

Sectorspecifieke eisen — HIPAA voor de zorg, PCI-DSS voor fintech, risicocategorisering volgens de EU AI Act.

5%
D8

Exitstrategie en portabiliteit

Mechanismen voor data-export, modelportabiliteit, migratiepad, contractuele exitclausules.

5%

Stroomschema van het evaluatieproces

flowchart TD
    A([Start: Vendor Evaluation]) --> B[Discovery & Requirements]
    B --> B1[Define use case & constraints]
    B --> B2[Set must-have criteria]
    B --> B3[Identify 15-20 candidate vendors]
    B1 & B2 & B3 --> C[Initial Shortlist]
    C --> C1[Apply MoSCoW filter]
    C1 --> C2{Passes must-haves?}
    C2 -- No --> X1[Eliminate]
    C2 -- Yes --> D[PoC / Pilot Phase]
    D --> D1[Technical benchmark on your data]
    D --> D2[Security review & DPA check]
    D --> D3[Pricing & TCO modelling]
    D1 & D2 & D3 --> E[Weighted Scoring Matrix]
    E --> E1[Score top 3 vendors]
    E1 --> F[Commercial Negotiation]
    F --> F1[SLA terms]
    F --> F2[Data processing agreement]
    F --> F3[Exit clause negotiation]
    F1 & F2 & F3 --> G([Vendor Selected])
    style A fill:#1a1a2e,stroke:#7c3aed,color:#e2e8f0
    style B fill:#1e293b,stroke:#475569,color:#e2e8f0
    style B1 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style B2 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style B3 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style C fill:#1e293b,stroke:#6366f1,color:#e2e8f0
    style C1 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style C2 fill:#1e1b4b,stroke:#6366f1,color:#e2e8f0
    style D fill:#1e293b,stroke:#3b82f6,color:#e2e8f0
    style D1 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style D2 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style D3 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style E fill:#1e293b,stroke:#8b5cf6,color:#e2e8f0
    style E1 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style F fill:#1e293b,stroke:#f59e0b,color:#e2e8f0
    style F1 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style F2 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style F3 fill:#1e293b,stroke:#475569,color:#e2e8f0
    style X1 fill:#1f0d0d,stroke:#ef4444,color:#e2e8f0
    style G fill:#0d1f12,stroke:#22c55e,color:#e2e8f0

Dimensie 1 in detail: Technische prestaties

Standaardgewicht: 25%

De evaluatie van technische prestaties heeft drie onderdelen: benchmarkmethodiek, meting van latentie en doorvoer, en nauwkeurigheidstests op uw specifieke domein. Alle drie moeten worden uitgevoerd voordat u zich vastlegt.

Benchmarkmethodiek

Openbare benchmarks zijn een startpunt, geen beslissingscriterium. MMLU test brede academische kennis. HumanEval test het genereren van Python-code. Geen van beide test uw specifieke taak. Bouw een domeinspecifieke evaluatieset uit echte productiedata voordat u een leveranciervergelijking uitvoert.

Opbouw van de evaluatieset

  • 100 tot 500 voorbeelden uit echte productiedata
  • Neem randgevallen en bekende faalpatronen op
  • Dek makkelijke, gemiddelde en moeilijke moeilijkheidsgraad af
  • Neem adversariële prompts op die relevant zijn voor uw use case
  • Maak ground-truthlabels met menselijke annotatoren

Nauwkeurigheidsmetrieken per taaktype

  • Extractie: F1-score op de nauwkeurigheid van entiteit/waarde
  • Classificatie: precisie, recall, F1 per klasse
  • Generatie: menselijke evaluatie + ROUGE/BERTScore
  • Redeneren: Pass@1 en Pass@3 op logische taken
  • Hallucinatiegraad: verificatie van feitelijke beweringen

Latentie- en doorvoermetrieken

Evalueer latentie nooit met één enkele aanvraag. Meet onder realistische gelijktijdige belasting met uw verwachte productieverkeerpatroon. De demolatentie van leveranciers is altijd het beste geval bij één aanvraag.

MetriekWat het meetAanvaardbare drempelHoe te meten
P50-latentieMediane responstijd< 400 ms voor eenvoudige takenBelastingstest bij 1x productievolume
P95-latentie95e percentiel — de ondergrens van de gebruikerservaring< 1.200 ms voor complexe takenBelastingstest bij 2x productievolume
P99-latentieSlechtste geval — de slechtste 1% van de gebruikers< 3.000 ms (SLA-plafond)Belastingstest bij 3x productievolume
Time to First TokenWaargenomen snelheid bij streamingresponsen< 300 ms bij P95Meet TTFT los van de totale latentie
Tokens/secondeGeneratiedoorvoer per aanvraag> 40 tokens/s voor een realtime UXAantal tokens / totale generatietijd
Capaciteit van de ratelimietMaximaal gelijktijdige aanvragen / tokens per minuut≥ 2x piekproductievolumeDocumentatie bekijken + burstgedrag testen

Protocol voor nauwkeurigheidstests

Week 1
Basisevaluatie
  • Voer de evaluatieset uit tegen elke leverancier met identieke prompts
  • Registreer nauwkeurigheid, latentie en aantal tokens per respons
  • Markeer duidelijke hallucinaties of formaatfouten
Week 2
Promptoptimalisatie
  • Optimaliseer prompts voor elke leverancier afzonderlijk
  • Meet de nauwkeurigheidswinst van de optimalisatie
  • Documenteer de prompt-engineeringinspanning per leverancier
Week 3
Stress- en randgevaltests
  • Test adversariële invoer en bekende faalpatronen
  • Meet de prestaties op documenten met lange context
  • Test het gedrag aan de grenzen van het contextvenster

Dimensie 2 in detail: Beveiliging en compliance

Standaardgewicht: 20%

Beveiliging en compliance zijn de meest voorkomende reden waarom de selectie van een AI-leverancier na de toezegging mislukt. Deze controles moeten vóór de PoC plaatsvinden, niet erna. Een leverancier die de compliancelat niet haalt, wordt uitgesloten, ongeacht de technische prestaties.

SOC 2 Type II

  • Type II beslaat een periode van 6 tot 12 maanden (geen momentopname)
  • Vraag het volledige rapport op onder NDA — een samenvatting volstaat niet
  • Controleer de gedekte Trust Services Criteria: minimaal Security + Availability
  • Beoordeel de managementbrief op openstaande uitzonderingen of voorbehouden
  • Verifieer de geloofwaardigheid van het auditkantoor (Big 4 of erkend specialist)

ISO 27001

  • Verifieer dat het certificaat actueel en niet verlopen is
  • Controleer de scope: dekt deze de specifieke diensten die u gaat gebruiken?
  • In de cloud gehoste AI-diensten zouden Annex A.17 (bedrijfscontinuïteit) moeten bevatten
  • Maak onderscheid tussen ISO 27001-certificering en louter complianceclaims
  • Combineer waar relevant met ISO 27017 (cloudbeveiliging) en ISO 27018 (PII in de cloud)

GDPR en gegevensverwerking

  • Een ondertekende DPA (verwerkersovereenkomst) is verplicht op grond van art. 28 GDPR
  • Beoordeel de lijst met subverwerkers en de goedkeuringsrechten bij wijziging van subverwerkers
  • Bevestig de dataresidentie: alleen EU-regio, geen overdracht naar de VS zonder SCC's
  • Verifieer de verwijderings-SLA: hoe snel worden gegevens verwijderd bij beëindiging of op verzoek?
  • Bevestig dat prompts en uitvoer nooit worden gebruikt voor modeltraining

Afstemming op de EU AI Act

  • Classificeer uw AI-use-case volgens de risicocategorieën van de EU AI Act
  • Use-cases met hoog risico (HR, krediet, zorg) vereisen conformiteitsbeoordelingen
  • Vraag een leveranciersverklaring over de GPAI-modelverplichtingen (transparantie, auteursrecht)
  • Verifieer dat de leverancier technische documentatie bijhoudt conform art. 53
  • Controleer het standpunt van de leverancier over de meldplicht bij incidenten op grond van art. 62

Opties voor dataresidentie per grote leverancier

LeverancierEU-regioGegevens verlaten de EU nooitSelf-hostingoptieDPA beschikbaar
OpenAI (direct)Niet beschikbaarNee — servers in de VSNeeJa (Enterprise)
OpenAI via AzureJa (Zweden, Frankrijk, Nederland)Ja (PTU)NeeJa (Azure DPA)
Anthropic (direct)Niet beschikbaarNee — servers in de VSNeeJa (Enterprise)
Anthropic via BedrockJa (Frankfurt, Ierland)JaNeeJa (AWS DPA)
Mistral (direct)Ja (Frankrijk)Ja — EU-nativeOpen gewichtenJa (standaard)
Google Vertex AIJa (België, Nederland)Ja (regionaal eindpunt)NeeJa (GCP DPA)

Dimensie 3 in detail: Totale eigendomskosten

Standaardgewicht: 15%

TCO-modellering voor AI-leveranciers kent 5 kostencategorieën. De meeste teams budgetteren alleen categorie 1. Het volledige beeld is doorgaans 2 tot 3 keer hoger dan de oorspronkelijke schattingen. Bouw een model over 3 jaar voordat u zich vastlegt.

Category 1

API- en inferentiekosten

  • Prijs van invoertokens × geprojecteerd maandelijks volume aan invoertokens
  • Prijs van uitvoertokens × geprojecteerd maandelijks volume aan uitvoertokens
  • Volumekortingsniveaus — modelleer bij elke prijsschaal
  • Afweging tussen toegezegd gebruik en betalen-naar-gebruik bij uw geprojecteerde volume
  • Kosten voor het verhogen van de ratelimiet als u toegewijde doorvoer nodig hebt

Dit is de enige kostenpost die de meeste teams in hun budget opnemen.

Category 2

Training en aanpassing

  • Rekenkracht voor fine-tuning: kosten van een trainingsrun per epoch × aantal verwachte runs
  • Inferentie na fine-tuning: fijngestelde modellen kosten doorgaans 2 tot 4 keer de inferentie van het basismodel
  • Rekenkracht voor evaluatie: het uitvoeren van uw evaluatiesuite bij elke modelversie-update
  • Kosten voor het opnieuw indexeren van embeddings bij het wisselen of bijwerken van embeddingmodellen
  • Datavoorbereiding en -labeling voor trainingssets

Voegt doorgaans 20 tot 40% toe aan de API-kosten voor teams die fine-tuning gebruiken.

Category 3

Operationele overhead

  • Engineeringtijd voor SDK-integratie, prompt-engineering en onderhoud
  • Tooling voor monitoring en observability (LangSmith, Langfuse, Datadog LLM)
  • Replicatie over meerdere regio's voor latentie- of failoververeisten
  • Abonnementskosten van het ondersteuningsniveau voor een enterprise-SLA
  • Juridische toetsing van wijzigingen in de gebruiksvoorwaarden (2 tot 4 keer per jaar)

Vaak 30 tot 60% van de API-kosten voor volwassen productie-implementaties.

Category 4

Compliance en beveiliging

  • SOC 2-overbruggingsbrieven en beoordelingen door derden
  • Juridische toetsing van de GDPR-DPA en jaarlijkse herbeoordeling
  • Kosten voor penetratietests en beveiligingsbeoordelingen
  • Infrastructuur voor auditlogging en opslag voor bewaring
  • Toeslag voor dataresidentie (indien van toepassing)

Eenmalige en jaarlijks terugkerende kosten van in totaal 10.000 tot 50.000 $/jaar voor gereguleerde sectoren.

Category 5

Migratie- en exitkosten

  • Engineeringtijd om prompts en adapters te herschrijven bij een leverancierwissel
  • Regressietests tegen uw evaluatiesuite na de migratie
  • Kosten voor parallel draaien tijdens de migratieperiode (2 leveranciers tegelijk)
  • Het opnieuw embedden van het hele corpus bij het wisselen van embeddingleverancier
  • Uitvalrisico en omzetimpact tijdens het migratievenster

De meest onderschatte kostencategorie. Reken op 3 tot 6 maanden migratie bij een wissel midden in een project.

Beslissingskader: zelf bouwen, kopen of samenwerken

Kopen (SaaS-API)

Het best wanneer
  • Time-to-market heeft de hoogste prioriteit
  • Het team mist expertise in ML-infrastructuur
  • Het volume is minder dan 5.000 $/maand aan API-kosten
  • De use case is standaard (samenvatting, classificatie)
Belangrijkste risico's
  • Leverancier-lock-in en prijswijzigingen bij schaal
  • Gegevens verlaten uw perimeter
  • Beperkte aanpassing voor domeinspecifieke taken
Voorbeelden: OpenAI API, Anthropic API, Mistral API

Bouwen (open source zelf hosten)

Het best wanneer
  • Het volume overschrijdt 10.000 $/maand aan API-kosten
  • Datasoevereiniteit is niet onderhandelbaar
  • Behoefte aan diepgaande aanpassing en controle over fine-tuning
  • Het team beschikt over ML-infrastructuur en DevOps-capaciteit
Belangrijkste risico's
  • Hoge operationele overhead en verantwoordelijkheid voor betrouwbaarheid
  • GPU-investeringen (capex) of huurkosten
  • Last van model-updates en beveiligingspatches komt op uw team te liggen
Voorbeelden: Llama 4, Mistral (open gewichten), Falcon, Gemma

Samenwerken (cloud-AI-platform)

Het best wanneer
  • Al sterk geïnvesteerd in AWS, Azure of GCP
  • Behoefte aan enterprise-compliance met bestaande cloudovereenkomsten
  • Modelvariatie gewenst zonder meerdere leveranciersrelaties te beheren
  • Behoefte aan beheerde tooling voor fine-tuning en evaluatie
Belangrijkste risico's
  • Cloudplatform-lock-in bovenop model-lock-in
  • Modelbeschikbaarheid loopt achter op de API's van directe leveranciers
  • Complexe prijsstelling met meerdere dimensies (tokens + rekenkracht + opslag)
Voorbeelden: AWS Bedrock, Azure OpenAI Service, GCP Vertex AI

Het sjabloon voor de scoringsmatrix

Een uitgewerkt voorbeeld dat vier leveranciers vergelijkt voor een LLM-implementatie bij een Europese grote onderneming. Scoor elke leverancier 1 tot 10 per dimensie, vermenigvuldig met het dimensiegewicht en tel op voor het gewogen totaal.

Formule: Weighted Total = Σ(Dimension Weight% × Score) / 10Score 1–3: voldoet niet aan de eisen | 4–6: voldoet gedeeltelijk | 7–9: voldoet of overtreft | 10: uitzonderlijk
DimensieGewichtLeverancier AAmerikaanse hyperscalerLeverancier BCloudplatformLeverancier CEU-nativeLeverancier DOpen-sourcehoster
Technische prestaties25%9/10(22.5)8/10(20.0)7/10(17.5)6/10(15.0)
Beveiliging en compliance20%5/10(10.0)8/10(16.0)10/10(20.0)7/10(14.0)
Totale eigendomskosten15%6/10(9.0)7/10(10.5)8/10(12.0)9/10(13.5)
Ondersteuning en SLA's10%8/10(8.0)9/10(9.0)6/10(6.0)5/10(5.0)
Integratie en ecosysteem10%9/10(9.0)7/10(7.0)6/10(6.0)5/10(5.0)
Roadmap en stabiliteit van de leverancier10%8/10(8.0)7/10(7.0)9/10(9.0)6/10(6.0)
Compliance en regelgevingsgeschiktheid5%4/10(2.0)7/10(3.5)10/10(5.0)8/10(4.0)
Exitstrategie en portabiliteit5%4/10(2.0)6/10(3.0)9/10(4.5)8/10(4.0)
Gewogen totaal100%70.576.080.0Winnaar66.5

De resultaten lezen

Leverancier C (EU-native) wint ondanks lagere scores op technische prestaties en integratie. De zware weging van beveiliging en compliance (20%) en regelgevingsgeschiktheid (5%) weerspiegelt de enterprisecontext. Een start-up zonder compliance-eisen zou een andere winnaar zien.

Beslissingsregel bij gelijke stand: Als twee leveranciers minder dan 5 punten van elkaar verwijderd zijn, voer dan een parallelle pilot van 2 weken uit op verkeer op productieschaal. De matrix versmalt het veld — echte data over uw belasting hakt de knoop door.

Gewichtsaanpassing: Laat vóór het scoren uw belangrijkste stakeholders (CTO, CISO, CFO, DPO) de gewichten onafhankelijk toekennen en neem vervolgens het gemiddelde of onderhandel. Verschillende gewichten leveren verschillende winnaars op — het gesprek over de weging is even belangrijk als het scoren.

RFP-sjabloon: 25 vragen om elke leverancier te sturen

Stuur deze vragen vóór een pilot naar elke leverancier die u overweegt. Leveranciers die weigeren te antwoorden of vaag antwoorden, signaleren problemen. Eis schriftelijke antwoorden — mondelinge antwoorden van een sales engineer zijn contractueel niet bindend.

Technische prestaties

  1. 1Wat zijn uw gepubliceerde latentiedoelen voor P50, P95 en P99 voor onze verwachte aanvraaggrootte?
  2. 2Welke doorvoer (tokens/seconde) kunt u garanderen op een toegewijd niveau versus gedeelde capaciteit?
  3. 3Hoe gaat u om met latentieverslechtering bij piekvraag? Werpt u belasting af of plaatst u aanvragen in een wachtrij?
  4. 4Wat is uw methodiek voor het nauwkeurigheidsbenchmark van het model en hoe valideert u die op domeinspecifieke data?
  5. 5Wat is uw proces voor het communiceren van model-updates die het uitvoergedrag kunnen veranderen?

Beveiliging en compliance

  1. 6Kunt u uw huidige SOC 2 Type II-rapport verstrekken onder NDA?
  2. 7Beschikt u over een ISO 27001-certificaat? Zo ja, welke scope dekt het?
  3. 8Wat zijn uw beleidsregels voor bewaring en verwijdering van API-aanroeplogs, promptdata en modeluitvoer?
  4. 9Biedt u een verwerkersovereenkomst (DPA) die voldoet aan artikel 28 GDPR?
  5. 10Kunt u schriftelijk bevestigen dat onze prompts en uitvoer nooit zonder uitdrukkelijke opt-in voor modeltraining worden gebruikt?
  6. 11Welke opties voor EU-dataresidentie biedt u en in welke regio's?

Prijsstelling en commerciële voorwaarden

  1. 12Wat is uw volledige prijsstructuur inclusief invoertokens, uitvoertokens, fine-tuning en opslag?
  2. 13Zijn er volumekortingen beschikbaar? Vanaf welk niveau en hoe is het contract voor toegezegd gebruik gestructureerd?
  3. 14Wat gebeurt er met de prijsstelling als we ons toegezegde volume in een bepaalde maand overschrijden?
  4. 15Zijn er egress-, dataoverdracht- of API-gatewaykosten die niet in de prijs per token zijn inbegrepen?
  5. 16Wat zijn de voorwaarden voor enterprise-ondersteuningsniveaus en wat omvat elk daarvan?

Operationeel en integratie

  1. 17Wat is uw SLA voor API-beschikbaarheid? Hoe berekent en crediteert u uitvaltijd?
  2. 18Hoe gaat u om met verhogingen van de ratelimiet bij pieken in productieverkeer?
  3. 19Welke observability en logging stelt u beschikbaar aan klanten (tokengebruik, foutpercentages, latentie)?
  4. 20Biedt u een staging-/sandboxomgeving voor tests die het productiegedrag weerspiegelt?
  5. 21Welke SDK's ondersteunt u officieel en wat is uw uitfaseringsproces voor SDK-versies?

Strategisch en exit

  1. 22Wat is uw roadmap voor de komende 12 tot 18 maanden? Welke modelmogelijkheden zijn gepland?
  2. 23Wat is de minimale opzegtermijn voordat een modelversie die wij in productie gebruiken, wordt uitgefaseerd?
  3. 24Hoe kunnen we de gewichten van ons fijngestelde model of de adapterlagen exporteren als we besluiten te vertrekken?
  4. 25Wat is het contractuele proces om de overeenkomst voortijdig te beëindigen en welke garanties voor dataverwijdering gelden?
  5. 26Kunt u referenties verstrekken van klanten in onze sector of met vergelijkbare compliance-eisen?

Hoe u deze vragen gebruikt

Verstuur als een formele schriftelijke RFP, niet als vragen tijdens een salesgesprek
Stel een reactietermijn van 5 werkdagen in
Beoordeel elk antwoord 1 tot 3 (ontoereikend, gedeeltelijk, volledig)
Leveranciers met meer dan 3 ontoereikende antwoorden in de secties Beveiliging/Compliance moeten worden uitgesloten
Vraag bewijsdocumenten op (SOC 2-rapport, DPA-sjabloon) naast de antwoorden
Stel vervolgvragen bij elk antwoord dat vaag is of wordt uitgesteld naar een contractonderhandeling

Waarschuwingssignalen: 12 tekenen dat een leverancier u zal teleurstellen

Dit zijn waarneembare signalen die sterk correleren met productiestoringen, complianceproblemen of verslechtering van de relatie. Kritieke signalen zijn harde stops — ga niet verder. Hoge signalen vereisen diepgaand onderzoek. Gemiddelde signalen zijn waarschuwingen om contractueel te beheren.

Nr.WaarschuwingssignaalErnstWat het signaleert
1Geen openbare statuspagina of historische beschikbaarheidsgegevensKritiekDe leverancier heeft iets te verbergen over betrouwbaarheid. Elke serieuze productieleverancier publiceert een incidenthistorie.
2Opt-out van training vereist een juridische toetsing, geen schakelaar in de UIKritiekUw eigen prompts en bedrijfsgegevens worden waarschijnlijk gebruikt voor modeltraining. Niet onderhandelbaar voor een onderneming.
3Geen SOC 2 Type II-rapport beschikbaar (alleen Type I)KritiekType I is een momentopname zonder bewijs van blijvende beheersmaatregelen. Type II beslaat een operationele periode van 6 tot 12 maanden.
4GDPR-/DPA-documentatie vereist een sales-escalatieKritiekEen DPA zou self-service of standaard moeten zijn. Escalatie-eisen wijzen op juridische onvolwassenheid of bewuste wrijving.
5Prijsstelling vereist een salesgesprek voor informatie over het basisniveauHoogVerborgen prijzen betekenen meestal dat ze variëren op basis van het waargenomen budget, wat uw kostenprognose onvoorspelbaar maakt.
6Opzegtermijn voor modeluitfasering korter dan 6 maandenHoogProductiesystemen kunnen niet veilig in minder dan 6 maanden migreren. Korte uitfaseringsvensters maken engineeringplannen onmogelijk.
7Geen self-hosting- of VPC-implementatieoptie voor het enterprise-niveauHoogVoor gereguleerde sectoren of zeer gevoelige data is gedeelde tenancy vaak onaanvaardbaar. Geen self-hosting = geen deal.
8De SDK is een dunne REST-wrapper zonder retry-/backofflogicaHoogEen indicator van engineeringvolwassenheid. Productiewaardige SDK's verzorgen retries, streaming, backoff bij ratelimieten en foutclassificatie.
9Ratelimieten niet gedocumenteerd of gewijzigd zonder voorafgaande kennisgevingGemiddeldOngedocumenteerde of volatiele ratelimieten maken capaciteitsplanning onmogelijk en veroorzaken onverwachte productiestoringen.
10Geen schriftelijke toezegging over dataresidentieGemiddeldMondelinge toezeggingen zijn niet afdwingbaar. Eisen voor dataresidentie moeten in de DPA of het MSA staan, niet in een salespresentatie.
11Bedrijf minder dan 18 maanden geleden opgericht zonder referentieerbare enterprise-klantenGemiddeldLeveranciers in een vroege fase kunnen pivoteren, zonder financiering komen te zitten of worden overgenomen. Voor een AI-productie-infrastructuur telt levensduur.
12Geen exitclausule of garantie voor dataverwijdering in het standaardcontractGemiddeldWat gebeurt er met uw data en fijngestelde modellen wanneer u vertrekt? Als het contract zwijgt, ga dan uit van het ergste.
4
Kritiek

Harde stop. Sluit de leverancier onmiddellijk uit, tenzij u contractueel herstel kunt verkrijgen.

4
Hoog

Vereisen een gedetailleerd onderzoek en een schriftelijk mitigatieplan voordat u verdergaat.

4
Gemiddeld

Waarschuwingssignaal. Beheer via contractuele bescherming of een gedocumenteerde risicoacceptatie.

Selectieproces: van 20 leveranciers naar 3 finalisten in 2 weken

De meeste leveranciersevaluaties lopen vast omdat teams te veel opties tegelijk proberen te beoordelen. Dit proces van 2 weken gebruikt progressieve eliminatie om efficiënt tot 3 gekwalificeerde finalisten te komen, en bespaart de PoC-inspanning voor de leveranciers die het echt verdienen.

Week 1
1

Verkenning

Werp een breed net uit: 15 tot 20 leveranciers

Resultaat: Longlist met een kwalificatie van één regel
Hulpmiddel: Marktonderzoek, G2, analistenrapporten
Week 1
2

MoSCoW-filter

Pas harde must-have-criteria toe

Resultaat: Elimineer automatisch ~60% van de leveranciers
Hulpmiddel: Compliancechecklist, prijsondergrens
Week 2
3

Bureauonderzoek

Diepgaande analyse van de resterende 6 tot 8 leveranciers

Resultaat: Beveiligingshouding, prijsstelling, volwassenheid van het ecosysteem
Hulpmiddel: Openbare documentatie, SOC 2-aanvragen, RFP-verzending
Week 2
4

Demo en technisch gesprek

Gesprek van 30 min met elke leverancier, stel de 25 RFP-vragen

Resultaat: Scoor de antwoorden, elimineer leveranciers met kritieke waarschuwingssignalen
Hulpmiddel: Gestructureerd interviewsjabloon
Week 2
5

Scoren en shortlist

Pas de gewogen scoringsmatrix toe op de top 3 tot 4 leveranciers

Resultaat: Gerangschikte shortlist van 3 finalisten voor de PoC
Hulpmiddel: Scoringsmatrix (zie sectie 6)

Criteria van het MoSCoW-filter

Pas deze toe als binaire slagen/zakken-poorten. Elke leverancier die een Must Have niet haalt, wordt onmiddellijk uitgesloten — zonder uitzonderingen.

Must Have (elk falen = uitsluiten)

  • SOC 2 Type II-rapport beschikbaar
  • GDPR-conforme DPA beschikbaar
  • EU-dataresidentie (indien vereist door uw DPO)
  • Gepubliceerde prijzen (geen sales-gated basisniveaus)
  • Beschikbaarheids-SLA ≥ 99,9% in het contract
  • Opt-out van training als standaard accountinstelling

Should Have (hoger scoren, niet uitsluiten)

  • ISO 27001-certificaat
  • Toegewijd enterprise-ondersteuningsniveau
  • Self-hosting- of VPC-implementatieoptie
  • Ondersteuning voor fine-tuning en aanpassing
  • Beschikbaarheid over meerdere regio's
  • Modelportabiliteit en -export

Casestudy: hoe een Europese bank haar LLM-leverancier koos

Proces van 3 maanden • 12 leveranciers beoordeeld • Beslissingsmotivering gedocumenteerd

Een pan-Europese retailbank met activiteiten in 7 landen had een LLM-leverancier nodig voor interne documentzoekopdrachten en contractanalyse. Met 52.000 documenten, PII-rijke inhoud en regelgevingseisen over meerdere jurisdicties stond er veel op het spel. Zo voerde de bank de evaluatie uit.

12
Beoordeelde leveranciers
3
Maanden van begin tot eind
3
PoC-finalisten
1
Geselecteerde leverancier
1
Maand 1

Verkenning en eisen

  • Use case gedefinieerd: interne documentzoekopdrachten en contractanalyse (52.000 documenten)
  • Harde eisen vastgesteld: EU-dataresidentie, GDPR-DPA, SOC 2 Type II, P95-latentie < 800 ms
  • 12 kandidaat-leveranciers geïdentificeerd uit marktonderzoek en bestaande cloudrelaties
  • MoSCoW-filter toegepast — 5 leveranciers onmiddellijk geëlimineerd (geen EU-residentie of geen DPA)
2
Maand 2

PoC en technische evaluatie

  • Parallelle PoC van 4 weken uitgevoerd met 3 finalisten op een representatieve subset van 500 documenten
  • Gemeten: extractienauwkeurigheid bij IBAN-/juridische clausules, P95-latentie bij 50 aanvragen/s, hallucinatiegraad
  • Beveiligingstoetsing: SOC 2 Type II-rapporten, DPA-voorwaarden en lijsten met subverwerkers beoordeeld
  • TCO-modellering: geprojecteerde kosten over 3 jaar inclusief API, fine-tuning en ondersteuningsniveaus
3
Maand 3

Onderhandeling en selectie

  • 2 leveranciers op de shortlist geplaatst, minder dan 8 gewogen scoringspunten van elkaar verwijderd
  • Stresstest van 2 weken op productievolume (piek 200 aanvragen/s) uitgevoerd bij beide finalisten
  • Contractuele exitclausule onderhandeld: opzegtermijn van 90 dagen, volledige dataverwijdering, export van modelgewichten
  • Definitieve beslissing: de EU-native leverancier won op de weging van dataresidentie (30% van de score) en de exitvoorwaarden

Motivering van de definitieve beslissing

De geselecteerde leverancier was een aanbieder met hoofdkantoor in Europa en native EU-dataresidentie. Hoewel hij op de pure modelprestatie-benchmarks derde stond, kwam hij op de eerste plaats zodra de aan beveiliging en compliance toegekende weging van 30% werd toegepast. De twee technisch superieure leveranciers hadden beide hun hoofdkantoor in de VS en boden ten tijde van de evaluatie geen tot de EU beperkte dataresidentiegarantie.

De onderhandelde contractuele exitclausule gaf de bank het recht om alle fijngestelde adapters te exporteren en met een opzegtermijn van 90 dagen van leverancier te wisselen. Deze ene clausule verlaagde de risicotoeslag voor migratie in het risicomodel met 400.000 € — de kosten van een verondersteld toekomstig migratie-engineering.

Resultaat na 12 maanden: De bank verwerkte in het eerste jaar 890.000 documentquery's tegen een TCO 30% onder de oorspronkelijke schattingen. De leverancier breidde zijn EU-dekking uit, wat de relatie verder versterkte. Het gestructureerde evaluatieproces werd aangenomen als standaard voor alle toekomstige selecties van AI-leveranciers.

Na de selectie: leveranciersbeheer en SLA-monitoring

Een leverancier selecteren is het begin, niet het einde. Leveranciersrelaties verslechteren zonder actief beheer. De teams met de beste resultaten behandelen leveranciersbeheer als een doorlopende discipline met een regelmatige cadans, gedocumenteerde SLA-opvolging en duidelijke escalatiepaden.

SLA-monitoringdashboard: kernmetrieken

MetriekSLA-doelMetingEscalatietrigger
API-beschikbaarheid≥ 99,9% per maandSynthetische monitoring elke 60 s vanuit de EU-regioP1-incident als de uitvaltijd > 15 minuten bedraagt
P95-latentie< 800 ms voor standaardaanvragen95e percentiel van de responstijden over een voortschrijdend venster van 24 uurAlarm als P95 langer dan 5 minuten 1.200 ms overschrijdt
Foutpercentage< 0,5% 5xx-fouten per uurFoutpercentage over alle API-eindpunten, exclusief clientfoutenEscaleer naar de leverancier als > 1% gedurende twee opeenvolgende uren
Marge op de ratelimiet≥ 30% vrije capaciteit ten opzichte van de contractuele limietenDagelijks piekgebruik ten opzichte van het contractuele plafond van de ratelimietVraag een limietverhoging aan wanneer de marge gedurende 5 opeenvolgende dagen < 20% is
Kosten per 1.000 API-aanroepenBinnen 10% van de gemodelleerde basisVoortschrijdend gemiddelde over 7 dagen ten opzichte van het oorspronkelijke TCO-modelBeoordeel en heronderhandel bij aanhoudend > 20% boven de basis
Driemaandelijkse business reviewOm de 90 dagen gehoudenUpdate van de leveranciersroadmap, incidentbeoordeling, prijsbeoordeling, SLA-compliancerapportActiveer een formele prestatiebeoordeling als een kritieke SLA niet wordt gehaald

Cadans van het leveranciersbeheer

DagelijksGeautomatiseerde SLA-monitoringalarmen — beschikbaarheid, latentie, foutpercentage
WekelijksInterne beoordeling van de trend in kosten per aanvraag en de marge op de ratelimiet
MaandelijksBeoordeling van de statuspagina van de leverancier, post-mortem voor elk P1-event
DriemaandelijksQBR met de leverancier: roadmap-update, prijsbeoordeling, SLA-compliancerapport
JaarlijksVolledige herbeoordeling: scoringsmatrix opnieuw uitvoeren, marktalternatieven beoordelen, contract heronderhandelen

Checklist voor contractverlenging

Begin 3 maanden vóór de contractverlenging. Dit is uw hefboomvenster.

  • Voer de gewogen scoringsmatrix opnieuw uit met marktdata van het lopende jaar
  • Vraag een bijgewerkt SOC 2 Type II-rapport op
  • Benchmark 2 tot 3 alternatieve leveranciers om een onderhandelingspositie op te bouwen
  • Beoordeel de uitfaseringsmeldingen van de leverancier — lopen modellen waarvan u afhankelijk bent risico?
  • Bereken de volledige TCO over de afgelopen 12 maanden ten opzichte van het oorspronkelijke model
  • Beoordeel de DPA op eventuele wijzigingen in de voorwaarden in de afgelopen 12 maanden
  • Onderhandel: volumetoezeggingen voor betere prijzen, een beter SLA, langere opzegtermijnen
  • Werk de exitclausule bij: zorg dat de SLA voor dataverwijdering en de rechten op modelportabiliteit actueel zijn

Strategie voor multi-leverancierabstractie

De veruit meest effectieve manier om leverancier-lock-in te verminderen, is uw LLM-aanroepen vanaf dag één te abstraheren achter een routinglaag. Dit is 1 tot 3 dagen engineeringinvestering die maanden migratierisico elimineert.

Open-sourceroutingopties

  • LiteLLM — uniforme API voor meer dan 100 leveranciers
  • Portkey — gateway met observability en fallbacks
  • OpenRouter — marktplaatsrouting met kostenoptimalisatie
  • Eigen abstractielaag met leveranciersinterface

Wat abstractie u oplevert

  • Wissel van hoofdleverancier zonder de applicatiecode te herschrijven
  • Voer automatisch een fallback-leverancier uit bij een ratelimiet of uitval
  • A/B-test twee leveranciers op live verkeer
  • Route dynamisch op kosten versus kwaliteit op het moment van de aanvraag

Hulp nodig bij het uitvoeren van uw AI-leveranciersevaluatie?

Ik help CTO's en engineeringleiders bij het uitvoeren van gestructureerde leveranciersevaluaties — van de definitie van de eisen via het PoC-ontwerp, het scoren tot de contractonderhandeling. U krijgt een objectief kader en iemand die dezelfde fouten al 50 keer heeft gezien.

Bekijk AI-strategiediensten
AI Vendor Evaluation Matrix: Score & Compare AI Solutions Objectively