Welk fragment van een pagina citeert een AI?
Gepubliceerd op
Een uitgewerkte paragraaf die de woorden overneemt waarmee de AI heeft gezocht. Bij Claude, waarvan de API exact het geciteerde fragment aangeeft, wordt een paragraaf van 50 tot 100 woorden 3,7 tot 4,8 keer vaker geciteerd dan een paragraaf van 10 tot 25 woorden, en een paragraaf die minstens een derde van de woorden uit de zoekopdracht van het model overneemt 5 tot 8 keer vaker. Het fragment kan zich overal op de pagina bevinden, behalve helemaal onderaan. De pagina wordt gekozen op basis van de vraag van de gebruiker; het fragment op basis van de woorden van de AI.
Voor welk type vraag? Voor de keuze van de pagina hangt alles af van de vraag. Voor de keuze van het fragment binnen de geselecteerde pagina golden de onderstaande regels bij Claude op onze corpussen, zowel in het Frans als in het Engels.
Twee vocabulaires: dat van de pagina en dat van het fragment
Een AI die op het web zoekt, maakt twee opeenvolgende keuzes. Eerst kiest ze de pagina's, en deze keuze is gebaseerd op de vraag van de gebruiker: de woorden van deze vraag in de titel en het adres van de pagina vergroten haar kansen om geselecteerd te worden. Vervolgens kiest ze binnen de pagina het fragment dat ze citeert, en deze tweede keuze is gebaseerd op haar eigen woorden, de woorden die ze in haar zoekopdrachten heeft geschreven.
Bij Claude wordt een paragraaf die minstens een derde van de woorden uit de zoekopdracht van het model overneemt 5,1 keer vaker geciteerd in de tiental sectoren in het Frans en 8,2 keer in het Engels. De woorden uit de vraag van de gebruiker spelen ook een rol, maar minder: 2,4 tot 3,4 keer. Dit zijn twee vocabulaires op twee verschillende plaatsen op de pagina; ze verwarren door de woorden van de AI in de titel te plaatsen, leidt tot verlies op beide fronten.
Een uitgewerkte en stellende paragraaf
Lengte is de sterkste variabele. Bij Claude wordt een paragraaf van 50 tot 100 woorden 4,8 keer vaker geciteerd dan een paragraaf van 10 tot 25 woorden in de tiental sectoren in het Frans, 3,7 keer in het Engels, en 5 tot 6 keer in onze eerste corpussen. Korte paragrafen, teasers en losse zinnen zijn zelden het geselecteerde fragment.
Ook de formulering telt. Een paragraaf die een stellend werkwoord bevat, zoals "is", "maakt het mogelijk" of "moet", wordt 1,7 tot 2,7 keer vaker geciteerd: de AI selecteert de fragmenten die iets poneren. Proza wint het meestal van de lijst, tot 3,2 keer in het Engels, maar niet altijd: bij het oplossen van softwareproblemen werden lange lijstitems die een stap beschrijven vaker geselecteerd dan paragrafen.
Waar het geciteerde fragment zich bevindt
In tegenstelling tot wat vaak wordt gedacht, heeft de eerste paragraaf niets speciaals. In onze eerste corpussen is de positie van het geciteerde fragment op de pagina vrijwel uniform, met slechts één dip: het allerlaatste deel van de pagina, waar zich vaak de vermeldingen, links en aanvullende inhoud bevinden. In onze volgende corpussen vertoonde de positie geen stabiel effect.
Een pagina hoeft dus niet alles in de inleiding te concentreren om geciteerd te worden. Elke uitgewerkte paragraaf kan het geselecteerde fragment worden, mits deze op zichzelf kan staan: de AI citeert een fragment, niet de hele pagina, en een paragraaf die verwijst naar "het voorgaande" verliest zijn betekenis zodra deze is geïsoleerd.
Wat Gemini en de documentatie van de uitgevers aantonen
De documentatie van Anthropic vermeldt dat elk webcitaat van Claude maximaal 150 tekens van de geciteerde tekst bevat, en dat citaten altijd zijn geactiveerd voor zoeken op het web. Hierdoor kunnen we het geselecteerde fragment nauwkeurig lokaliseren. Google documenteert van zijn kant een systeem voor het rangschikken van fragmenten dat secties van een pagina identificeert om de relevantie ervan te beoordelen.
Bij Gemini geeft de API de positie van het geciteerde fragment niet terug: deze moet worden gereconstrueerd, en elke reconstructiemethode introduceert een bias. Onze reconstructies wijzen in dezelfde richting als bij Claude, waarbij een paragraaf van 25 tot 100 woorden die de zoekwoorden bevat vaker wordt geselecteerd, maar de omvang van het effect is niet met zekerheid meetbaar. De enige meting zonder deze bias is die van Claude.
Wat Google zegt, en hoe dat te interpreteren
Google geeft in zijn gids over optimalisatie voor generatieve AI-functies, bijgewerkt op 10 juli 2026, aan dat er geen verplichting is om inhoud in kleine stukjes op te delen: zijn systemen kunnen de nuances van meerdere onderwerpen op een pagina begrijpen en de gebruiker het relevante fragment tonen. Hij voegt eraan toe dat het niet nodig is om op een specifieke manier te schrijven voor zoeken via AI, omdat deze systemen synoniemen en de algemene betekenis van wat er wordt gezocht begrijpen.
Deze beweringen en onze metingen gaan niet over dezelfde systemen: Google heeft het over zijn zoekmachine, wij meten wat Claude citeert via zijn API. Ze komen op de belangrijkste punten overeen. Het gaat er niet om voor een machine te schrijven of een pagina in stukken te hakken, maar om het schrijven van volledige paragrafen die helder formuleren en de werkelijke woordenschat van het onderwerp gebruiken; dat is ook wat de lezers verwachten.
Wat dit verandert voor een bedrijf
Om geciteerd te worden, is het niet voldoende om de juiste pagina te zijn: u moet de juiste passage bevatten. Concreet betekent dit het schrijven van paragrafen van meerdere zinnen, die helder formuleren wat waar is, en die de woorden overnemen waarmee de AI's naar uw onderwerp zoeken. Deze woorden kunt u niet raden: u krijgt ze door de vragen aan de AI's te stellen en hun zoekopdrachten te registreren.
Dit is de methode die voor deze rubriek is gevolgd: elke vraag is gesteld aan ChatGPT, Claude en Gemini, hun zoekopdrachten zijn geregistreerd om de paragrafen te schrijven, en de titels dragen de vraag, niet de woorden uit de zoekopdrachten.
Wat we niet weten
De exacte locatie van de passage is alleen beschikbaar bij Claude; bij Gemini is deze gereconstrueerd, en bij ChatGPT hebben we deze niet gemeten. Onze metingen hebben betrekking op de API van de modellen en beschrijven verbanden tussen kenmerken van de paragrafen en citaten.
Bronnen
- Anthropic — documentatie van de webzoektool van Claude, .
- Google Search Central — gids voor rankingsystemen, .
- Google Search Central — "Optimizing your website for generative AI features on Google Search", .
- Metingen FaireDuBruit, van 4 tot 16 september 2026 — zie 'Hoe we hebben gemeten'.