Naar de inhoud gaan
AI-zichtbaarheid

Citeren AI-systemen PDF-documenten?

Gepubliceerd op

Zelden, vergeleken met webpagina's. Bij ChatGPT vertegenwoordigen PDF's 16 tot 21% van de resultaten die door zijn zoekopdrachten worden opgehaald, maar ze worden op al onze corpora 2 tot 5 keer minder vaak geciteerd dan de andere pagina's. Claude haalt zeer weinig PDF's op, hooguit zo'n 3% van zijn resultaten. We hebben geen enkele gepubliceerde studie gevonden die het citeren van PDF's door AI-systemen meet: deze cijfers zijn de onze. Een belangrijk document dat alleen als PDF is gepubliceerd, heeft dus minder kans om te worden geciteerd dan een gelijkwaardige webpagina.

Voor welk type vraag? Alles hangt af van de vraag. Als de gebruiker een specifiek document, een norm, een technische fiche of een rapport zoekt, kan de AI dit in PDF-formaat opzoeken. Bij een informatieve of marktgerelateerde vraag citeert deze eerder webpagina's.

Wat we hebben gemeten bij ChatGPT

We hebben in de resultaten die door de zoekopdrachten van ChatGPT worden opgehaald, de adressen van PDF-documenten geteld, en vervolgens het aandeel van deze documenten dat daadwerkelijk is geciteerd. PDF's zijn talrijk in wat ChatGPT vindt: 21% van de resultaten in een tiental sectoren in het Frans, 20% in deze sectoren in het Engels, 19% bij het oplossen van softwareproblemen, 17% bij onze vragen over de zichtbaarheid in AI.

Toch worden ze weinig geciteerd: 5,7% van de opgehaalde PDF's tegenover 12,1% van de andere pagina's in de Franstalige sectoren, 5,2% tegenover 10,1% in het Engels, 4,9% tegenover 11,8% bij het oplossen van softwareproblemen, en 2,1% tegenover 10,8% bij onze vragen van 15 september 2026. Een PDF wordt dus 2 tot 5 keer minder vaak geciteerd dan een webpagina die door dezelfde AI is gevonden. Onze eerste corpora, over HVAC en kunstmatige intelligentie, lieten al een verschil van 3 tot 4 keer zien.

Claude haalt zeer weinig PDF's op

Bij Claude zijn PDF's bijna afwezig in de resultaten: tussen 0,5 en 3% van wat zijn zoekopdracht ophaalt, afhankelijk van het corpus. Dit is te weinig om een betrouwbaar citatiepercentage te meten. Het verschil met ChatGPT ligt dan ook in de eerste plaats in wat elke zoekmachine teruggeeft, nog vóór de keuze van de te citeren bronnen.

Bij Gemini maakt de API geen onderscheid tussen gevonden en geciteerde pagina's en geeft alleen het domein van de bronnen op, waardoor het aandeel PDF's niet kan worden gemeten. Ook hier is een eenduidige regel voor „de AI-systemen” niet mogelijk: ChatGPT vindt veel PDF's en negeert ze, Claude vindt er weinig.

Waarom een PDF minder wordt geciteerd

We nemen verschillende obstakels waar, zonder te kunnen zeggen welke het zwaarst weegt. Een PDF heeft vaak geen bruikbare title-tag, noch een voor machines leesbare alineastructuur: tijdens onze eigen metingen werden sommige PDF's gelezen als één enkel tekstblok van tienduizenden woorden, en andere konden helemaal niet worden gelezen. De passage die door een AI wordt geciteerd, is echter een uitgewerkte, herkenbare alinea die de woorden van de zoekopdracht overneemt.

Een PDF is ook vaak lang en algemeen (jaarverslag, volledige gids, catalogus), waar de AI juist zoekt naar een passage die antwoord geeft op een specifieke vraag. Deze verklaringen blijven hypothesen: wij meten het verschil in citaten, niet de oorzaak ervan.

Wat Google en gepubliceerde onderzoeken zeggen

Google indexeert PDF-documenten: het formaat staat in de lijst van bestandstypen die het kan indexeren, bijgewerkt op 3 februari 2026. En de documentatie over de AI-functies geeft aan dat een geïndexeerde pagina die in aanmerking komt voor een fragment, als bron kan dienen, zonder aanvullende vereisten. Niets sluit een PDF dus uit van de AI-antwoorden van Google.

We hebben geen enkel gepubliceerd onderzoek gevonden, noch enige documentatie van OpenAI, Anthropic of Google, die specifiek ingaat op het citeren van PDF's door AI-systemen. Dit is een van de onderwerpen waarop onze metingen, voor zover wij weten, de enige beschikbare zijn.

Wat dit verandert voor een bedrijf

Een whitepaper, een technische fiche of een onderzoek dat alleen als PDF is gepubliceerd, wordt wel gevonden, maar zelden geciteerd. Om ervoor te zorgen dat belangrijke inhoud door een AI kan worden overgenomen, is het beter om deze ook als webpagina te publiceren, opgedeeld in pagina's of secties die elk een specifieke vraag beantwoorden, met uitgewerkte alinea's, en de PDF als download aan te bieden.

De webpagina bevat de vraag in de titel en het adres, geeft vanaf de eerste regels antwoord en verwijst naar het volledige document. De PDF blijft nuttig voor de lezer die alles wil lezen; de webpagina is wat de AI kan citeren.

Wat we niet weten

Een document wordt als PDF geteld wanneer het adres eindigt op „.pdf”; een PDF die onder een ander adres wordt aangeboden, wordt niet meegeteld. Bij ChatGPT worden de geciteerde documenten geïdentificeerd in de links van het antwoord. Onze metingen hebben betrekking op de API van de modellen en maken geen onderscheid tussen de verschillende soorten PDF's.

Bronnen

  1. Google Search Central — bestandstypen die Google kan indexeren, .
  2. Google Search Central — „AI features and your website”, .
  3. Metingen FaireDuBruit, van 4 tot 16 september 2026 — zie 'Hoe we hebben gemeten'.

Vergelijkbare vragen

Alle vragen over de zichtbaarheid in AI · Ons aanbod