Hoe NoteIA een pdf van 200 pagina's leest
Onze aanpak van opknippen en citeren op paginaniveau.
Een pdf van 200 pagina’s is geen tekst. Het is een hybride object: inhoudsopgave, bijlagen, tabellen, voetnoten, een lay-out die wisselt. Hem zo in een machine gooien geeft magere resultaten. Dit is hoe wij het aanpakken.
Opknippen, niet afkappen
De eerste fout zou zijn het document te snijden in blokken van vaste grootte, met de maaibalk. Dan krijg je fragmenten die een zin doormidden snijden en de context verliezen.
Onze aanpak: opknippen volgens de structuur van het document — titels, secties, paragrafen — met behoud van de oorspronkelijke paginanummering. Elk fragment weet waar hij vandaan komt.
De pagina als anker behouden
Citeren op paginaniveau is geen detail. Het is precies wat een verifieerbare synthese scheidt van een hallucinatie.
Wanneer NoteIA een samenvatting schrijft, wordt elke bewering gekoppeld aan een fragment, en elk fragment aan een pagina. Je kunt terugkeren naar de bron, in het oorspronkelijke document, zonder te moeten raden.
Helemaal lezen, op het juiste moment citeren
We lezen het document helemaal — niet alleen het begin, niet alleen de executieve samenvatting. Maar we spuwen niet alles uit in het antwoord: we citeren wat relevant is, op het moment dat het relevant is.
Dat is het verschil tussen een instrument dat het doc « heeft gelezen » en een instrument dat er iets mee heeft gedaan.
Wat we leren van elk document
Elke pdf is een lesgever. Tabellen, voetnoten, bijlagen stellen elk een andere probleem. We passen het opknippen document na document bij, zonder ooit het citeren op te offeren.