Van Tasword naar Joomla: een digital preservation avontuur
Nu ik al weer een tijdje bezig ben met een aanbeveling uit mijn eigen doctoraalscriptie (boek)geschiedenis van bijna veertig jaar geledenZie: https://cannedit.org/projects/books-of-tongerlo-abbey en: https://tongerlo.cannedit.org/catalog., vond ik het tijd om die ongepubliceerde scriptie hier online ter beschikking te stellen. Maar wat een avontuur was dat. Ik dacht dat het ongeveer een middagje werk zou zijn: de papieren versie scannen, OCR-en, er een nette PDF van maken en die dan publiceren. Maar dat bleek al snel een veel te optimistische inschatting.
De scriptie was destijds afgedrukt op een Star NL-10 matrix printer en daarna enkele malen vermenigvuldigd via een Xerox kopieer machine. Maar hoewel de afdrukken na bijna veertig jaar nog verrassend goed leesbaar zijn, bleken ze voor OCR-software verre van ideaal. De karakteristieke matrix letters in de Xerox kopieën zorgden voor zoveel herkenningsfouten dat het corrigeren daarvan haast evenveel werk zou zijn als het opnieuw overtypen van de tekst. Ik moest dus iets anders verzinnen.
![]() |
![]() |
Gelukkig had ik destijds niet alleen de papieren versie bewaard, maar ook de originele diskettes met alle tekst en database bestanden. De ideale oplossing leek die bestanden op een of andere manier opnieuw te gebruiken. Maar al snel kwam ik er achter dat ook dat niet zo eenvoudig was. Ik had de scriptie geschreven op een MSX2 home computer in het tekstverwerkingsprogramma Tasword2Zie: https://en.wikipedia.org/wiki/Tasword. en daarbij had ik de bestanden opgeslagen in het oorspronkelijke "native" bestandsformaat van Tasword2. Maar daar kunnen moderne computers zoals mijn MSI laptop met Linux Mint uiteraard niets mee. Het was daarom noodzakelijk om de tekst bestanden opnieuw te openen in Tasword2 en ze om te zetten naar het eenvoudige TXT-formaat dat Tasword2 ondersteunde.
Ook dat was gemakkelijker bedacht dan uitgevoerd. Mijn oude MSX2 computer, een Philips VG8235, stond weliswaar nog steeds op zolder, maar na al die jaren bleek de ingebouwde 3,5 inch diskdrive niet meer te werken. In eerste instantie dacht ik dit op te lossen door de half vergane rubberen aandrijfsnaar van de diskdrive te vervangen en daarna leek de diskdrive inderdaad weer tot leven te komen, maar na wat tests kwam ik er achter dat hij diskettes toch niet meer heel betrouwbaar kon lezen of schrijven en ik besloot mijn bron bestanden daar niet aan bloot te stellen. Op dat moment leek dit projectje opnieuw vast te lopen, maar enige tijd later diende zich onverwachts toch weer een oplossing aan: ik kon voor weinig een oude externe MSX Hitachi 3,5 inch diskdrive op de kop tikken, die via een cartridge op de Philips VG8235 kon worden aangesloten. Daarmee kon ik mijn originele Tasword2 bestanden alsnog openen, deze naar TXT exporteren en naar 'nieuwe' diskettes wegschrijven.
Met de via Tasword2 naar TXT geëxporteerde tekst bestanden was het werk nog lang niet klaar. Tasword2 gebruikte in teksten allerlei 'eigen' opmaakcodes voor bijvoorbeeld tabs, marges, cursieve en onderstreepte tekst en voetnoten. Zo ook voor internationale karakters (zoals: é, ü, ç of ñ), want mijn oude tekst bestanden stonden nu weliswaar in TXT formaat, maar niet in UTF-8Zie: https://en.wikipedia.org/wiki/UTF-8. TXT formaat. Bovendien had ik ook nog met dBASE IIZie: https://en.wikipedia.org/wiki/DBase. bestanden te maken waarop ik de tabellen in de scriptie had gebaseerd.
Ik had dus nog wat conversie slagen te gaan, maar eerst besloot ik om niet meer zo afhankelijk te zijn van de stokoude MSX hardware en de 'nieuwe' diskettes om te zetten naar disk images, om die te kunnen gebruiken in de emulatie software openMSXZie: https://openmsx.org. op mijn moderne hardware. Daarvoor moest ik nog wel een andere 'antieke' computer van mijn zolder halen, en wel mijn eerste personal computer: een Amstrad PC2386/65 machine, een van de eerste pc's met een 3,5 inch (i.p.v. 5,25 inch) diskdrive... en 80386sx processor, 4 Mb intern geheugen en een 65 Mb harde schijf (!), waarop nog MS-DOS 6.0 draaide. Met vier verse AA-batterijen (!) startte deze 'geweldenaar' uit een lang vervlogen tijd meteen op met zijn karakteristieke geluid, herkende de MSX-DOS diskettes onmiddellijk en zette ze met DCOPY commando's in een mum van tijd om naar disk images (in .dsk formaat). Zo kon ik - na installatie van openMSX - altijd nog al mijn oude originele tekst en database bestanden op mijn huidige MSI Linux Mint laptop raadplegen en bovendien kon ik nu - door tussenkomst van mijn oude Amstrad - ook de 'verse' originele Tasword2 TXT bestanden op mijn laptop gebruiken. Nog even afgezien van het uiteindelijke resultaat, was het op zich al bijzonder om te zien hoe computers uit drie verschillende generaties samenwerkten in hetzelfde projectje: een MSX2 home computer uit de jaren tachtig, een MS-DOS personal computer uit de vroege jaren negentig en een nog geen twee jaar oude MSI Linux Mint laptop.
Met behulp van Python scripts converteerde ik de 'verse' Tasword2 TXT bestanden naar UTF-8 en zette ik alle oorspronkelijke Tasword2 opmaakcodes om naar HTML. Voor de uiteindelijke publicatie van de scriptie op deze Joomla websiteZie: https://cannedit.org/projects/books-of-tongerlo-abbey/boeken-van-tilburgse-pastoors. werden de voetnoten bovendien automatisch omgezet naar de syntax van de Joomla plugin FootnotesZie: https://extensions.joomla.org/extension/footnotes., die ik hier al een tijdje naar volle tevredenheid gebruik, waardoor ook de honderden voetnoten van de scriptie netjes werden geconverteerd. De enige concessie die ik daarbij moest doen was dat het doornummeren van voetnoten over alle hoofdstukken achterwege moest blijven. In de Joomla-Footnotes combinatie werkt doornummeren namelijk niet als je hoofdstukken als aparte pagina's opneemt en dat leek me voor de leesbaarheid en toegankelijkheid van de digitale versie van de scriptie een beter concept dan één heel lang verhaal. De Footnotes plugin kwam overigens ook uitermate goed van pas bij het converteren van de vele bijlagen van de scriptie.
Voor conversie van de dBASE II bestanden bleek de openMSX emulator (versie 21) onmisbaar. Die stelde mij in staat om de oorspronkelijke DBF bestanden te openen vanaf de disk images en die naar CSV te exporteren. De in de emulator ingebouwde Disk Manipulator zorgde er vervolgens voor dat ik die virtuele CSV bestanden op de harde schijf van mijn laptop kon opslaan, zodat ik ze verder kon bewerken in LibreOffice Calc.
Het proeflezen van het uiteindelijke resultaat voelde bijna als de dag van gisteren, alsof de tijd even had stilgestaan, alleen zat ik deze keer niet achter een stapel geprinte pagina's maar achter een monitor met een webbrowser.
Deze exercitie laat zien dat digital preservation veel meer is dan het bewaren van bestanden alleen. Om een digitaal document werkelijk toegankelijk te houden, moet ook kennis worden bewaard over de software, de hardware, de bestandsformaten en zelfs de manier waarop gegevens ooit werden verwerkt. Zonder een werkende MSX2, kennis van Tasword2, inzicht in dBASE II en moderne hulpmiddelen, zoals openMSX en Python, zouden mijn oorspronkelijke scriptie bestanden voor de meeste computers van nu onleesbaar zijn gebleven. De combinatie van oude (historische) hardware en moderne technieken maakte het mogelijk om de oorspronkelijke tekst vrijwel authentiek opnieuw te publiceren. Dat is het uiteindelijke doel van digital preservation: niet alleen het bewaren van oude bestanden, maar ook het opnieuw toegankelijk maken daarvan en daardoor kennis bewaren die anders langzaam zou verdwijnen.




