Definition
Verfahren zur Erkennung und Entfernung oder Konsolidierung mehrfach vorhandener Datensätze innerhalb einer Sammlung, die dasselbe bibliografische Werk oder digitales Objekt repräsentieren, wobei Provenienz und beabsichtigte Unterschiede (Ausgaben, Erscheinungsformen) erhalten bleiben und redundante Darstellungen reduziert werden.
Prinzip
Prinzip
Die Erkennung kombiniert stabile Kennungen, normalisierte Metadaten und Ähnlichkeitsmessungen; Konsolidierung erfordert die Auswahl oder Konstruktion eines kanonischen Datensatzes und das Aufzeichnen der Provenienz, sodass Informationsverlust kontrollierbar und gegebenenfalls reversibel bleibt.
Demonstration
Demonstration
Illustratives Szenario → Ein Katalog enthält zwei Datensätze zur selben Ausgabe mit leichten Metadatenabweichungen. Erkennung → ISBN und hohe Ähnlichkeit von Titel/Autor identifizieren ein Duplikat. Aktion → Bestandsnachweise und lokale Notizen werden in einen kanonischen Datensatz zusammengeführt; die Originaldatensätze bleiben in einer Audit‑Spur erhalten. Folge → Suchergebnisse und Ausleihlogik arbeiten mit einem autoritativen Datensatz, während die Provenienz Rekonstruktion ermöglicht.
Fehlanwendung
Fehlanwendung
Datensätze zu verschmelzen, die unterschiedliche Erscheinungsformen (verschiedene Ausgaben, Übersetzungen oder Formate) darstellen, nur weil sie Titel oder Autor teilen. Der Fehler ist die Verwechslung von Redundanz mit legitimen Varianten und der Verlust bibliografischer Genauigkeit.
Konsequenz
Konsequenz
Angemessene Duplikaterkennung verringert Nutzerverwirrung, Speicherbedarf und Indexierungsrauschen; übermäßige Duplikatbereinigung beseitigt sinnvolle Unterscheidungen, zerstört Zitierketten und kann Metadaten entfernen, die für Erhaltung oder Rechteverwaltung nötig sind.
Umkehrung
Umkehrung
In Bewahrungs-, wissenschaftlichen oder rechtlichen Kontexten können Duplikate (oder Varianten) bewusst aufbewahrt werden; wenn Varianten materiell unterschiedliche Metadaten oder Rechte enthalten, ist Konsolidierung unangebracht und Duplikatbereinigung muss eingeschränkt oder vermieden werden.
Abgrenzung
Abgrenzung
Eindeutig innerhalb: Entfernen exakt oder nahezu identischer Datensätze derselben Ausgabe in einem einzelnen institutionellen Katalog. Grenzfall: Datensätze desselben Werks, aber unterschiedlicher Ausgaben oder Übersetzungen, bei denen die Richtlinie die Konsolidierung bestimmt. Eindeutig außerhalb: bereichsübergreifende Entitätsrekonsiliation (ein verwandter, aber auf Verknüpfung statt interner Konsolidierung ausgerichteter Prozess).
Semantische Spannung
Semantische Spannung
Vollständigkeit/Treue ↔ Einfachheit/Effizienz — das Entfernen von Duplikaten vereinfacht Zugriff und Speicher, kann aber bibliografische Treue opfern.
Synthese
Synthese
Duplikaterkennung ist ein redaktioneller Prozess, der explizite Regeln und Provenenzerfassung erfordert: technische Erkennung muss mit Richtlinien gekoppelt werden, die bestimmen, wann Konsolidierung wesentliche Unterschiede erhält oder vernichtet.