The first de-identification engine built for Greek clinical documents — and it never sends them anywhere.
Η πρώτη μηχανή ανωνυμοποίησης φτιαγμένη για ελληνικά κλινικά έγγραφα.
A de-identification engine built from first principles — no model, no guessing, every decision traceable to a rule.
Μια μηχανή ανωνυμοποίησης χτισμένη από θεμελιώδεις αρχές — χωρίς μοντέλο, χωρίς εικασίες, κάθε απόφαση ανάγεται σε έναν κανόνα.
A powerful duo
Ένα ισχυρό δίδυμο
Two ways of reading the same text, coming together as one.
Δύο τρόποι ανάγνωσης του ίδιου κειμένου, που γίνονται ένας.
* The de-identification engine is also available on its own, as a separate application from ClinicalMiner.
* Η μηχανή ανωνυμοποίησης διατίθεται και από μόνη της, ως ξεχωριστή εφαρμογή από το ClinicalMiner.
Tools built for English break on Greek clinical text. Names and places inflect, so a single form in a list catches only a fraction of real mentions. Capital letters drop their accents. Hospitals carry the city inside their legal name. And the notes themselves are written in a mixture of Greek and English, often in the same sentence. Morpheus was built around those facts rather than adapted to them afterwards.
Τα εργαλεία ανωνυμοποίησης που φτιάχτηκαν για την αγγλική γλώσσα αποτυγχάνουν στο ελληνικό κλινικό κείμενο. Η ελληνική γλώσσα έχει μεγάλη ποικιλομορφία. Διαφορετικές κλίσεις, καταλήξεις, τονισμοί, κ.α., καθιστούν την αναγνώριση ελληνικών κειμένων εξαιρετικά δύσκολη. Τα ιατρικά έγγραφα περιέχουν σε μεγάλο βαθμό μη δομημένο, ελεύθερο κείμενο, το οποίο πρέπει να διατηρεί την κλινική αξία του. Επίσης τα ελληνικά έγγραφα χρησιμοποιούν συχνά μείξη ελληνικών και αγγλικών όρων, συχνά στην ίδια πρόταση. Ο Morpheus χτίστηκε πάνω σε αυτά τα δεδομένα, δεν προσαρμόστηκε εκ των υστέρων.
De-identification runs entirely on your own machine — an ordinary laptop, no graphics card, no server, no internet connection required. The documents are never uploaded for processing, and no part of the engine phones home. What the engine reads, only the engine sees.
Η ανωνυμοποίηση εκτελείται εξ ολοκλήρου στο δικό σας μηχάνημα — έναν συνηθισμένο φορητό υπολογιστή, χωρίς κάρτα γραφικών, χωρίς διακομιστή, χωρίς σύνδεση στο διαδίκτυο. Τα έγγραφα δεν ανεβαίνουν πουθενά για επεξεργασία και κανένα τμήμα της μηχανής δεν επικοινωνεί προς τα έξω. Ό,τι διαβάζει η μηχανή, το βλέπει μόνο η μηχανή. Η μηχανή ανωνυμοποίησης δεν χρησιμοποιεί μεγάλα γλωσσικά μοντέλα (large language models – LLMs).
Every document is read by two engines, each on its own. Whatever either of them marks as an identifier is replaced; a shared body of clinical knowledge keeps the medical terms from going with it.
Κάθε έγγραφο διαβάζεται από δύο μηχανές, ανεξάρτητα τη μία από την άλλη. Ό,τι επισημάνει οποιαδήποτε από τις δύο ως στοιχείο ταυτοποίησης αντικαθίσταται· ένα κοινό σώμα κλινικής γνώσης φροντίζει να μη χαθούν μαζί και οι ιατρικοί όροι.
Morpheus asks of every word: does this look like a name? It combines name-recognition models, which read the surrounding context, with rules and vocabularies written for Greek clinical text. Its strength is the unfamiliar: a name it has never seen, written in a way nobody thought to list.
Ο Morpheus ρωτά για κάθε λέξη: μοιάζει με όνομα; Συνδυάζει μοντέλα αναγνώρισης ονομάτων, που διαβάζουν τα συμφραζόμενα, με κανόνες και λεξιλόγια γραμμένα για το ελληνικό κλινικό κείμενο. Η δύναμή του είναι το άγνωστο: ένα όνομα που δεν έχει ξαναδεί, γραμμένο με τρόπο που κανείς δεν είχε σκεφτεί να καταγράψει.
Protogene asks the opposite question: is this an ordinary word? Nobody can list every name in the world, but the ordinary words of a language can be listed. Protogene knows the Greek dictionary and the vocabulary of medicine; a capitalised word that belongs to neither is treated as a name, a place or an institution, and is replaced. It uses no model of any kind: every decision goes back to a word list or a written rule, and can be explained.
Ο Protogene θέτει το αντίστροφο ερώτημα: είναι αυτή μια κοινή λέξη; Κανείς δεν μπορεί να καταγράψει όλα τα ονόματα του κόσμου· τις κοινές λέξεις μιας γλώσσας, όμως, μπορεί. Ο Protogene γνωρίζει το λεξικό της ελληνικής και το λεξιλόγιο της ιατρικής· μια λέξη με κεφαλαίο αρχικό που δεν ανήκει σε κανένα από τα δύο αντιμετωπίζεται ως όνομα, τόπος ή ίδρυμα, και αντικαθίσταται. Δεν χρησιμοποιεί κανενός είδους μοντέλο: κάθε απόφαση ανάγεται σε έναν κατάλογο λέξεων ή σε έναν γραπτό κανόνα, και μπορεί να εξηγηθεί.
A clinical note announces its own identifiers: a label before a name, a title before a doctor, a role above a signature. It announces its medical content just as clearly: a unit after a number, a dose after a drug. Protogene collects these announcements instead of guessing, and it reads the whole note before deciding, so that a diagnosis or an operation named in the note keeps its own medical terms readable.
Ένα κλινικό σημείωμα δηλώνει μόνο του τα στοιχεία ταυτοποίησης που περιέχει: μια ετικέτα πριν από ένα όνομα, έναν τίτλο πριν από έναν γιατρό, μια ιδιότητα πάνω από μια υπογραφή. Εξίσου καθαρά δηλώνει και το ιατρικό του περιεχόμενο: μια μονάδα μετά από έναν αριθμό, μια δόση μετά από ένα φάρμακο. Ο Protogene συλλέγει αυτές τις δηλώσεις αντί να εικάζει, και διαβάζει ολόκληρο το σημείωμα πριν αποφασίσει, ώστε η διάγνωση ή η επέμβαση που αναφέρεται να κρατά αναγνώσιμους τους ιατρικούς της όρους.
The two engines fail in different ways. A model can pass over a name that looks unremarkable; a dictionary can pass over a name that is also an ordinary word. Run together, each covers the other's blind side. And because Protogene starts from the Greek language rather than from medicine, the same approach could be tuned to other kinds of documents.
Οι δύο μηχανές αστοχούν με διαφορετικό τρόπο. Ένα μοντέλο μπορεί να προσπεράσει ένα όνομα που δεν του φαίνεται ασυνήθιστο· ένα λεξικό μπορεί να προσπεράσει ένα όνομα που είναι ταυτόχρονα και κοινή λέξη. Όταν δουλεύουν μαζί, η καθεμία καλύπτει το τυφλό σημείο της άλλης. Και επειδή ο Protogene ξεκινά από την ελληνική γλώσσα και όχι από την ιατρική, η ίδια προσέγγιση θα μπορούσε να προσαρμοστεί και σε άλλα είδη εγγράφων.
Protogene joined the engine after the benchmark study, which evaluated Morpheus 1.0 on its own.
Ο Protogene προστέθηκε στη μηχανή μετά τη μελέτη αξιολόγησης, η οποία αφορούσε μόνο τον Morpheus 1.0.
A de-identifier that removes too much is not safe — it is broken. The clinical content is the reason the document exists.
Μια μηχανή που αφαιρεί υπερβολικές πληροφορίες δεν θα είχε κανένα απολύτως νόημα. Με τη συγκεκριμένη μηχανή, στόχος μας είναι η λεπτή ισορροπία μεταξύ ευαίσθητων προσωπικών δεδομένων που πρέπει να αποκρύπτονται, και σημαντικών ιατρικών δεδομένων που πρέπει να διατηρούνται. Η ασφάλεια των προσωπικών δεδομένων είναι η πυξίδα μας.
Identifiers are not blanked out. They are replaced with realistic stand-ins — a different name, a different street, a shifted date — so that the document still reads as a clinical document, and so that anything the engine might have missed does not stand out as the only real name on the page.
Τα στοιχεία ταυτοποίησης δεν σβήνονται. Αντικαθίστανται με ρεαλιστικά υποκατάστατα — διαφορετικό όνομα, άλλη οδός, μετατοπισμένη ημερομηνία — ώστε το έγγραφο να εξακολουθεί να διαβάζεται ως κλινικό κείμενο, και ώστε οτιδήποτε τυχόν ξέφυγε να μην ξεχωρίζει ως το μόνο αληθινό όνομα στη σελίδα.
Morpheus makes the same decisions every time it sees the same text, and checks itself against a frozen reference every time it starts. Each processed document carries the engine version and a fingerprint of the exact build that handled it.
Ο Morpheus παίρνει τις ίδιες αποφάσεις κάθε φορά που βλέπει το ίδιο κείμενο και ελέγχει τον εαυτό του με ένα παγωμένο σημείο αναφοράς σε κάθε εκκίνηση. Κάθε επεξεργασμένο έγγραφο φέρει την έκδοση της μηχανής και ένα αποτύπωμα του ακριβούς build που το χειρίστηκε.
No de-identification engine is perfect, and any that claims to be should be treated with suspicion. Morpheus is evaluated against annotated Greek clinical corpora, measuring both what it removes and what it damages. A formal benchmark study is in preparation for publication; results will be reported here once peer review is complete.
Καμία μηχανή ανωνυμοποίησης δεν είναι τέλεια, και όποια το ισχυρίζεται πρέπει να αντιμετωπίζεται με επιφύλαξη. Ο Morpheus αξιολογείται σε επισημειωμένα ελληνικά κλινικά σώματα κειμένων, μετρώντας τόσο όσα αφαιρεί όσο και όσα καταστρέφει. Μια επίσημη μελέτη αξιολόγησης ετοιμάζεται για δημοσίευση· τα αποτελέσματα θα παρουσιαστούν εδώ μόλις ολοκληρωθεί η κρίση.
Morpheus is built into ClinicalMiner. Every document passes through it before any AI feature can see it — de-identification is not an option you can switch off.
Ο Morpheus είναι ενσωματωμένος στο ClinicalMiner. Κάθε έγγραφο περνά από αυτόν πριν το δει οποιαδήποτε λειτουργία AI — η ανωνυμοποίηση δεν είναι επιλογή που απενεργοποιείται.
Both engines are frozen at every release, and every processed document records the versions that handled it.
Και οι δύο μηχανές «παγώνουν» σε κάθε έκδοση, και κάθε επεξεργασμένο έγγραφο καταγράφει τις εκδόσεις που το χειρίστηκαν.
The benchmark study evaluated Morpheus 1.0. The study and its data are listed under Publications.
Η μελέτη αξιολόγησης αφορά τον Morpheus 1.0. Η μελέτη και τα δεδομένα της παρατίθενται στις Δημοσιεύσεις.