TECHNICAL NOTE
Dincolo de Word Error Rate: un cadru pentru măsurarea fidelității clinice în documentația medicală asistată de AI
Clinical Information Fidelity (CIF), Critical Clinical Error Rate (CCER) și Clinical Correction Burden (CCB) — un framework conceptual pentru evaluarea sistemelor moderne speech-to-document.
- Autor
- DictaMed Research & Engineering
- Publicație
- Technical Note · CIF-001
- Versiune
- Version 0.1
- Publicat
- Limba
- Română
- Status
- Conceptual proposal
Cum se citează
DictaMed Research & Engineering. Clinical Information Fidelity (CIF): un cadru pentru măsurarea fidelității clinice în documentația medicală asistată de AI. Technical Note CIF-001, version 0.1. DictaMed, 2026.https://dictamed.ro/blog/clinical-information-fidelity
Cuprins
Introducere
Recunoașterea vocală este evaluată tradițional prin Word Error Rate (WER) — o metrică simplă, reproductibilă și extrem de utilă pentru măsurarea diferenței dintre o transcriere automată și textul de referință.
În documentația medicală apare însă o problemă fundamentală:
nu toate erorile au aceeași semnificație clinică.
O prepoziție transcrisă diferit poate să nu schimbe deloc sensul unui raport. O negație omisă poate modifica fundamental informația medicală.
Literatura privind recunoașterea vocală clinică arată de mult timp o mare heterogenitate a metodelor de evaluare. Un review sistematic care a analizat 122 de studii privind speech recognition în documentația clinică a identificat atât variații mari ale ratelor de eroare raportate, cât și nevoia unor metode de evaluare mai standardizate și mai cuprinzătoare [1].
Problema a devenit și mai importantă odată cu apariția sistemelor bazate pe inteligență artificială.
Un sistem modern de documentare medicală nu se oprește neapărat la:
speech → text
Transcriptul poate trece prin punctuație automată, normalizare, structurare și procesare cu modele lingvistice înainte de a deveni documentul pe care medicul îl verifică.
Avem astfel un pipeline mai apropiat de:
speech → transcript → procesare → document → validare
În acest context, documentul final poate fi lexical diferit de transcript și simultan perfect fidel informației exprimate de medic.
Poate apărea însă și situația inversă: documentul este impecabil redactat, dar o informație clinică a fost omisă, modificată sau introdusă fără suport în ceea ce medicul a spus.
Întrebarea relevantă nu mai este doar:
„Cât de corect au fost recunoscute cuvintele?”
Trebuie să putem întreba și:
„Cât de fidel a ajuns informația clinică exprimată de medic în documentul final?”
În acest articol propunem un framework conceptual pentru evaluarea acestei dimensiuni.
El introduce trei metrici principale:
- Clinical Information Fidelity (CIF) — fidelitatea informației clinice;
- Critical Clinical Error Rate (CCER) — frecvența erorilor cu potențial clinic important;
- Clinical Correction Burden (CCB) — volumul intervențiilor clinice necesare medicului înainte de validarea documentului.
Limitele Word Error Rate
Word Error Rate compară transcriptul generat cu un transcript de referință.
unde:
S= substituții;D= omisiuni;I= inserții;N= numărul cuvintelor din textul de referință.
WER răspunde foarte bine unei întrebări:
Cât de diferit este transcriptul generat de transcriptul de referință?
Problema apare atunci când diferența lexicală este interpretată automat ca diferență clinică.
Exemplul A
Ficat cu dimensiuni normale.
Ficat de dimensiuni normale.
Există o diferență lexicală. Informația clinică este însă echivalentă.
Exemplul B
Fără adenopatii mediastinale.
Adenopatii mediastinale.
Diferența lexicală este redusă. Diferența clinică este fundamentală.
WER identifică existența unei erori. Nu a fost însă construit pentru a determina semnificația clinică a acelei erori.
Această limitare nu este doar teoretică. Ellis și colaboratorii au construit un benchmark în care clinicienii au evaluat impactul erorilor ASR din dialoguri medic–pacient și au constatat că WER și alte metrici uzuale corelau slab cu clasificarea impactului clinic făcută de experți [2].
Word Error Rate
WER- Ce măsoară
- Diferența lexicală față de transcriptul de referință.
- Interval
- 0–∞
- Valoare ideală
- 0%
- Direcție
- ↓ mai mic este mai bine
Clinical Information Units
Ideea că evaluarea medicală trebuie să depășească nivelul cuvintelor are precedente importante.
În evaluarea recunoașterii automate a întrebărilor clinice au fost utilizate metrici precum medical term error rate, semantic type error rate și concept error rate [3].
În radiologie, RadGraph reprezintă informația din rapoarte prin entități și relații [4], iar metrici precum RadGraph F1 și RadCliQ au fost dezvoltate pentru evaluarea conținutului clinic al rapoartelor generate automat [5].
Framework-ul propus aici pornește de la aceeași problemă generală, dar urmărește întregul traseu speech-to-document.
Clinical Information Unit — CIU
O Clinical Information Unit (CIU) reprezintă o unitate atomică de informație clinică exprimată în sursa de referință.
Formațiune nodulară de 14 mm în lobul superior drept, în creștere față de examinarea precedentă, când măsura 7 mm.
| CIU | Tip | Valoare |
|---|---|---|
| C1 | finding | formațiune nodulară |
| C2 | location | lob superior |
| C3 | laterality | dreapta |
| C4 | current measurement | 14 mm |
| C5 | previous measurement | 7 mm |
| C6 | temporal change | creștere |
| C7 | comparison | examinarea precedentă |
Formal:
R = {r₁, r₂, …, rN}
reprezintă CIU din documentul de referință, iar:
G = {g₁, g₂, …, gM}
reprezintă CIU din output.
O CIU poate fi descrisă conceptual:
rᵢ = (entity, polarity, location, laterality, value, unit, temporality, relations)
Nu toate câmpurile sunt obligatorii.
Fidelitatea trebuie să fie independentă de formulare
Comparați:
Formațiune nodulară de 14 mm în lobul superior drept.
cu:
În lobul superior drept se evidențiază un nodul cu diametrul de 14 mm.
Textele sunt lexical diferite. Dar informația clinică relevantă poate fi aceeași:
- finding: nodul;
- polarity: prezent;
- location: lob superior;
- laterality: dreapta;
- measurement: 14 mm.
Din perspectiva CIF, formularea poate fi diferită atât timp cât informația clinică rămâne echivalentă.
Conceptele singure nu sunt suficiente
Considerăm:
Nodul pulmonar drept de 14 mm. Nodul pulmonar stâng de 7 mm.
Output:
Nodul pulmonar drept de 7 mm. Nodul pulmonar stâng de 14 mm.
Toate conceptele există. Dar documentul este incorect deoarece relațiile sunt greșite.
Funcția de concordanță clinică
Definim:
m(rᵢ,gⱼ) ∈ [0,1]
unde m = 1 înseamnă echivalență clinică completă, iar m = 0 înseamnă informație absentă, contradictorie sau incompatibilă.
Valorile intermediare reprezintă concordanțe parțiale și trebuie validate experimental.
Pentru fiecare CIU din referință:
sᵢ = max(gⱼ ∈ G) m(rᵢ,gⱼ)
Clinical Information Fidelity
Clinical Preservation — CP
Clinical Preservation răspunde întrebării:
„Cât din informația clinică exprimată în sursă a fost păstrată?”
unde wᵢ este ponderea CIU, iar sᵢ este scorul de concordanță. Dacă CP = 1, toată informația clinică de referință a fost păstrată.
De ce CP nu este suficient
Medicul spune:
Fără adenopatii mediastinale.
Documentul spune:
Fără adenopatii mediastinale. Fără metastaze hepatice.
Informația originală este păstrată. CP poate fi 1. Dar sistemul a introdus o informație nesusținută.
Clinical Precision — CPr
Clinical Precision răspunde:
„Cât din informația clinică prezentă în document este susținută de sursă?”
Pentru fiecare CIU generată:
qⱼ = max(rᵢ ∈ R) m(gⱼ,rᵢ)
Clinical Preservation întreabă: „Am pierdut ceva?”
Clinical Precision întreabă: „Am introdus ceva nesusținut?”
Clinical Information Fidelity — CIF
CIF reprezintă media armonică dintre Clinical Preservation și Clinical Precision.
Un sistem nu poate obține un CIF ridicat doar fiind conservator și eliminând informație: CP ↓, și nici păstrând informația originală în timp ce introduce afirmații suplimentare: CPr ↓.
Pentru un CIF ridicat, documentul trebuie simultan:
să păstreze informația clinică exprimată și să nu introducă informație clinică nesusținută.
CLINICAL INFORMATION FIDELITY
Exemplu de calcul
Presupunem CP = 0.980 și CPr = 0.995. Atunci:
CIF = 2 × (0.980 × 0.995) / (0.980 + 0.995)
Rezultă aproximativ CIF = 0.9874, adică CIF = 98.74%.
Această valoare descrie fidelitatea informațională agregată. Dar un scor agregat poate ascunde o eroare rară și importantă.
Clinical Preservation
CP- Ce măsoară
- Informația clinică păstrată din sursă.
- Interval
- 0–1
- Valoare ideală
- 1 / 100%
- Direcție
- ↑ mai mare este mai bine
Clinical Precision
CPr- Ce măsoară
- Informația generată susținută de sursă.
- Interval
- 0–1
- Valoare ideală
- 1 / 100%
- Direcție
- ↑ mai mare este mai bine
Clinical Information Fidelity
CIF- Ce măsoară
- Fidelitatea informației clinice între sursă și document.
- Interval
- 0–1 / 0–100%
- Valoare ideală
- 1 / 100%
- Direcție
- ↑ mai mare este mai bine
Critical Clinical Error Rate
Presupunem că un document conține sute de CIU corecte și o singură eroare: dreapta → stânga.
CIF poate rămâne foarte ridicat. Avem însă nevoie să știm explicit că această eroare a existat.
Definim un Critical Clinical Error (CCE) ca o eroare care modifică material informația clinică și care, conform unei taxonomii validate, este clasificată ca având potențial clinic important.
| Cod | Tip eroare | Exemplu |
|---|---|---|
| POL | Polarity | fără adenopatii → adenopatii |
| LAT | Laterality | dreapta → stânga |
| NUM | Numeric | 14 mm → 41 mm |
| UNIT | Unit | 5 mg → 5 g |
| ENTITY | Clinical entity | substituție entitate |
| REL | Relationship | valoare asociată entității greșite |
| OMI | Omission | informație relevantă eliminată |
| ADD | Unsupported addition | informație clinică nesusținută |
Formula CCER
Dacă E_c = numărul erorilor clinice critice și N = numărul CIU de referință, atunci:
Pentru 5.000 CIU și 7 erori critice: CCER_100 = 100 × 7 / 5000 = 0.14, adică 0,14 erori clinice critice / 100 CIU.
CCER trebuie raportat și pe categorii deoarece două sisteme cu aceeași valoare agregată pot avea profiluri de risc diferite.
Critical Clinical Error Rate
CCER- Ce măsoară
- Frecvența erorilor clinice critice.
- Interval
- 0–∞
- Valoare ideală
- 0
- Direcție
- ↓ mai mic este mai bine
Clinical Correction Burden
WER măsoară diferența lexicală. CIF măsoară fidelitatea informației. CCER evidențiază erorile clinice importante. Dar rezultatul final este verificat de medic.
Apare astfel întrebarea:
„Cât trebuie să corecteze medicul înainte ca documentul să poată fi validat?”
Pentru aceasta propunem Clinical Correction Burden (CCB).
Considerăm G = documentul generat și V = documentul validat de medic. Definim E_V = numărul CIU care necesită o corecție clinică și N = numărul CIU evaluate.
Un rezultat CCB_100 = 0.73 înseamnă 0,73 corecții clinice / 100 CIU.
CCB nu este edit distance
Medicul poate modifica:
Ficat cu dimensiuni normale.
în:
Ficat de dimensiuni normale.
A avut loc o modificare textuală. Dar informația clinică nu s-a schimbat.
CCB nu trebuie să numere automat orice modificare de text. Trebuie să urmărească modificările care corectează informația clinică.
Separăm astfel Editing Burden de Clinical Correction Burden. Primul este relevant pentru productivitate. Al doilea este relevant pentru fidelitatea clinică.
Clinical Correction Burden
CCB- Ce măsoară
- Corecțiile clinice efectuate de medic înainte de validare.
- Interval
- 0–∞
- Valoare ideală
- 0
- Direcție
- ↓ mai mic este mai bine
Evaluarea pipeline-ului speech-to-document
Într-un sistem clasic: speech → ASR → transcript.
Într-un sistem modern: speech → ASR → transcript → AI/processing → document → physician validation.
De ce WER nu poate evalua singur documentul final
Medicul poate dicta:
ficat normal omogen fără leziuni colecist fără calculi
iar sistemul poate redacta:
Ficat cu dimensiuni normale, ecostructură omogenă, fără leziuni focale. Colecist fără calculi.
Textul final diferă lexical. Dar informația poate fi păstrată.
În schimb, sistemul poate transforma:
Fără adenopatii mediastinale.
în:
Fără adenopatii mediastinale sau hilare.
Textul este fluent și plauzibil. Dar informația despre ganglionii hilari nu a fost furnizată de medic.
Fluența lingvistică nu garantează fidelitatea clinică.
Clinical Fidelity Gain — ΔCIF
Dacă ΔCIF > 0, postprocesarea a îmbunătățit fidelitatea clinică. Dacă ΔCIF = 0, a păstrat-o. Dacă ΔCIF < 0, a degradat-o.
Critical Error Delta — ΔCCER
Aici, ΔCCER < 0 înseamnă reducerea erorilor clinice critice.
Situația ideală: ΔCIF > 0 AND ΔCCER < 0. Postprocesarea crește fidelitatea generală și reduce simultan erorile importante.
Exemplu ipotetic
Transcript ASR: WER = 6.1%, CIF_ASR = 97.8%, CCER_ASR = 0.42 / 100 CIU.
Document final: CIF_FINAL = 99.1%, CCER_FINAL = 0.11 / 100 CIU.
Rezultă ΔCIF = +1.3 puncte procentuale și ΔCCER = −0.31 / 100 CIU. În acest scenariu, procesarea ulterioară îmbunătățește fidelitatea clinică.
Putem avea însă CIF_ASR = 99.0% și CIF_FINAL = 98.4%. Textul final poate fi mai elegant, dar informația clinică a fost degradată.
Profilul complet de evaluare
În locul unei singure valori de „accuracy”, propunem următorul profil:
| Metrică | Întrebarea |
|---|---|
| WER | Cât de fidel sunt reproduse cuvintele? |
| CP | A fost păstrat ceea ce a exprimat medicul? |
| CPr | Este informația generată susținută de sursă? |
| CIF | Cât de fidel este transferată informația clinică? |
| CCER | Câte erori clinic importante apar? |
| CCB | Câte corecții clinice trebuie să facă medicul? |
Exemplu ilustrativ:
| Metrică | Rezultat |
|---|---|
| WER | 4,8% |
| CP | 99,0% |
| CPr | 99,4% |
| CIF | 99,2% |
| CCER | 0,10 / 100 CIU |
| CCB | 0,73 / 100 CIU |
De ce WER mai mic nu înseamnă automat sistem clinic mai bun
| Metrică | Sistem A | Sistem B |
|---|---|---|
| WER | 5,2% | 4,4% |
| CIF | 99,1% | 97,8% |
| CCER | 0,08 | 0,31 |
| CCB | 0,35 | 0,82 |
Într-o evaluare exclusiv prin WER, Sistemul B ar fi preferat. Evaluarea fidelității clinice descrie însă un profil diferit.
Validare și direcții viitoare
Ce este validat și ce este propus
Susținut de literatura existentă
- WER nu descrie singur impactul clinic al erorilor;
- evaluarea semantică și conceptuală poate completa evaluarea lexicală;
- entitățile și relațiile pot fi utilizate pentru reprezentarea informației clinice;
- evaluarea de către clinicieni rămâne necesară pentru stabilirea relevanței clinice.
Propus în CIF v0.1
- definiția CIU utilizată în acest framework;
- Clinical Preservation;
- Clinical Precision;
- combinația CP și CPr prin CIF;
- taxonomia CCER;
- Clinical Correction Burden;
- ΔCIF;
- ΔCCER;
- utilizarea lor integrată pentru evaluarea pipeline-ului speech-to-document.
Framework-ul ridică mai multe întrebări deschise.
Definiția CIU
Doi evaluatori trebuie să poată segmenta același document într-un mod suficient de reproductibil.
Funcția de matching
Trebuie definit riguros m(rᵢ,gⱼ) și stabilit când două informații sunt:
- echivalente;
- parțial echivalente;
- incompatibile.
Ponderile
Nu putem presupune arbitrar că o eroare de negație sau lateralitate trebuie să primească o anumită pondere numerică. Ponderile trebuie validate experimental.
Definiția erorii critice
Nu orice eroare numerică este automat critică.
Diferența 14 mm → 15 mm nu este neapărat echivalentă clinic cu 14 mm → 41 mm. Impactul depinde de context. CCER necesită deci o taxonomie validată clinic.
Cum ar putea fi validat framework-ul
Un prim studiu ar putea utiliza un corpus de documente medicale provenite din mai multe specialități.
Pentru fiecare document ar putea fi create controlat variante care conțin:
- modificări stilistice fără impact clinic;
- sinonime clinic echivalente;
- omisiuni;
- inversarea negației;
- erori de lateralitate;
- erori numerice;
- erori de unitate;
- substituții de entități;
- relații incorecte;
- afirmații suplimentare nesusținute.
Mai mulți medici ar evalua independent:
- fidelitatea clinică;
- severitatea erorilor;
- necesitatea corectării;
- posibilitatea validării documentului.
Ulterior ar putea fi comparate WER, metricile semantice existente, CP, CPr, CIF, CCER și CCB cu evaluarea experților.
Validarea ar trebui să urmărească cel puțin:
Reproductibilitatea
Evaluatorii diferiți trebuie să identifice CIU și erorile într-un mod suficient de concordant.
Corelația CIF cu evaluarea clinicianului
Documentele apreciate drept mai fidele trebuie să primească scoruri CIF mai mari.
Corelația CCER cu impactul clinic
Erorile considerate importante de medici trebuie reflectate corespunzător.
Relevanța CCB
Un CCB mai mare trebuie să corespundă unui volum mai mare de corectare clinică.
Generalizarea
Framework-ul trebuie testat în mai multe specialități.
De ce nu trebuie validat doar în radiologie
Radiologia este un candidat foarte bun pentru primele experimente deoarece rapoartele conțin frecvent:
- constatări;
- localizări;
- lateralitate;
- dimensiuni;
- comparații;
- evoluție temporală;
- negații.
Există și precedente solide pentru reprezentarea prin entități și relații [4][5].
Dar un framework numit Clinical Information Fidelity trebuie să funcționeze dincolo de radiologie.
Ar trebui testat ulterior în:
- cardiologie;
- oncologie;
- anatomie patologică;
- consultații;
- alte domenii clinice.
Altfel am avea o metrică pentru un anumit tip de raport, nu un framework general pentru documentația medicală.
Automatizarea evaluării
Evaluarea manuală este posibilă pentru un corpus de cercetare. Nu este realistă pentru volume foarte mari sau pentru regression testing continuu.
O implementare automată ar putea utiliza NLP sau modele lingvistice pentru:
- extragerea CIU;
- identificarea relațiilor;
- matching-ul referință-output;
- clasificarea erorilor;
- calcularea CP, CPr, CIF și CCER.
Apare însă o problemă importantă:
dacă folosim AI pentru evaluarea AI, trebuie validat și evaluatorul.
Evaluatorul automat trebuie calibrat față de un gold standard construit de clinicieni.
Clinical Correction Burden necesită date reale
CP, CPr, CIF și CCER pot fi evaluate pe corpusuri construite. CCB are însă o proprietate diferită.
Pentru măsurarea sa avem nevoie de:
document generat → document efectiv validat de medic
Această caracteristică îl face relevant pentru studii prospective și pentru evaluarea sistemelor în utilizare reală.
CCB conectează benchmark-ul tehnic de experiența efectivă a clinicianului.
Un posibil standard de raportare
Dacă framework-ul este validat, un benchmark speech-to-document ar putea raporta:
- Lexical fidelity
- WER
- Clinical fidelity
- CP · CPr · CIF
- Critical errors
- CCER_100 · POL · LAT · NUM · UNIT · ENTITY · REL · OMI · ADD
- Physician correction
- CCB_100
- Pipeline transformation
- ΔCIF · ΔCCER
În loc de Accuracy: 98,7%, am obține un profil multidimensional al performanței.
Ideea centrală
Concluzie
Word Error Rate rămâne o metrică esențială pentru evaluarea automatic speech recognition.
Dar răspunde în primul rând unei întrebări lexicale:
„Cât de apropiat este transcriptul automat de transcriptul de referință?”
Pentru documentația medicală asistată de AI apare o întrebare suplimentară:
„Cât de fidel a fost transferată informația clinică de la medic către document?”
Clinical Preservation măsoară dacă informația exprimată a fost păstrată.
Clinical Precision măsoară dacă informația prezentă în document este susținută de sursă.
Clinical Information Fidelity combină aceste două perspective.
Critical Clinical Error Rate face vizibile erorile importante care pot fi ascunse într-un scor agregat foarte bun.
Clinical Correction Burden extinde evaluarea până la medic și măsoară intervențiile clinice necesare înainte de validare.
Framework-ul propus poate fi rezumat:
WER + CP + CPr + CIF + CCER + CCB
iar pentru sistemele cu postprocesare:
ΔCIF + ΔCCER
În loc să întrebăm exclusiv:
„Care sistem are cel mai mic WER?”
putem formula o întrebare mai apropiată de scopul real al documentației medicale:
„Care sistem transferă cel mai fidel informația clinică, produce cele mai puține erori importante și necesită cele mai puține corecții din partea medicului?”
Aceasta este ipoteza pe care Clinical Information Fidelity încearcă să o transforme într-o măsură testabilă.
Referințe
- Blackley SV, Huynh J, Wang L, Korach Z, Zhou L. Speech recognition for clinical documentation from 1990 to 2018: a systematic review. Journal of the American Medical Informatics Association. 26(4):324–338. 2019.DOI: 10.1093/jamia/ocy179Sursa originală ↗
- Ellis Z, Joselowitz J, Deo Y, et al. WER is Unaware: Assessing How ASR Errors Distort Clinical Understanding in Patient Facing Dialogue. Proceedings of the 16th International Workshop on Spoken Dialogue Systems. 2026.Sursa originală ↗
- Towards spoken clinical-question answering: evaluating and adapting automatic speech-recognition systems for spoken clinical questions. Journal of the American Medical Informatics Association. 2011.Sursa originală ↗
- Jain S, Agrawal A, Saporta A, et al. RadGraph: Extracting Clinical Entities and Relations from Radiology Reports. PhysioNet. 2021.Sursa originală ↗
- Yu F, Endo M, Krishnan R, et al. Evaluating progress in automatic chest X-ray radiology report generation. Patterns. 2023.Sursa originală ↗
- Joseph J, Moore ZEH, Patton D, O'Connor T, Nugent LE. The impact of implementing speech recognition technology on the accuracy and efficiency (time to complete) clinical documentation by nurses: A systematic review. Journal of Clinical Nursing. 29:2125–2137. 2020.DOI: 10.1111/jocn.15261
Version history
- v0.110 august 2026
Propunerea conceptuală inițială.
Technical Note CIF-001 · Version 0.1 · DictaMed Research & Engineering · 2026
https://dictamed.ro/blog/clinical-information-fidelity