Porque é que as notas veterinárias em texto livre prejudicam a codificação automatizada
Os registos veterinários em texto livre carecem da estrutura necessária para uma codificação clínica automatizada fiável. Descubra porque é que a linguagem ambígua, as abreviaturas e os procedimentos narrativos causam falhas na codificação

As notas de consulta em texto livre são a espinha dorsal da documentação clínica veterinária, mas foram concebidas para o raciocínio clínico, não para a extração de dados. Quando um veterinário escreve "Suspeito que possamos estar perante uma otite em fase inicial", está a comunicar incerteza diagnóstica a um colega. Quando um sistema de codificação automatizada lê a mesma frase, pode não detetar o diagnóstico, classificá-lo incorretamente ou atribuir um código com um nível de confiança que o clínico nunca pretendeu. Esta lacuna entre a forma como os veterinários escrevem e a forma como os sistemas de codificação leem é uma das principais razões pelas quais a codificação clínica na prática veterinária continua pouco fiável. Os dados subsequentes que dela dependem são muitas vezes incompletos.
O que a codificação clínica na prática veterinária realmente exige
A codificação clínica é o processo de converter a informação essencial contida numa narrativa clínica em dados estruturados e padronizados, utilizando um vocabulário controlado. Na medicina veterinária, os sistemas mais amplamente utilizados incluem o VeNom (Veterinary Nomenclature) e o SNOMED CT (Systematized Nomenclature of Medicine Clinical Terms). O objetivo é transformar uma nota de consulta, escrita em linguagem natural, em conceitos discretos e inequívocos: um diagnóstico, uma espécie, um sistema corporal, um procedimento.
Os sistemas de codificação, sejam operados manualmente ou baseados em processamento de linguagem natural (NLP, um ramo da inteligência artificial que interpreta a linguagem humana), analisam registos à procura de sinais específicos. Precisam de identificar um ponto final codificável, uma condição confirmada ou suspeita, e mapeá-la para um termo dentro do vocabulário controlado. O que não conseguem fazer de forma fiável é inferir significado clínico a partir do contexto narrativo, resolver terminologia ambígua ou distinguir entre um problema ativo atual e um histórico mencionado de passagem.
Como observou uma investigação publicada na npj Digital Medicine, as notas veterinárias diferem substancialmente no estilo de escrita e vocabulário entre clínicas. Os seus códigos de diagnóstico utilizam um sistema de terminologia diferente do da medicina humana. Ao contrário dos cuidados de saúde humanos, onde uma infraestrutura de codificação robusta está incorporada nos sistemas clínicos, a maioria dos registos veterinários são texto livre sem codificação de diagnóstico padronizada. A ausência dessa infraestrutura significa que todo o peso da codificabilidade recai sobre a própria nota. Para mais informações sobre como a codificação clínica na prática veterinária difere da medicina humana, consulte a nossa visão geral dedicada.
Os padrões narrativos específicos que comprometem a codificação automatizada
Vários hábitos distintos de texto livre causam consistentemente falhas ou omissões na codificação. Estes não são erros aleatórios. São consequências previsíveis de escrever notas para comunicação clínica em vez de para extração de dados estruturados.
Diagnósticos incorporados em linguagem de atenuação. Quando um veterinário escreve "Suspeito que possamos estar perante uma otite em fase inicial", o diagnóstico está presente, mas oculto numa atenuação epistémica. As ferramentas automatizadas frequentemente não detetam ou classificam incorretamente diagnósticos expressos desta forma. O sistema de codificação não consegue determinar de forma fiável se isto representa uma condição suspeita que justifica um código ou uma observação especulativa que não o justifica.
Abreviaturas e notação específica da clínica. Termos como "ouvido bilat.", "PU/PD query Cushing's" ou "?DII" são imediatamente compreendidos por um colega da mesma clínica, mas são interpretados de forma inconsistente entre sistemas de codificação. A investigação sobre NLP para registos veterinários identificou que a terminologia não padronizada é uma das barreiras mais persistentes à extração automatizada fiável, especialmente ao mapear dados de prescrição e descrições clínicas para condições específicas em larga escala.
Diagnósticos diferenciais registados como conclusões. Quando um veterinário lista diagnósticos a excluir, "DDx: hipotiroidismo, Cushing's, diabetes", sem indicar um diagnóstico de trabalho confirmado, as ferramentas de codificação ficam sem um ponto final codificável. Os diferenciais podem ser clinicamente apropriados, mas não dão ao sistema nada a que ancorar um código.
Procedimentos descritos narrativamente. "Dei uma vista de olhos rápida à pele e tosquiei a área" não surge como um código de procedimento discreto. Ações procedimentais incorporadas em prosa descritiva são rotineiramente ignoradas por sistemas automatizados que procuram sinais de procedimento reconhecíveis em vez de relatos narrativos do que aconteceu durante a consulta.
Pressupostos de espécie e raça. Quando o sinalamento do paciente (espécie, raça, idade, sexo) não é repetido ou referenciado no corpo da nota, as ferramentas automatizadas podem aplicar códigos concebidos para um contexto de espécie diferente. Se o sistema de codificação lê uma nota isoladamente do ficheiro do paciente, a ausência de contexto de espécie pode resultar em códigos mal aplicados ou ambíguos.
Negação e contexto histórico misturados com achados ativos. "Sem vómitos, embora o proprietário relate que foi um problema no ano passado" é uma construção comum e clinicamente sensata, mas pode causar codificação falso-positiva de vómitos como uma condição atual. Trabalho inicial sobre o desempenho de pesquisa em texto livre em registos veterinários estabeleceu que a sensibilidade de pesquisa para diagnósticos em notas não estruturadas variava de 33 por cento a 98 por cento. O valor preditivo positivo variava de 2 por cento a 74 por cento, dependendo da condição e da estratégia de pesquisa utilizada. Uma variação tão ampla torna os dados agregados pouco fiáveis sem revisão manual significativa. O tratamento da negação continua a ser um dos problemas tecnicamente mais difíceis no NLP clínico.
Porque é que a linguagem de atenuação é particularmente problemática para a precisão da codificação
A incerteza clínica não é uma falha de documentação. É uma parte legítima e importante do raciocínio veterinário. O problema é que a linguagem utilizada para expressar incerteza em notas de texto livre elimina uma distinção que os sistemas de codificação precisam de preservar.
Existe uma diferença significativa entre:
Uma condição que é suspeita e deve gerar um código de "suspeita" ou "query"
Uma condição que está a ser ativamente excluída e não deve ser codificada de todo
Uma condição mencionada apenas como contexto histórico
Em prosa de texto livre, as três podem aparecer em construções quase idênticas. "Query Cushing's", "a excluir Cushing's" e "o proprietário mencionou que Cushing's foi levantado por um veterinário anterior" podem parecer superficialmente semelhantes a um modelo de NLP, mas têm implicações de codificação completamente diferentes. A investigação sobre precisão de codificação automatizada descobriu que as taxas de precisão podem cair até 60 por cento em tarefas de codificação de texto livre desafiantes, em parte porque a atenuação, negação e ambiguidade contextual continuam a ser computacionalmente difíceis de resolver.
O problema subjacente é que os veterinários são treinados para documentar o seu processo de raciocínio, incluindo a incerteza, em forma narrativa. Os sistemas de codificação são concebidos para extrair conclusões. Quando a nota contém raciocínio em vez de conclusões, o sistema tem material limitado com que trabalhar.
Como as omissões são frequentemente mais prejudiciais do que os erros
Um registo mal codificado é um problema, mas um registo omitido é invisível. Quando uma condição ou procedimento não é captado de todo, não há sinalização, nenhuma anomalia e nenhum aviso para revisão. A ausência simplesmente torna-se parte dos dados.
Esta invisibilidade tem consequências reais:
Lacunas nos dados de saúde populacional. Estudos de mineração de texto sobre vigilância de síndrome entérica em animais de companhia demonstraram que os registos não estruturados requerem esforço computacional significativo para extrair até contagens de casos básicas. Sem codificação sistemática, a determinação de casos para estudos de prevalência e incidência é fundamentalmente pouco fiável.
Alertas de seguimento perdidos. Nos sistemas de gestão de clínicas, os alertas automatizados para acompanhamento, vacinação ou dispensa repetida dependem frequentemente de registos codificados. Os registos codificados suportam alertas automatizados que os registos de texto livre não conseguem acionar de forma fiável.
Relatórios de clínica imprecisos. A auditoria clínica na prática veterinária demonstrou ser difícil retrospetivamente devido a barreiras no estabelecimento de diagnóstico a partir de registos clínicos. A ausência de codificação consistente foi identificada como um obstáculo primário.
Vigilância de doenças distorcida. Programas de vigilância nacional como o SAVSNET (Small Animal Veterinary Surveillance Network) e o VetCompass dependem da qualidade dos dados que fluem das clínicas individuais. Quando as condições não são codificadas, os padrões de doença parecem menos prevalentes do que realmente são. Esta distorção tem implicações para relatórios de gestão antimicrobiana e monitorização de doenças emergentes.
Um estudo usando modelos de gradient boosting para determinação de casos a partir de registos veterinários de texto livre descobriu que as ferramentas de NLP podiam alcançar alta precisão para condições específicas e bem definidas. Mas apenas após extensa limpeza de dados, verificação ortográfica veterinária personalizada e treino em registos manualmente anotados. A sobrecarga computacional necessária para compensar notas não estruturadas é substancial.
As alterações estruturais nas notas que tornam os registos mais fiavelmente codificáveis
Os ajustes que melhoram a codificabilidade não requerem uma mudança fundamental na forma como os veterinários pensam ou raciocinam. Exigem pequenas mudanças consistentes na forma como as conclusões clínicas são apresentadas no registo escrito. A maioria pode ser implementada sem adicionar tempo significativo a uma consulta.
Indicar um diagnóstico de trabalho explicitamente. Mesmo sob incerteza, uma frase consistente como "Diagnóstico de trabalho: otite externa" dá ao sistema de codificação um sinal inequívoco. A incerteza ainda pode ser documentada no corpo narrativo, mas o ponto final codificável precisa de ser visível.
Separar achados ativos de contexto histórico e diferenciais excluídos. Uma distinção estrutural simples, por exemplo, agrupar problemas ativos separadamente de "história" ou "antecedentes", reduz o risco de condições históricas serem codificadas como atuais. Os diferenciais excluídos devem ser rotulados como tal, em vez de listados ao lado do diagnóstico de trabalho.
Usar terminologia consistente para condições comuns. Alternar entre "infeção de ouvido", "otite", "ouvido bilateral" e "inflamação auricular" em diferentes consultas cria inconsistência que se agrava ao longo do tempo nos dados ao nível da clínica. Estabelecer um termo preferido para condições frequentemente encontradas, mesmo que informalmente, melhora tanto a fiabilidade da codificação manual como automatizada.
Registar procedimentos como ações discretas. "Citologia realizada (zaragatoa de ouvido, ouvido direito)" é codificável. "Dei uma vista de olhos e recolhi uma zaragatoa enquanto o proprietário o segurava" não é. A distinção não é sobre formalidade, mas sim sobre dar ao registo um sinal procedimental reconhecível.
Incluir contexto específico de espécie quando a nota pode ser lida independentemente. Isto é particularmente relevante para clínicas que utilizam sistemas onde as notas podem ser extraídas, partilhadas ou processadas fora do ficheiro do paciente, por exemplo, em resumos de referenciação ou conjuntos de dados de vigilância.
Onde os modelos estruturados e assistentes de IA podem ajudar, e onde não podem
Para uma visão geral mais ampla de ferramentas de documentação de IA para veterinários e o que avaliar antes de as adotar, consulte o nosso guia dedicado. Os modelos estruturados abordam o problema da codificabilidade diretamente, substituindo campos narrativos abertos por campos discretos e obrigatórios: espécie, queixa apresentada, diagnóstico de trabalho, procedimentos realizados. A investigação demonstrou que modelos de linguagem de grande escala treinados em grandes volumes de dados curados e manualmente codificados podem alcançar melhorias significativas na codificação de diagnóstico automatizada. Mas a qualidade dos dados de treino subjacentes e a qualidade das notas recebidas continuam a ser o limite para o desempenho.
Assistentes médicos de IA que geram notas estruturadas a partir de áudio de consulta podem reduzir o peso da escrita manual de notas e melhorar a consistência, mas enfrentam as mesmas ambiguidades que afetam os codificadores manuais. Se um veterinário expressa um diagnóstico verbalmente com linguagem de atenuação, o assistente transcreverá essa atenuação. Se um procedimento é descrito narrativamente em vez de nomeado, o assistente pode não apresentá-lo como uma ação codificável discreta.
Os modelos, por outro lado, reduzem a liberdade narrativa e podem parecer onerosos em ambientes clínicos de ritmo acelerado. A investigação sobre NLP veterinário identifica consistentemente a variação do estilo de escrita entre clínicas como um desafio importante para a generalização de modelos. Isto significa que mesmo sistemas automatizados bem treinados podem ter desempenhos diferentes entre clínicas, dependendo de quão consistentemente os modelos são utilizados. Nenhuma ferramenta elimina o problema. Ambas são limitadas pela qualidade da nota com que estão a trabalhar.
Como é a codificação fiável na prática
O exemplo seguinte ilustra o mesmo encontro clínico escrito de duas formas. O conteúdo clínico é idêntico. A codificabilidade não é.
Versão típica de texto livre:
"A Bella veio com o seu proprietário que estava preocupado com os seus ouvidos. Ela tem estado a coçar muito e a abanar a cabeça. No exame, o ouvido direito parecia bastante inflamado e havia alguma secreção escura (pode ser levedura, pode ser bacteriana, difícil de dizer nesta fase). O ouvido esquerdo parecia bem. Limpei o ouvido direito e recolhi uma zaragatoa. Comecei-a com Surolan por agora e verei como ela se sai. O proprietário deve voltar em duas semanas se não melhorar."
A partir desta nota, um sistema de codificação automatizada enfrenta vários desafios: o diagnóstico está implícito, mas não declarado. O procedimento ("limpei o ouvido direito e recolhi uma zaragatoa") está incorporado na narrativa. A lateralidade está presente, mas não estruturada. A justificação do tratamento é expressa como incerteza em vez de uma decisão clínica.
Versão estruturalmente ajustada:
"Queixa apresentada: abanar de cabeça e prurido, ouvido direito.
Achados ativos: otite externa direita (eritema, secreção ceruminosa escura). Ouvido esquerdo sem alterações de destaque.
Diagnóstico de trabalho: otite externa direita, provavelmente levedura (Malassezia). Componente bacteriano não excluído.
Procedimentos: citologia de ouvido direito (zaragatoa recolhida), lavagem de ouvido direito realizada.
Tratamento: Surolan ótico (5 gotas ouvido direito BID x 14 dias).
Acompanhamento: reavaliação em 2 semanas se não houver melhoria."
Na segunda versão, o diagnóstico de trabalho é explícito e codificável. O procedimento é nomeado e lateralizado. O diferencial é reconhecido sem ser registado como um diagnóstico confirmado. O tratamento está ligado a um produto nomeado e a uma ação discreta. Cada elemento de que o sistema de codificação precisa está presente e inequívoco, sem qualquer perda de informação clínica.
Porque é que isto importa para além da consulta individual
A qualidade de uma nota de consulta individual tem consequências que se estendem muito para além do próprio encontro. Ao nível da clínica, a codificação pouco fiável significa que os relatórios sobre carga de casos, prevalência de doenças e resultados de tratamento são construídos sobre dados incompletos. Ao nível nacional, os programas de vigilância de doenças que se baseiam em registos clínicos veterinários, incluindo monitorização de gestão antimicrobiana e rastreio de doenças zoonóticas, são apenas tão precisos quanto os registos que os alimentam.
A investigação epidemiológica usando registos equinos de texto livre demonstrou tanto o potencial como as limitações desta fonte de dados: a mineração de texto pode revelar associações significativas de fatores de risco, mas os autores observam que a abordagem "requer uma mudança conceptual no diagnóstico de doenças que deve ser considerada cuidadosamente". Essa mudança conceptual começa com a forma como os veterinários individuais escrevem as suas notas.
A viabilidade a longo prazo do apoio à decisão clínica assistido por IA na medicina veterinária também depende desta base. Modelos treinados em dados veterinários codificados e estruturados podem apoiar o diagnóstico, sinalizar interações medicamentosas e identificar populações em risco. Modelos treinados em registos de texto livre escritos de forma inconsistente, sem codificação fiável, enfrentam desafios de generalização significativos que limitam a sua utilidade clínica. A codificação fiável depende de registos fiáveis. E os registos fiáveis, na prática veterinária, começam com as escolhas que os veterinários fazem sobre como escrevem.
Perguntas frequentes
▶ Porque é que as notas veterinárias de texto livre causam falhas na codificação clínica
As notas de consulta em texto livre são escritas para comunicação clínica, não para extração de dados. Os sistemas de codificação automatizada precisam de pontos finais codificáveis inequívocos, mas as notas veterinárias frequentemente contêm linguagem de atenuação, notação específica da clínica e descrições narrativas de procedimentos. Estes hábitos tornam difícil para os sistemas de codificação identificar um diagnóstico confirmado, distinguir achados ativos de históricos ou apresentar códigos procedimentais discretos.
▶ Que sistemas de codificação utilizam as clínicas veterinárias
Os sistemas mais amplamente utilizados na medicina veterinária são o VeNom (Veterinary Nomenclature) e o SNOMED CT (Systematized Nomenclature of Medicine Clinical Terms). Ambos convertem narrativas clínicas em conceitos estruturados e padronizados que cobrem diagnósticos, espécies, sistemas corporais e procedimentos. Ao contrário dos cuidados de saúde humanos, a maioria dos registos veterinários são texto livre sem codificação de diagnóstico padronizada, o que coloca todo o peso da codificabilidade sobre a própria nota.
▶ Que hábitos de escrita específicos comprometem mais frequentemente a codificação automatizada
Vários padrões causam consistentemente falhas de codificação. Diagnósticos ocultos em linguagem de atenuação, como "Suspeito que possamos estar perante uma otite em fase inicial", são frequentemente não detetados ou mal classificados. Abreviaturas e notação específica da clínica são interpretadas de forma inconsistente entre sistemas. Diagnósticos diferenciais listados sem um diagnóstico de trabalho confirmado deixam as ferramentas de codificação sem uma âncora. Procedimentos descritos narrativamente em vez de nomeados como ações discretas são rotineiramente omitidos. A negação e o contexto histórico misturados com achados ativos também podem gerar códigos falso-positivos para condições que não são atuais.
▶ Como é que a linguagem de atenuação afeta a precisão da codificação
A linguagem de atenuação elimina distinções que os sistemas de codificação precisam de preservar. Uma condição suspeita, uma condição a ser ativamente excluída e uma condição mencionada apenas como contexto histórico podem todas aparecer em construções quase idênticas em prosa de texto livre. A investigação sobre precisão de codificação automatizada descobriu que as taxas de precisão podem cair até 60 por cento em tarefas de codificação de texto livre desafiantes, em parte porque a atenuação, negação e ambiguidade contextual continuam a ser computacionalmente difíceis de resolver.
▶ Porque é que as omissões da codificação clínica são mais prejudiciais do que os erros
Um registo mal codificado pelo menos existe nos dados e pode ser sinalizado para revisão. Um registo omitido é invisível. Quando uma condição ou procedimento não é captado de todo, não há anomalia nem aviso para correção. Esta invisibilidade afeta dados de saúde populacional, alertas de seguimento automatizados, relatórios ao nível da clínica e programas de vigilância de doenças nacionais como o SAVSNET e o VetCompass, todos os quais dependem de registos codificados que fluem das clínicas individuais.
▶ Que mudanças práticas tornam as notas veterinárias mais fiavelmente codificáveis
Pequenas mudanças consistentes na forma como as conclusões clínicas são apresentadas podem melhorar significativamente a codificabilidade. Indicar um diagnóstico de trabalho explicitamente, mesmo sob incerteza, dá aos sistemas de codificação um sinal inequívoco. Separar achados ativos de contexto histórico e diferenciais excluídos reduz a codificação falso-positiva. Usar terminologia consistente para condições comuns, registar procedimentos como ações nomeadas discretas e incluir contexto específico de espécie quando as notas podem ser lidas independentemente, tudo ajuda sem adicionar tempo significativo a uma consulta.
▶ Podem os assistentes médicos de IA ou modelos estruturados resolver o problema da codificação
Ambas as ferramentas podem ajudar, mas nenhuma elimina o problema. Os modelos estruturados substituem campos narrativos abertos por campos obrigatórios discretos, o que melhora diretamente a codificabilidade. Os assistentes médicos de IA que geram notas estruturadas a partir de áudio de consulta podem melhorar a consistência, mas enfrentam as mesmas ambiguidades que os codificadores manuais. Se um veterinário expressa um diagnóstico verbalmente com linguagem de atenuação, o assistente transcreverá essa atenuação. A qualidade da nota continua a ser o limite para o desempenho da codificação, independentemente da ferramenta.
▶ Como é que a codificação veterinária pouco fiável afeta a vigilância de doenças
Os programas de vigilância nacional que se baseiam em registos clínicos veterinários, incluindo monitorização de gestão antimicrobiana e rastreio de doenças zoonóticas, são apenas tão precisos quanto os registos que os alimentam. Quando as condições não são codificadas, os padrões de doença parecem menos prevalentes do que realmente são. Estudos de mineração de texto sobre vigilância de síndrome entérica em animais de companhia demonstraram que sem codificação sistemática, a determinação de casos para estudos de prevalência e incidência é fundamentalmente pouco fiável.
▶ Como é uma nota veterinária fiavelmente codificável comparada com uma nota típica de texto livre
O conteúdo clínico pode ser idêntico, mas a estrutura faz a diferença. Uma nota típica de texto livre pode implicar um diagnóstico, incorporar procedimentos na narrativa e expressar a justificação do tratamento como incerteza. Uma nota estruturalmente ajustada indica o diagnóstico de trabalho explicitamente, nomeia e lateraliza procedimentos como ações discretas, rotula diferenciais separadamente de achados confirmados e liga o tratamento a um produto nomeado e ação. Cada elemento de que o sistema de codificação precisa está presente e inequívoco, sem qualquer perda de informação clínica.