dunossauro / dunossauro/live-de-python
[SUGESTÃO] Modelo NER com spacy
- Dominant language
- Python
- Stars
- 1.3k
- Forks
- 217
- PR merge metrics
- No merged PRs in 30d
Description
Assisti à Live de Python nº 226 - spaCy: Introdução a Processamento de Linguagem Natural. Foi muito massa, e fiquei curioso sobre como seria aplicar o Spacy a um domínio específico, como a área da saúde. O inscrito Geoffrey Moraes Porto perguntou na Live algo parecido com o que sugiro aqui.
A ideia para um projeto prático seria a seguinte: identificar quais seriam os termos em um texto que se referem a exames médicos, como hemograma completo, raio X, ultrassonografia, etc. Essa base de termos específicos eu consigo gerar a partir de documentação disponível no site da Agência Nacional de Saúde - ANS.
Para tornar a prática bem mais interessante, temos que lembrar que esses exames médicos possuem vários "apelidos" dados pelos médicos. Por exemplo, Raio X pode ser escrito como RX, ultrassonografia pode ser escrito como US ou USG. Além disso, vários desses exames referem-se a determinada parte do corpo: Raio X pode ser de braço, de pé direito, pé esquerdo, etc.
E para facilitar o entendimento, esse conteúdo poderia ser divido em duas lives, de modo que o assunto pudesse ser abordado calmamente, sem correria.
Contributor guide
No contributing guide indexed for this repository
Research direction
Start by reviewing the proposed ANS documentation and the spaCy NER material from Python Live #226. Define the medical-exam terms, abbreviations, body-part variants, project scope, and whether the work should be split across two lives; done means the scope and practical deliverables are agreed before implementation.
Written by the indexing model from the issue text.
Assessment
- Tech stack
- python
- Domain
- machine-learning
- Issue type
- Feature
- Difficulty
- 5/5
- Estimated time
- Over a week
- Activity status
- Stale
- Clarity
- Needs clarification
- Newbie friendliness
- 25/100