Högskolan i Skövde

his.sePublikasjoner
Endre søk
RefereraExporteraLink to record
Permanent link

Direct link
Referera
Referensformat
  • apa
  • apa-cv
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annet format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annet språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf
Menings- och dokumentklassficering för identifiering av meningar
Högskolan i Skövde, Institutionen för informationsteknologi.
Högskolan i Skövde, Institutionen för informationsteknologi.
2018 (svensk)Independent thesis Basic level (degree of Bachelor), 20 poäng / 30 hpOppgaveAlternativ tittel
Sentence and document classification for identification of sentences (engelsk)
Abstract [sv]

Detta examensarbete undersöker hur väl tekniker inom meningsklassificering och dokumentklassificering fungerar för att välja ut meningar som innehåller de variabler som använts i experiment som beskrivs i medicinska dokument. För meningsklassificering används tillståndsmaskiner och nyckelord, för dokumentklassificering används linjär SVM och Random forest. De textegenskaper som har valts ut är LIX (läsbarhetsindex) och ordmängd (word count). Textegenskaperna hämtas från en färdig datamängd som skapades av Abrahamsson (T.B.D) från artiklar som samlas in för denna studie. Denna datamängd används sedan för dokumentklassificering. Det som undersöks hos dokumentklassificeringsteknikerna är förmågan att skilja dokument av typerna vetenskapliga artiklar med experiment, vetenskapliga artiklar utan experiment, vetenskapliga artiklar med metaanalyser och dokument som inte är vetenskapliga artiklar åt. Dessa dokument behandlas med meningsklassificering för att undersöka hur väl denna hittar meningar sominnehåller definitioner av variabler.

Resultatet från experimentet tydde på att teknikerna för meningsklassificering inte var dugliga för detta ändamål på grund av låg precision. För dokumentklassificering var Randomforest bäst lämpad men hade problem att skilja olika typer av vetenskapliga artiklar åt.

sted, utgiver, år, opplag, sider
2018. , s. 48
Emneord [en]
natural language processing, classification, finite state automata
Emneord [sv]
språkteknologi, klassificering, tillståndsmaskiner
HSV kategori
Identifikatorer
URN: urn:nbn:se:his:diva-16373OAI: oai:DiVA.org:his-16373DiVA, id: diva2:1261804
Fag / kurs
Informationsteknologi
Utdanningsprogram
Computer Science - Specialization in Systems Development
Veileder
Examiner
Tilgjengelig fra: 2018-11-12 Laget: 2018-11-08 Sist oppdatert: 2025-09-29bibliografisk kontrollert

Open Access i DiVA

fulltext(2389 kB)358 nedlastinger
Filinformasjon
Fil FULLTEXT01.pdfFilstørrelse 2389 kBChecksum SHA-512
61e7ffc3d1c3268ba2d2765cb523efbc204ef035a8d7841d6f226e067da869394df42d6eff38e4543033af187de6b75b5de219bb92dc67c5931a946c615e9bef
Type fulltextMimetype application/pdf

Søk i DiVA

Av forfatter/redaktør
Paulson, JörgenHuynh, Peter
Av organisasjonen

Søk utenfor DiVA

GoogleGoogle Scholar
Totalt: 358 nedlastinger
Antall nedlastinger er summen av alle nedlastinger av alle fulltekster. Det kan for eksempel være tidligere versjoner som er ikke lenger tilgjengelige

urn-nbn

Altmetric

urn-nbn
Totalt: 613 treff
RefereraExporteraLink to record
Permanent link

Direct link
Referera
Referensformat
  • apa
  • apa-cv
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annet format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annet språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf