word2vec: Danish DSL and Reddit word2vec word embeddings
Description
Semantiske modeller er trænet på DSL's tekstkorpusser ved hjælp af Python-pakken Gensims. Modellerne er trænet med 500 features, et "vindue" på 5 ord omkring søgeordet og ord, der optræder mindre end 5 gange i korpus, er sorteret fra, og der er anvendt "skip-gram" som træningsalgoritme. Modellen "DSL_skipgram_2020.model" er trænet med et korpus på godt en milliard løbende ord med tekster fra 1983 til og med 2019.Modellerne stilles til rådighed i tre formater. ÅBEN-DSL-LICENS:Ressourcen kan frit downloades idet man accepterer en række brugsbetingelser og forpligter sig til at overholde dem. Refereres til ved: "Word2Dict – Lemma Selection and Dictionary Editing Assisted by Word Embeddings" / Nicolai H. Sørensen, Nimb, Sanni, i Proceedings from Euralex 2018, Ljubliana, Slovenia, 2018".
Resources
| Name |
Format |
Description |
Link |
|
0 |
|
https://korpus.dsl.dk/download/word2vec/dsl_skipgram_2020_m5_f500_epoch2_w5.model.w2v.bin |
|
57 |
|
https://korpus.dsl.dk/download/word2vec/dsl_skipgram_2020_m5_f500_epoch2_w5.model.txtvectors.zip |
|
57 |
|
https://korpus.dsl.dk/download/word2vec/dsl_skipgram_2020_m5_f500_epoch2_w5.model.zip |
|
57 |
|
https://ndownloader.figshare.com/files/15111116 |
Tags
- sprog-og-retskrivning
- kultur
- uddannelse,-kultur-og-sport
- kulturarv