word2vec: Danish DSL and Reddit word2vec word embeddings

Description

Semantiske modeller er trænet på DSL's tekstkorpusser ved hjælp af Python-pakken Gensims. Modellerne er trænet med 500 features, et "vindue" på 5 ord omkring søgeordet og ord, der optræder mindre end 5 gange i korpus, er sorteret fra, og der er anvendt "skip-gram" som træningsalgoritme. Modellen "DSL_skipgram_2020.model" er trænet med et korpus på godt en milliard løbende ord med tekster fra 1983 til og med 2019.Modellerne stilles til rådighed i tre formater. ÅBEN-DSL-LICENS:Ressourcen kan frit downloades idet man accepterer en række brugsbetingelser og forpligter sig til at overholde dem. Refereres til ved: "Word2Dict – Lemma Selection and Dictionary Editing Assisted by Word Embeddings" / Nicolai H. Sørensen, Nimb, Sanni, i Proceedings from Euralex 2018, Ljubliana, Slovenia, 2018".

Resources

Name Format Description Link
57 https://ndownloader.figshare.com/files/15111116
57 https://korpus.dsl.dk/download/word2vec/dsl_skipgram_2020_m5_f500_epoch2_w5.model.zip
0 https://korpus.dsl.dk/download/word2vec/dsl_skipgram_2020_m5_f500_epoch2_w5.model.w2v.bin
57 https://korpus.dsl.dk/download/word2vec/dsl_skipgram_2020_m5_f500_epoch2_w5.model.txtvectors.zip

Tags

Topics

  • EDUC

Categories