Hoppa till huvudinnehåll

Aktuellt från Språkbanken

Blogg (Svenska)

Gör ditt eget korsord!

Snart är det semester, och då är korsord en klassiker.

Nyhet (Svenska)

SuperLim ska förbättra svenska språkmodeller

Nu släpper Språkbanken Text SuperLim 1.0 , en datasamling som kan användas för testning och utvärdering av svenska språkmodeller. Släppet är en del i projektet SuperLim, ett samarbete med aktörer inom språkteknologi och artificiell intelligens.
Nyhet (Svenska)

Går det att förutsäga språkliga förändringar?

Mänskliga språk förändras hela tiden, men vad är det som ligger bakom utvecklingen? I juli drar projektet Cassandra igång där en grupp forskare från Språkbanken Text vill se om det går att förutsäga språkliga förändringar.
Blogg (Svenska)

Documentation: a (fictional) sad story with a (real) happy ending

This post is based on joint work with Gerlof Bouma. Illustrations by Jan and Julija.

Here's a sad story (it's fictional, but sad nonetheless).

Nyhet (Svenska)

Nu finns en ny version av Sparv

Nu finns det en ny version av Språkbankens textanalysverktyg Sparv. Bland annat har användarupplevelsen blivit ännu bättre.
Blogg (Svenska)

Swedish derivational morphology with CoDeRooMor

This blog is based on a joint work by Elena Volodina, Therese Lindström Tiedemann and Yousuf Ali Mohammed within the RJ-funded project L2 profiles.

Nyhet (Svenska)

Månadens profil: Per Fallgren

Per Fallgren är doktorand vid avdelningen för tal, musik och hörsel på KTH. Han jobbar bland annat med att ta fram metoder för att kunna utnyttja den ljuddata som finns inom arkiv.
Nyhet (Svenska)

Nya ord i spåren av pandemin

Hör du till dem som råkat ut för en självutnämnd hobbyepidemiolog? Eller har du kanske drabbats av zoombombning eller sökt coronapass? Dimitrios Kokkinakis är docent i språkteknologi vid Språkbanken Text. Tillsammans med några av sina kollegor är han i full färd med att undersöka vilka nya ord och uttryck som den pågående pandemin gett upphov till och hur de används i olika kontexter.
Nyhet (Svenska)

Månadens profil: Lena Wenner

Lena Wenner är forskare och dialektolog på Isof, Institutet för språk och folkminnen. Hon jobbar bland annat med Dialektkartan, ett verktyg där det går att söka bland och lyssna på inspelningar från Isofs samlingar.
Nyhet (Svenska)

Visualiserar klassisk litteratur

Den 28 januari lanseras Litteraturkartan.se, en digital karta för att utforska litteratur i Bohuslän, Dalsland och Västergötland. Lanseringen livesänds från Göteborgs Litteraturhus och bakom den tekniska utvecklingen står Johan Roxendal på Språkbanken Text vid Göteborgs universitet.
Nyhet (Svenska)

Upptäck textanalysverktyget Sparv – nu i ny version

Nu finns en ny version av textanalysverktyget Sparv. Sparv märker upp texter med lingvistisk information och är ett av många språkteknologiska verktyg som utvecklats inom Nationella språkbanken.
Blogg (Svenska)

A Swedish COVID-19 (sv-COVID-19) corpus and its exploration ... smorgasbord

As the COVID-19 virus became a pandemic in March 2020, the amount of (time-stamped written) data, such as news/newspaper reports, scientific articles, social media posts (e.g.

Blogg (Svenska)

The SwedishGLUE project

Artificial intelligence system dealing with (human) natural language rely on language models, predictions of which words occur together. To better understand how such models work -- and where they fail -- when applied to Swedish texts we need Swedish test data.

Blogg (Svenska)

Reflektioner från SLTC 2020

25-27 november gick den åttonde upplagan av SLTC, Swedish Language Technology Conference, av stapeln på Humanisten här i Göteborg. Eller, skulle ha gjort om inte ett visst virus satte stopp för det.

Blogg (Svenska)

How native and non-native speakers talk to each other

We at Språkbanken Text have just released a new corpus of native (L1) and non-native (L2) speech in four languages: English, Spanish, French and Italian.

Nyhet (Svenska)

Miljoner till projekt om terrorismens historia

Det tvärvetenskapliga projektet SweTerror tilldelas drygt 22 miljoner kronor i årets utlysning av Digitalisering och kulturarv (DIGARV). Projektet förenar talteknologisk och humanistisk analys och är ett samarbete mellan Språkbanken Tal vid Kungliga tekniska högskolan (KTH), Centrum för digital humaniora (CDH) och Språkbanken Text vid Göteborgs universitet.
Nyhet (Svenska)

Nu utökas Sägenkartan

Hästskötande tomtar och en självspinnande spinnrock är bara två av tusentals exempel på möten med det övernaturliga. Nu utökas Sägenkartan med drygt 3 100 finlandssvenska berättelser från de svensktalande områdena i Finland och Estland kring sekelskiftet.
Blogg (Svenska)

Pseudonymization of learner essays as a way to meet GDPR requirements

This blog is based on the author's (Elena Volodina's) joint research with Yousuf (Samir) Ali Mohammed, Arild Matsson, Beáta Megyesi and Sandra Derbring

Blogg (Svenska)

Structural markup of Swedish newspapers

Newspapers contain complex layout and content structure. While layout refers to margins, white spaces, columns, placement of headings etc, content refers to the information inside a paragraph such as type of content in the paragraph, is it enumeration, bullet lists, addresses, etc.

Blogg (Svenska)

Flerordingar: ord som består av flera delar

När vi tänker på ord så tänker vi oftast på enheter som i text omges av blanksteg (mellanrum): 'huset', 'superstor', 'bloggade'. De flesta skulle nog säga att 'idag' är ett ord, men hur är det om vi skriver det (också rättstavat) 'i dag' då? 'Mont Blanc-tunneln'? 'Röda blodkroppar'?