Skip to main content

Blog

Blog Nina Tahmasebi

Change is key! 6-year RJ Program funded!

In Michelangelo’s depiction of Moses, a marble statue commissioned by Julius II, we can see that Moses has horns.But why does Moses have horns?
Blog Niklas Zechner

Jupiter Descending

Those of you who are interested in astronomy may have noticed that you can currently see Jupiter in the night sky. Jupiter is in opposition (with the sun) – in other words, it's on the opposite side of us from the sun. That makes it easier to see, for a couple of reasons.
Blog Niklas Zechner

Vilket ord är bäst?

I förra blogginlägget fick vi läsa om korsord, en populär sysselsättning så här under sommarmånaderna. En relaterad hobby om man vill vara lite mer social är förstås att spela Scrabble – även känt under det svenska namnet Alfapet, samt i olika digitala versioner, bland annat Wordfeud.
Blog Peter Ljunglöf

Gör ditt eget korsord!

Snart är det semester, och då är korsord en klassiker.
Blog Aleksandrs (Sasha) Berdicevskis

Documentation: a (fictional) sad story with a (real) happy ending

This post is based on joint work with Gerlof Bouma. Illustrations by Jan and Julija.Here's a sad story (it's fictional, but sad nonetheless).
Blog Elena Volodina

Swedish derivational morphology with CoDeRooMor

This blog is based on a joint work by Elena Volodina, Therese Lindström Tiedemann and Yousuf Ali Mohammed within the RJ-funded project L2 profiles.
Blog Dimitrios Kokkinakis

A Swedish COVID-19 (sv-COVID-19) corpus and its exploration ... smorgasbord

As the COVID-19 virus became a pandemic in March 2020, the amount of (time-stamped written) data, such as news/newspaper reports, scientific articles, social media posts (e.g.
Blog Yvonne Adesam

The SwedishGLUE project

Artificial intelligence system dealing with (human) natural language rely on language models, predictions of which words occur together. To better understand how such models work -- and where they fail -- when applied to Swedish texts we need Swedish test data.
Blog Peter Ljunglöf

Reflektioner från SLTC 2020

25-27 november gick den åttonde upplagan av SLTC, Swedish Language Technology Conference, av stapeln på Humanisten här i Göteborg. Eller, skulle ha gjort om inte ett visst virus satte stopp för det.
Blog Aleksandrs (Sasha) Berdicevskis

How native and non-native speakers talk to each other

We at Språkbanken Text have just released a new corpus of native (L1) and non-native (L2) speech in four languages: English, Spanish, French and Italian.
Blog Elena Volodina

Pseudonymization of learner essays as a way to meet GDPR requirements

This blog is based on the author's (Elena Volodina's) joint research with Yousuf (Samir) Ali Mohammed, Arild Matsson, Beáta Megyesi and Sandra Derbring
Blog Dana Dannélls

Structural markup of Swedish newspapers

Newspapers contain complex layout and content structure. While layout refers to margins, white spaces, columns, placement of headings etc, content refers to the information inside a paragraph such as type of content in the paragraph, is it enumeration, bullet lists, addresses, etc.
Blog Yvonne Adesam

Flerordingar: ord som består av flera delar

När vi tänker på ord så tänker vi oftast på enheter som i text omges av blanksteg (mellanrum): 'huset', 'superstor', 'bloggade'. De flesta skulle nog säga att 'idag' är ett ord, men hur är det om vi skriver det (också rättstavat) 'i dag' då? 'Mont Blanc-tunneln'? 'Röda blodkroppar'?
Blog Elena Volodina

How reliable is sense disambiguation in texts by native and non-native speakers?

(This blog is based on a joint research and publication in collaboration with David Alfter, Therese Lindström Tiedemann, Maisa Lauriala and Daniela Piipponen)
Blog Lars Borin

Grierson’s “Linguistic Survey of India” as open-access digital data resource for studying languages of South Asia

Lars Borin, Anju Saxena, Shafqat Mumtaz Virk, Bernard Comrie
Blog Yvonne Adesam

En syntaktisk beskrivningsmodell för modern svensk text

Sverige har en relativt lång tradition av att skapa en typ av korpus som brukar kallas trädbank. En trädbank är en samling texter som har annoterats (märkts upp) med ordklasser och syntaktisk struktur. Den syntaktiska strukturen för en mening kan ritas upp så att den liknar ett träd.
Blog Elena Volodina

Korp searches in Second Language data

Korp offers a lot of different corpus collections for various types of search (and research). Swedish as a Second Language (L2) is one of the subcategories of the language that can be studied with the help of Korp. At the moment, Korp provides access to five L2 corpora through its interface:
Blog Aleksandrs (Sasha) Berdicevskis

The five lives of Talbanken

This post is about Talbanken, one of the most widely used and important Swedish corpora. There exist at least five versions of this treebank, and the purpose of this post is to reduce ambiguity of the name "Talbanken", which sometimes leads to confusion.
Blog Yvonne Adesam

Om ordklasser för svenska språket

Ordklassindelning används i många språkteknologiska verktyg därför att det är ett sätt att skilja mellan olika användningar av ett ord. Genom ordklasserna kan man enklare söka efter liknande ord och uttryck i stora textmängder, eller skapa en ny text med liknande form.
Blog Nina Tahmasebi

En topic modell bland andra – En data-intensiv forskningsmetodologi 3

I det första avsnittet av denna bloggserie pratade vi om den data-intensiva forskningsmetodologin och gav en övergripande bild.