Computerlinguistik und Digital Humanities

In einem Kommentar zu meinem Kurzbericht von der GSCL 2013 hat Patrick Sahle folgendes geschrieben:

Das finde ich spannend: Computerlinguistik/Sprachtechnologie ist
nach diesem Beitrag KEIN “Teil” von DH, sondern macht (auch) Sachen,
die für DH relevant sind.

Michael, könntest Du ein paar Hinweise dazu geben,
a) wieso CL/ST nicht als Teil der DH aufzufassen sind und
b) wie Du DH definierst, so dass man daraus ableiten kann, welche
CL/ST-Themen für die DH einschlägig/relevant/interessant sind
?
Das würde bei mir vermutlich vieles erhellen.

Ich möchte hier zunächst Frage (a) beantworten, also die Frage, ob Computerlinguistik (CL) und Sprachtechnologie (NLP) ein »Teil« der Digital Humanities sind. Diese Frage führt natürlich direkt zur Frage, was die Digital Humanities sind. In meinem Buch definiere ich sie wie folgt:

The emerging field of digital humanities aims to exploit the possibilities offered by digital data for humanities research. The digital humanities combine traditional qualitative methods with quantitative, computer-based methods and tools, such as information retrieval, text analytics, data mining, visualization, and geographic information systems (GIS).

Nach meiner Definition ist DH also die Ergänzung traditioneller geisteswissenschaftlicher Methoden durch rechnergestützte quantitative Methoden und Werkzeuge zur Beantwortung geisteswissenschaftlicher Forschungsfragen.

Was ist unter CL und NLP zu verstehen? CL und NLP hängen eng zusammen, im üblichen Sprachgebrauch wird CL meist für stärker linguistisch und theoretisch orientierte Forschung verwendet, während NLP nicht umsonst oft auch als »language engineering« bezeichnet wird: Hier geht es nicht um linguistische Forschungsfragen, sondern primär darum, effektive und effiziente Algorithmen, Datenstrukturen usw. für die Verarbeitung natürlicher Sprachen zu erforschen und für praktische Anwendungen nutzbar zu machen. Ein gutes Beispiel dafür ist die aktuelle Forschung im Bereich der maschinellen Übersetzung (MÜ).
Diese Definition nimmt bereits einen Teil der Antwort vorweg: NLP ist meines Erachtens kein Teil der DH, da sich NLP nicht mit geisteswissenschaftlichen Forschungsfragen beschäftigt. Die Situation ist vergleichbar mit der Rolle von NLP in der Pharmaforschung: Biomedizinisches Textmining spielt ein wichtige Rolle, dennoch ist Sprachtechnologie kein Teil der Pharmazie.

Auch wenn NLP kein Teil der DH ist, ist NLP aber eine wichtige Grundlage, oder, wie ich es in meinem Buch (S. 10) ausgedrückt habe: »NLP—and NLP for historical texts in particular—should be considered a foundation for the emerging discipline of digital humanities.«
Wenn Computerlinguistik und Sprachtechnologie nicht das selbe sind, wie sieht es dann mit der Computerlinguistik aus? Die Linguistik wird ja üblicherweise zu den Geisteswissenschaften gerechnet.

Zunächst ist hier zu beachten, dass die Linguistik eine der »naturwissenschaftlichsten« geisteswissenschaftlichen Disziplinen ist; ihre Methoden unterscheiden sich deutlich von – zum Beispiel – der Geschichtswissenschaft oder der Literaturwissenschaft.
Dazu kommt, dass sich die Computerlinguistik in den letzten 50 Jahren weitgehend von der Linguistik emanzipiert hat. Natürlich gibt es noch Forscher in der Computerlinguistik, die linguistische Fragestellungen bearbeiten, der Mainstream hat sich aber stark in Richtung NLP entwickelt. Wissensfreie statistische Verfahren haben sich etabliert, und angesichts der schnellen Erfolge, die man mit ihnen insbesondere in der MÜ erreicht hat, muss man sich heutzutage für regelbasierte, linguistisch motivierte Ansätze oft rechtfertigen. Die geringe Rolle der Linguistik in der Computerlinguistik wird andererseits aber auch seit einiger Zeit innerhalb der CL diskutiert (siehe etwa die Proceedings des EACL 2009 Workshop on the Interaction between Linguistics and Computational Linguistics oder die Artikel Computational Linguistics: What About the Linguistics? von Karen Spärck Jones und What Science Underlies Natural Language Engineering? von Shuly Wintner).

Ich würde daher auch die heutige CL nicht – jedenfalls nicht als Ganzes – als Teil der DH betrachten. Da die CL aber eine der Grundlagen für NLP sind, sind sie auch eine Grundlage für DH.

CL-Forschung mit einer stärkeren linguistischen Ausrichtung – also quasi die »klassische« CL, bei der es um die rechnergestützte Modellierung sprachlicher Phänomene geht, um ein besseres Verständnis von natürlicher Sprache zu erreichen – könnte man durchaus als Teil der DH betrachten, diese Forschung ist aber heute eher in der Korpuslinguistik angesiedelt.
Die Antwort auf die Frage (a) ist jetzt schon recht lang geraten, daher werde ich mich mit (b) in einem weiteren Beitrag beschäftigen.

Quelle: http://dhd-blog.org/?p=2532

Weiterlesen

Kurzer Bericht von der GSCL 2013 in Darmstadt

Die diesjährige Tagung der Gesellschaft für Sprachtechnologie und Computerlinguistik (GSCL 2013) fand vom 25. bis zum 27. September 2013 an der TU Darmstadt statt, mit Workshops am 23. September und Tutorials am 24. September. Ich berichte aus zwei Gründen hier im DHd-Blog über die GSCL 2013: Zum einen hat man mich freundlich darum gebeten, zum anderen wies GSCL 2013 eine bemerkenswerte Anzahl von Beiträgen mit DH-Bezug auf.

Zu den Workshops kann ich leider nichts sagen, da ich am Montag noch nicht in Darmstadt war, hier verweise ich aufs Workshop-Programm. Im Tutorial-Programm am Dienstag waren die Digital Humanities zweifach vertreten, vormittags mit meinem Tutorial »Natural Language Processing for Historical Texts« (Folien), nachmittags mit »Text Analysis and Mining for Digital Humanities« (gehalten von Caroline Sporleder, Universität Trier).

Die eigentliche Konferenz wurde am 25. September mit einem eingeladenen Vortrag »Big Data and Text Analytics« von Hans Uszkoreit (DFKI) eröffnet. Danach gab es zwei parallele Sessions, von denen sich eine mit Sprachverarbeitung für Social-Media-Texten beschäftigte (Melanie Neunerdt, Bianka Trevisan, Michael Reyer, Rudolf Mathar: »Part-of-Speech Tagging for Social Media Texts«, Ines Rehbein: »Fine-Grained POS Tagging of German Twitter Data«, Manuel Burghardt, Alexander Bazo, Christian Wolff: »TWORPUS – An Easy-to-Use Tool for the Creation of Tailored Twitter Corpora«) und die andere mit computerlinguistischen Themen (Sabine Schulte Im Walde, Maximilian Köper: »Pattern-based Distinction of Paradigmatic Relations for German Nouns, Verbs, Adjectives«, Noëmi Aepli, Martin Volk: »Reconstructing Complete Lemmas for Incomplete German Compounds«, Thomas Bögel, Anette Frank: »A Joint Inference Architecture for Global Coreference Clustering with Anaphoricity«).

Nach der Mittagspause trugen die Kandidaten für den GSCL-Preis für die beste studentische Abschlussarbeit vor:

  • Marcel Bollmann (Ruhr-Universität Bochum): »Automatic Normalization for Linguistic Annotation of Historical Language Data« – auch das ein Thema mit starkem Digital-Humanities-Bezug –,
  • Yevgen Chebotar (TU Darmstadt): »Dialog Act Classification in Wikipedia Discussion Pages« und
  • Steffen Remus: »Automatically Identifying Lexical Chains by Means of Statistical Methods – A Knowledge-Free Approach«.

Im Anschluss fand die Mitgliederversammlung der GSCL statt. Aus DH-Perspektive ist insbesondere berichtenswert, dass die Mitglieder einstimmig die Einrichtung des Arbeitskreises »CL4DH: Computerlinguistik für Digital Humanities« guthießen. Der Arbeitskreis wird von Anette Frank (Universität Heidelberg) und Anke Lüdeling (HU Berlin) geleitet. Ziel des Arbeitskreises ist es, die Leistungsfähigkeit computerlinguistischer Werkzeuge und Verfahren für den Einsatz in den Digital Humanities zu verbessern. Hierfür sollen spezielle Bedürfnisse, Fragestellungen und Interessensgebiete aus den Digital Humanities in eine gemeinsame Forschungsagenda aufgenommen werden. Außerdem sollen Desiderata der aktuellen computerlinguistischen Forschung für das Deutsche analysiert werden, um durch Community-Aktivitäten die Qualität computerlinguistischer Werkzeuge für den Einsatz in den Digital Humanities zu verbessern. Weitere Informationen zum Arbeitskreis finden sich auf seiner Webseite.

Der Donnerstag begann mit einer Poster-Session. Aus einer DH-Perspektive möchte ich hier vor allem die Poster »Technological Support for Older Germanic Languages« (Christian Chiarcos, Timothy Price, Maria Sukhareva) und »Erkennung interpersonaler Relationen in XML-kodierten Texten mit lokalen Grammatiken« (Sophia Stotz, Valentina Stuss) hervorheben.

Bei den folgenden parallelen Paper-Sessions hatte vor allem Claes Neuefeinds Vortrag »Collaboratively Building Corpora – a Case Study for Romansh« einen DH-Bezug. Nach der Mittagspause gab es eine weitere Poster-Session, bei der auch wieder mehrere Arbeiten mit DH-Bezug vorgestellt wurden, etwa »Building and Analyzing a Massively Parallel Bible Corpus« (Thomas Mayer, Michael Cysouw) und »Computational Humanities« (Alexander Mehler, Rüdiger Gleim, Andy Lücking, Giuseppe Abrami, Tim vor der Brück, Zahurul Islam, Armin Hoenen).

Anschließend gab es einen weiteren eingeladenen Vortrag, »Distributed Wikipedia LDA« von Massimiliano Ciaramita. Danach wurde der GSCL-Preis für die beste studentische Abschlussarbeit verliehen, und zwar an Marcel Bollmann – und damit für eine Arbeit mit starkem DH-Bezug, siehe oben. Der Tag endete mit dem sehr gelungenen Konferenzdinner im Biergarten »Zum Scheinheil’gen«.

Der Freitag begann mit dem eingeladenen Vortrag »Multimodal Sentiment Analysis« von Rada Mihalcea und der Verleihung der GSCL-Ehrenmitgliedschaft an Burghard Rieger. Leider konnte ich an der abschließenden Kaleidoskop-Session nicht mehr teilnehmen, an der weitere Arbeiten mit DH-Bezug vorgestellt wurden; dazu gehörten die Vorstellung des Arbeitskreises »Computerlinguistik für Digital Humanities« durch Anette Frank und Anke Lüdeling, »Digital Humanities Text Analysis: Needs and Deeds« von Sabine Bartsch und Andrea Rapp, »SeNeReKo – Netzwerkanalyse für die Religionsgeschichte« von Frederik Elwert und »Graph Databases for the Exploration of Large Corpora in the eHumanities« von Thomas Efer.

Je nach Forschungsfrage sind natürlich noch weitere als die genannten Vorträge und Poster für Forscher in den Digital Humanities interessant; ich habe mich hier auf die beschränkt, bei denen der Bezug explizit ist und verweise auf die Proceedings. Festzuhalten ist auf jeden Fall, dass die Digital Humanities in der Computerlinguistik als interessantes Anwendungsgebiet wahrgenommen werden und sich als solches auch etabliert haben.

 

 

Quelle: http://dhd-blog.org/?p=2418

Weiterlesen

Neue Publikation: «Global Perspectives on Digital History»

Das Roy Rosenzweig Center for History and New Media (CHNM) an der George Mason University in Fairfax hat kürzlich das Projekt PressForward lanciert. Das von der Sloan Foundation grosszügig mitfinanzierte Projekt hat zum Ziel, neue Formen des wissenschaftlichen Publizierens im Kontext digitaler Medien zu erproben. PressForward besteht aus zur Zeit fünf Publikationen, die sich nicht [...]

Quelle: http://weblog.hist.net/archives/5679

Weiterlesen