23 September 2008

FAZ-Testbericht über Dragon NaturallySpeaking 10

In der FAZ vom heutigen Dienstag, 23. September 2008, wird endlich der Testbericht von Michael Spehr über das neue Dragon NaturallySpeaking 10 abgedruckt. Mit gewohnter Sorgfalt wird die Erkennungsgenauigkeit gegenüber der Vorversion getestet und tatsächlich als besser erkannt, werden die Neuerungen aufgelistet und auch die immer noch vorhandenen Lücken und Fehler genannt.

Einige kleine Ergänzungen möchte ich vornehmen: es wird das längst überfällige neue Merkmale erwähnt, dass man Datumsangaben und Zahlen Formatierungen jetzt einstellen kann. Leider ist dabei ein kleiner Fehler unterlaufen - ich habe nicht die Möglichkeit, frei zu definieren, ab welcher Zahl Zahlen nur noch als Ziffern geschrieben werden sollen. Auch die Vorgehensweise, einen bereits trainierten Sprecher einfach in die neue Version zu übernehmen und ein Upgrade zu machen, ist ein wenig fragwürdig, auch wenn es im vorliegenden Fall zu einem guten Ergebnis geführt hat - nach meinen Erfahrungen kommen beim Upgrade gerne einmal Fehler in das Vokabular, davon abgesehen, dass ein alter Sprecher die neuen Möglichkeiten der Software nie ganz ausnutzen kann.

Abgesehen von diesen kleinen Anmerkungen allerdings wirklich ein sehr guter und kompetenter Artikel, der den aktuellen Stand in der Spracherkennung objektiv wiedergibt. Wer ihn bei mir bestellen will, sende bitte eine E-Mail an meine Adresse: Stephan [@] soldatkuepper.de.

17 September 2008

Spracherkennung für Interviews

In der FAZ vom 16. September 2008 stellt Michael Spehr die Möglichkeiten vor, Spracherkennung für die Transkription von Interviews zu nutzen. Sein Fazit: derzeit ist Spracherkennung noch nicht reif dafür.

Gründe sind dafür vor allen Dingen die meist schlechte Qualität der Sprache, dann aber auch die Tatsache, dass ein Sprecherprofil für jeden Sprecher angelegt werden muss, damit die Sprache adäquat verschriftlicht werden kann.

Als Alternativen schlägt er ein "Echo-Diktat" vor, das heißt also das gleichzeitige Abhören und Nachsprechen des Interviews durch einen geschulten Diktanten. Dies erfordert allerdings sehr große Übung unter hoher Konzentration. Hier wendet man sich am besten an Profis. So gibt es inzwischen das Berufsbild des Schriftdolmetschers, der mithilfe von Spracherkennung das gesprochene Wort nahezu in echt zeit in geschriebenen Text umsetzen kann - wobei allerdings entsprechendes Training vorausgesetzt wird. Weitere Informationen dazu unter www.kombia.de.

Wer den Artikel verpasst hat und per E-Mail von mir erhalten möchte, melde sich bitte unter stephan [at] soldatkuepper.de!

Zum Thema Sprecherprofil übrigens noch die Anmerkung, dass inzwischen Dragon NaturallySpeaking mit einem komplett untrainierten Sprecher, für den bloß das anfängliche Ritual zum Einstellen des Mikrofons absolviert wurde, hervorragende Ergebnisse erzielt - und das unabhängig davon, ob ein Mann oder eine Frau das Mikrofon eingepegelt hat. Vielleicht wäre dies noch einmal einen Versuch wert?

12 September 2008

Dragon NaturallySpeaking 10 - erste Erfahrungen

Inzwischen habe ich Dragon NaturallySpeaking 10 Professional auf zwei Rechnern installiert und kann erste Erfahrungen mitteilen.

1. Installation:
Die Installation ging auf einem sauberen Rechner und als Upgrade gleichermaßen glatt, sofern man die setup.exe startet - DNS 10 erwartet eine Visual C++-Runtime, die der MSI-Installer nicht it installiert, die Setup.exe aber schon.
Das Upgrade der Sprecher schlug fehl, aber wohl deshalb, weil der eine ein 4voice (d.h. geschütztes) Vokabular hatte, das DNS allein nicht lesen kann. Bei den Rechnern handelt es sich zum einen um ein Notebook mit Windows XP Pro, Intel CoreDuo T2500 mit 2 GHz, 1 GB RAM; der andere ein Desktop PC mit Windows Vista, 2 GB RAM, AMD Sempron 3400+, 1,8 GHz,

Bei der benuterdefinierten Installation lassen sich jetzt Format- und allgemeine Optionen getrennt einstellen; die Komposita können schon hier abgewählt werden. Außerdem ist die umstrittene Datensammlung mit dabei, kann aber ebenfalls ausgeschaltet werden.

2. Erkennungsgenauigkeit:
Für einen ersten Vergleich zwischen der alten und neuen Version habe ich einfach zwei Mikrofone benutzt, eines (Olympus DR-1000) am Windows XP-Rechner, auf dem zu diesem Zeitpunkt noch Dragon 9.5 installiert war, das andere (VXI Parrott TalkPro-Headset) am Vista-Rechner mit DNS 10 angeschlossen. Den DNS 9-Benutzer habe ich seit Juni im täglichen Einsatz, der DNS 10-Nutzer war völlig neu angelegt.

Die Ergebnisse unterschieden sich zwar in den konkreten Fehlern, numerisch ist das Ergebnis gleich: jeweils 8 Fehler auf 671 Wörter. Nicht gewertet wurde die Zahlenformatierung (s.u.), in der DNS 10 klar die Nase vorn hat. Interessant ist, dass DNS 10 seinen Namen nicht erkennt: "Dragon NaturallySpeaking" wurde bei jedem Vorkommen anders geschrieben (was strenggenommen die Fehlerquote auf 14 erhöht hätte, doch habe ich das Wort nur einmal gewertet).

Bei diesem Test sprach ich bewusst deutlich. Bei undeutlicher Aussprache - wie sie sich im Laufe des Tages immer mehr einschleicht - kann ich noch keine genauen Aussagen treffen. Nach den Ergebnissen, die ich gestern Abend zwischen 21 und 22:00 Uhr hatte, scheint aber auch hier die Erkennung besser zu verlaufen. Eine gute Nachricht für alle Praktiker, die viel diktieren müssen, auch wenn sie müde sind, und bisher dafür mit schlechterer Erkennungsgenauigkeit bestraft wurden.

3. Systemressourcen:

Unter Windows Vista ließ sich DNS 10 mühelos installieren, meldete aber die Deaktivierung der natürlichen Sprachbefehle für Word und Excel aus Speichergründen. Offensichtlich ist diese Kombination also für Dragon 10 schon schwach. Die Erkennung lief allerdings flüssig und vom Tempo ähnlich wie auf dem XP-Notebook mit DNS 9.5.

Die eigentliche Überraschung: Die Installation auf dem XP-Notebook lief ohne Warnung vor mangelnden Ressourcen, und die Erkennung verläuft tatsächlich flüssiger als mit DNS 9.5! Offensichtlich ist Vista schuld, denn Michael Spehr berichtete mir dasselbe.

Überhaupt scheint die Spracherkennung nach allem, was man hört, wesentlich flüssiger zu verlaufen - auch aus anderen Ecken vermeldet man das gleiche. Schön, dass sich die Befürchtungen hier einmal nicht bewahrheitet haben - bisher hat Dragon NaturallySpeaking in jeder Version das System immer stärker in Anspruch genommen. im Task Manager belegt Dragon NaturallySpeaking jetzt allerdings ungefähr 200.000 KB Speicher, vorher waren es 140.000 KB.

4. Zahlen:
Fast alles, was uns geärgert hat, ist verschwunden: eine 53 jährige Patientin geht in beiden, aber eine drei bis 4 m lange Bremsspur, eine fünf bis 6 cm große Narbe oder gar ein 7 x 8 cm großes Bild wird von DNS 9.5 wie angezeigt geschrieben, von DNS 10 in allen Fällen korrekt. Auch das Datum scheint besser zu sein, mit Ausnahme des 23. EIne Folge von Ziffern wird korrekt geschrieben, also 089244104445 statt null acht neun zwei vier vier eins null vier vier vier fünf. Paragraph drei, Abs. 4, [Ziffer] 5 ist komplett identisch. Ein Fehler macht sich allerdings bei Maßeinheiten bemerkbar - im Kochrezept werden drei Eier, 4 g Mehl, 5 l Wasser (nein, Sie brauchen das nicht essen) als drei Eier ,4 g Mehl ,5 l Wasser geschrieben, das Komma also falsch gesetzt.

5. Neuigkeiten:
Alle Neuheiten habe ich noch gar nicht ausprobiert und kann sie daher auch nicht vermelden. Was wirklich Spaß macht, ist die Möglichkeit, mit einem einzigen Befehl ein Wort oder mehrere Wörter zu formatieren oder zu löschen. Man sagt in Microsoft Word zum Beispiel "fett Dragon NaturallySpeaking", und der Ausdruck wird sofort fett gesetzt. Analog funktioniert auch "lösche Dragon NaturallySpeaking", was eine Funktion ist, die schon von vielen Benutzern angefragt wurde - zumindest haben viele Leute, die ich trainiert habe, intuitiv versucht, mit diesem Befehl ein Wort zu löschen, und waren sehr enttäuscht, als es nicht ging.

Weitere Ergebnisse in Bälde!

Anwenderstimmen DNS 10 Wireless / Plantronics Calisto Headset

Dragon NaturallySpeaking Preferred Wireless Edition wird seit neuestem mit einem Plantronics Calisto-Headset geliefert, das nach Aussagen des Herstellers optimiert für Spracherkennung wurde. Da dieses Gerät bisher nur in den USA lieferbar war, liegen in Deutschland keine Erfahrungen vor, wie gut es tatsächlich ist. Ich erhalte in den nächsten Tagen ein Gerät zum Test, damit ich dazu etwas Fundiertes sagen kann, bisher sind die Anwenderberichte gemischt. In der Firma wurde das Gerät zum Beispiel positiv getestet, allerdings nicht von mir ;-)

Dieser Anwenderbericht steht in der Yahoo-Usergroup für Dragon NaturallySpeaking zu lesen:

Die Erkennungsgenauigkeit unter Calisto ist sehr eingeschränkt. Die Wiedergabe wird begleitet von einem unangenehmen Hintergrundgeräusch inklusive Knattern und Rauschen.
Die Software wurde auf zwei neuen Rechnern (Vista/XP) mit den jeweils gleich schlechten Resultaten, (Erkennungsgenauigkeit 15), getestet.
Bei Plantronics sagte man mir, dass der Support in Deutschland abgelehnt wird, weil es absehbar war, das die Bluetooth Übertragung wesentlich schlechter wäre als der DECT Standard des CS 60.
Nuance in Edinburgh will aber kein CS 60 als Ersatz anbieten. Das defekte Gerät habe ich mittlerweile eingeschickt.
Zu Dragon 10 ist generell zu sagen, dass es flüssiger läuft, als die
Vorgängerversion 9.5.

Hier scheint ein Defekt am Gerät vorzulegen, der für die genannten Probleme sorgt.

Ein Händler bestätigt, dass er zu diesem Headset sehr unterschiedliche Reaktionen gehabt hat. Von der Distribution weiß ich, dass die professionellen Versionen nach wie vor mit einem Plantronics CS 60 gebündelt werden - was aber auch damit zusammenhängt, dass zum Beispiel in einem Krankenhaus ein Bluetooth-Headset in aller Regel gar nicht installiert werden kann.

Der Vollständigkeit halber sei aber auch gesagt, dass die Zahl, die im Audioassistenten von Dragon NaturallySpeaking erreicht wird, nicht unbedingt etwas über die Erkennungsgenauigkeit aussagt. Ein Bluetooth-Headset erreicht hier schon allein deswegen einen niedrigeren Wert, weil hohe Frequenzen erst gar nicht übertragen werden - dafür ist der Bluetooth-Standard nämlich nicht ausgelegt. In der Praxis muss sich das übrigens gar nicht in einer schlechteren Erkennungsgenauigkeit niederschlagen, wie andere Erfahrungen von Anwendern mit Bluetooth-Headsets belegen. Hier wie überall gilt, das der Diktierstil einen wesentlich größeren Einfluss auf das Ergebnis hat als das Mikrofon.

Ich würde gern weitere Stimmen speziell zu diesem Headset hören. Wer hat es getestet? Schreibt!

Ich diktiere Teile dieses Beitrags übrigens mit dem neuen Dragon NaturallySpeaking 10 und einem Olympus-Handmikrophon und kann bestätigen, dass das Diktat tatsächlich sehr viel flüssiger läuft. Außerdem erkennt die Spracherkennung jetzt endlich das Wort "Bluetooth". Ist das ein Grund für ein Upgrade?

10 September 2008

Peinlicher Spracherkennungsfehler

Peinliche Panne für Augsburger Staatsanwalt ging es durch die Schlagzeilen, als ein Augsburger Staatsanwalt einen Angeklagten als "A****loch" titulierte; - der Herr entschuldigt sich damit, er benutze Spracherkennung, habe sogar Korrektur gelesen, aber dann die unkorrigierte Version des Dokuments verschickt.

Was lehrt uns das?

1. Korrektur muss immer sein, übrigens auch bei getippten, handschriftlichen und sonstwie produzierten Dokumenten.
2. Sorgfältiges Arbeiten hat seine Vorteile.
3. Dragon kennt auch die schlimmen Wörter - übrigens auch in V. 10, ich hab nachgeschaut...

Es soll Händler geben, die in ihren Wortschätzen diese Wörter löschen.

03 September 2008

Ich bin Feuerwehrmann geworden (Werbung für die andere Dragon-Informationsquelle)

Das beste Forum zu Dragon NaturallySpeaking im deutschsprachigen Raum wird von Willy Sander angeboten. Eine Besonderheit ist es, dass alle "kleinen Drachen", also alle Forumsteilnehmer, eingedenk einer beliebten Fernsehserie für Kinder zuerst als Grisu angemeldet werden - so auch ich. Seit langem schrieb ich in diesem Forum und rief nach jedem Beitrag wie Grisu: "ich will Feuerwehrmann werden!" Seit heute bin ich es - nach dem 50. Beitrag wird man befördert.

[Edit]: Ich erwähne dies nicht aus reiner Eitelkeit, sondern weil der Foren-Thread zum Thema "wie diktiere ich CO2 so, dass die Zahl tiefergestellt wird" läuft und daher vielleicht für manche Leser interessant ist. Wir haben inzwischen einen guten Ansatz gefunden, mit dem sich zumindest in Word das Problem umgehen lässt, dass Dragon keine Indizes und tiefergestellten Ziffern schreiben will. Zu den Ergebnissen verweise ich an das Forum; die Befehle versende ich gern auf Anfrage direkt.

Und jetzt habe ich hoffentlich noch ganz viel Zeit, um mich endlich Dragon NaturallySpeaking 10 widmen zu können. Erste Erfahrungen demnächst hier!

26 August 2008

Dragon 10-Kaffeesatzleserei

Ein paar Neuerungen von Dragon 10 habe ich letztens schon genannt; eine Menge steht in den Werbemails, die Nuance im Moment verschickt - aber was brigts tatsächlich auf dem Feld der Erkennung?

Die angekündigte, um 20% verbesserte Erkennungsgenauigkeit geht wirklich an die Grenze des Wahrnehmbaren: wo DNS 9 10 Fehler macht, macht DNS 10 nur noch 8. Ob das so viel ausmacht? "Da aber schon Dragon 9 im IDealfall nur eines von hundert Wörtern missverstand, ist dies nicht sehr brisant" - schreibt Dorothee Wiegand in der aktuellen c´t, weiß darüber hinaus aber auch noch nichts Neues.

Für mich wäre viel spannender zu erfahrten, wie die neue Version mit undeutlicher Aussprache und Dialekten umgeht. Da gab es schon mal einen Sprung, als - man höre und staune - die Erkennungsgenauigkeit weiblicher Stimmen an die der Männer angeglichen wurde (war das in DNS 8?) Bei mir hat sich ein Kunde allen Ernstes darüber beschwert, dass Dragon am Abend schlechter erkenne als am Morgen - ob denn die Software müde würde? An ihm konnte es ja nicht liegen. Für mich werden aber genau hier die Schlachten der Zukunft geschlagen, und zumindest bei Nuance Deutschland ist man sich dessen bewusst. Auch das heißt aber nichts, bis das mal nach USA dringt...

Zum Thema Hardware, um Missverständnisse zu vermeiden: Die Mindestanforderungen sind nicht gestiegen, die empfohlenen Ressourcen haben sich mal eben verdoppelt. Wer daraus ableitet, DNS 10 habe keine höheren Systemansprüche als die Vorversion, beschönigt da wohl etwas. Wie es im Vergleich zu DNS 9 auf demselben Rechner aussieht, muss ich aber auch erst noch testen - mein Urlaub ist noch nicht vorbei, außerdem ist DNS 10 noch gar nicht erhältlich...

Stay tuned!

24 August 2008

Nuance und 4voice statten die nordrhein-westfälische Justiz aus

Nuance Pressemitteilungen Sind mir normalerweise keine Hinweise wert, in diesem Falle aber schon, weil hier eine Geschichte zum vorläufigen Abschluss kommt, die bereits seit meinem Eintritt bei der 4voice AG vor sich hin geköchelt hat: die Ausschreibung für die Justiz in Nordrhein-Westfalen. Eine Ausschreibung, die angefochten wurde, ein neues Ergebnis, die Auslieferung, Produkte, die nicht abgenommen worden und wieder zurückgegeben wurden - die Geschichte nahm kein Ende, und so ist es schon mit einer gewissen persönlichen Genugtuung verbunden, wenn Nordrhein-Westfalen sich jetzt doch wieder für den Anbieter entscheidet, der schon am Anfang eigentlich den Zuschlag erhalten sollte.

Soviel Stolz muss sein :-)

"Wie können sie jetzt Urlaub machen?" - weil doch DNS 10 da ist

"Wie können sie jetzt Urlaub machen?" - fragt mich einer meiner treuesten Leser und verweist auf die durch alle Newsticker gehende Agenturmeldung, dass Dragon NaturallySpeaking 10 jetzt erscheint.

Dabei ist noch gar nicht klar, wann es tatsächlich in die Läden kommt - nach meiner Information beginnt die Auslieferung Ende August. Nuance hat gar selbst noch die Version 9 auf der Website angekündigt.

Alles Neue habe ich aber schon vor meinem Urlaub onlinebestellkompatibel angekündigt. Wer also meine detaillierten Beschreibungen von Dragon NaturallySpeaking 10 lesen will, folge dem Link.

Der Fairness halber sei nicht unerwähnt, dass ich auch noch keine Vollversion 10 habe und mich daher auf Betas und Vorführungen verlassen muss, außerdem auf die Produktankündigungen des Herstellers.

Was auf jeden Fall cool wird, ist die Möglichkeit, in Befehle Variablen einzubauen, die nicht aus einer Liste stammen, sondern quasi frei sagbar sind. Dem Endanwender wird das v.a. an den Funktionen auffallen, die mit großem Aufwand angekündigt werden - der Möglichkeit, mit einem einzigen Sprachbefehl im Web zu suchen ("suche nach China-Restaurant in Berlin-Mitte"), und der Möglichkeit, ein Wort ohne vorheriges Markieren sofort zu formatieren ("schreib Dragon fett"). Dahinter steckt eine neue Technologie, die Variablen in Befehlen zulässt, welche nach Bedarf "gefüllt" werden können. Solche Variablen sollen demnächst auch in anderen Sprachbefehlen möglich sein, sicher weiß ich es von Textbausteinen, in denen man also beispielsweise einen kompletten Brief ablegen kann, bei der man bloß die Anrede als Variable markiert und dann per Sprache anspringt. Ob auch Skript-Befehle auf diese Weise möglich sein werden, wird sich zeigen - hier tun sich ungeahnte Möglichkeiten auf.

Gespannt bin ich darauf, welche Fehler und Ärgernisse der Version neun in Dragon NaturallySpeaking 10 ausgebügelt werden. Z.B. wird es möglich sein, einzustellen, welche Zahlen als Ziffer geschrieben werden sollen und welche nicht, so dass das lästige Formatieren im Vokabular oder aber korrigieren von Hand im Text oder der Befehl "schreib das als Zahl" weitestgehend der Vergangenheit angehören dürften. Wer, wie ein Arzt, eigentlich alle Zahlen als Ziffern braucht, stellt das einfach über ein Menü ein und fertig. Wie gut dann aber die Erkennungsgenauigkeit ist, muss auch die Praxis zeigen. Von der Beta-Version weiß ich, dass es hier noch Potenzial nach oben gab.

Andere Kleinigkeiten fallen mir kaum mehr auf, z.B. dass der Befehl "zum Absatzende" stillschweigend verschwunden ist. Vielleicht taucht er ja in der neuen Version wieder auf?

Stutzig machen mich die Systemvoraussetzungen, die mal wieder das Potential aktueller Hardware voll ausschöpfen (will sagen: auf älteren Rechnern die Grenze der Leistungsfähigkeit erreichen). Auch vor dem Hintergrund, dass Nuance die Spracherkennungstechnologie von Dragon NaturallySpeaking demnächst für Handys zur Verfügung stellen möchte, erscheint mir das nicht unbedingt zielführend. Ich bin sowieso gespannt, wohin diese Entwicklung noch geht - die Endgeräte werden immer leichter, Anwendungen werden im Netz zur Verfügung gestellt, aber meine Spracherkennung braucht (teilweise als letzte Anwendung) einen richtig leistungsstarken Prozessor und jede Menge Arbeitsspeicher. Hier bin ich sehr auf die nächsten Entwicklungen gespannt.

Das Kernstück, die Erkennungsgenauigkeit, kann ich natürlich ohne eine endgültige Version nicht beurteilen. Hier bin ich sehr gespannt, wenn mich das Paket erreicht, wie Dragon NaturallySpeaking 10 wohl im Vergleich zur Vorgängerversion abschneiden wird. Sie erfahren als erste davon - sobald ich aus dem Urlaub zurück bin!

08 August 2008

Ich bin dann mal weg.

When Your Computer Listens to You | New York Times Video

Mit diesem Beitrag verabschiede ich mich zunächst mal in den Urlaub - genau wie der freundliche Herr, der in dem Video zu sehen ist. Nur dass ich nicht nach Hawaii fliege, sondern nach Kreta. Das Video hat aber trotzdem alles mit dem Thema diese Blogs zu tun - aber das darf ich nicht sagen...

Ich melde mich dann bei Gelegenheit wieder mit meinen Netznotizen zu selbigem Thema!

05 August 2008

Linguatec kündigt neue Version seines Spracherkennungsprogramms Voice Pro an

Erster! Ich zitiere:

Der Münchner Sprachtechnologie-Experte Linguatec plant für Herbst 2008 die vollständig überarbeitete Neuauflage seines Spracherkennungsprogramms Voice Pro. Die Vorversion war 2004 Testsieger der Stiftung Warentest im Vergleich der Spracherkennungsprogramme.

Das Interesse an Spracherkennung ist immens. Kein Wunder – das Verfassen von Texten vielfältigster Art ist aus unserem beruflichen und privaten Alltag nicht wegzudenken, und wer würde nicht gerne „wie von Zauberhand“ schreiben können. Diktieren statt Tippen bedeutet eine spürbare Arbeitserleichterung und Entlastung für den Anwender. Auch Surfen und die Steuerung des Computers sind per Spracheingabe mühelos möglich.

Das Verblüffende an Spracherkennung ist die Geschwindigkeit, in der das Diktierte festgehalten wird. Nicht jeder kann von sich behaupten, so schnell zu tippen, wie er sprechen kann. Noch dazu sind beim Diktieren Rechtschreibfehler ausgeschlossen. In Kombination mit einer Erkennungsgenauigkeit von bis zu 99% bedeutet dies eine enorme Effizienzsteigerung für jede Schreibaufgabe.

Nach zwei Jahren intensiver Entwicklungsarbeit steht nun fest: Die neue Version der Spracherkennungssoftware Voice Pro kommt im Herbst auf den Markt. In einer engen Zusammenarbeit mit führenden Hochschulen in Deutschland, Österreich und der Schweiz wurde der Grundstock für eine neue Generation von Spracherkennung geschaffen. Besonderes Augenmerk legt die neue Version Voice Pro auf den Einsatz unter Windows Vista, eine deutlich verbesserte Erkennungsgenauigkeit und eine intuitive Bedienung.


Vista-Unterstützung war ja auch mal fällig, nicht wahr, Rike :-)

Ich bin gespannt, ob auch die Erkennungsmaschine mal überarbeitet wurde oder ob immer noch das alte ViaVoice vor sich hin werkelt. Ein Vorteil sind sicherlich die geringen Ansprüche, die die Software dann an den Rechner stellt. Wie es sich in der Praxis schlägt, werden wir nach Erscheinen feststellen.

Heute abend präsentiert Nuance in München übrigens auch neue Technologien. Obwohl in der Einladung von einem zehnfingrigen Drachen die Rede war, werde ich frühestens morgen erfahren, was es denn zu sehen gab und welche Wundertiere uns demnächst von dieser Seite ins Haus stehen, die dann bestimmt mächtig hungrig sind (nach GHz, RAM und so). Sicher weiß ich nur, dass ein sprachgesteuertes Auto zu sehen sein wird, weswegen das Event nicht im BMW-Tower stattfinden wird.

Test: Philips LFH 331 Ohrhörer-Mikrofon-Kombination

Ich habe mir testweise die Philips-Ohrhörer-Mikrophon-Kombination LFH 331 8zu sehen unter http://www.dictation.philips.com/index.php?id=53&CC=DE) für das digitale Diktiergerät DPM 9600 kommen lassen und gestern unter verschärften Bedingungen getestet - im doch recht starken Wind, an der Kreuzung Skalitzer Straße/Schlesische Straße in Berlin-Kreuzberg.

Vorgabe war festzustellen, ob das Gerät eine vernünftige Geräuschunterdrückung bietet.

Leider scheint es so zu sein, dass das Mikrophon keine spürbare Verbesserung bei der Aufnahme bringt. Dies mag am Wind liegen, der alles andere übertönt; aber auch was die Nebengeräusche durch Autos angeht, kann ich nicht wirklich eine qualitative Veränderung feststellen. Dies bezieht sich explizit auf die Spracherkennung eines aufgenommen Diktats, die Qualität des Diktats scheint mir subjektiv besser zu sein. Die Sprache selbst klingt klarer als durch das eingebaute Mikrophon des Diktiergerätes.

Das erste Fazit ist also, dass das Gerät durchaus dafür geeignet ist, in vertraulichen Situationen zu diktieren, in denen man nach Möglichkeit niemand mithören lassen will. Vor allem das abhören des Diktats geschieht für die Außenwelt geräuschlos; das Diktat selbst produziert natürlich immer noch gesprochene Sprache :-) Auch ein Diktat im Auto, bei dem ich die Hände weitgehend frei haben will, ist gut möglich; der Vorteil besteht halt darin, die Hände frei zu haben.

Um aber in einer lauten Umgebung Nebengeräusche herauszufiltern, würde ich ein anderes Gerät nehmen, also eines der Aufsteckmikrofone, die alle drei Anbieter im Programm haben.

So ist das eben - für jede Situation die passende Lösung. Leider nicht eine Lösung für alle Situationen...

22 Juli 2008

Fußschalter neu erfunden! (Belesenheit schützt vor Neuentdeckungen)

Michael Spehr macht mich aufmerksam auf einem Beitrag des hessischen Rundfunks, indem die Erfinder des Fußschalters für computergestützte Konstruktion von digitalen Diktaten erfunden werden - und Überraschung: es handelt sich um zwei Studenten aus Hessen. "Belesenheit schützt vor Neuentdeckungen" - pflegte mein verehrter Lehrer zu sagen.

Den Vorwurf brauchen wir den Erfindern gar nicht zu machen. Wie der Webseite der beiden Studenten zu entnehmen ist, sind sie sich durchaus dessen bewusst, dass es auch professionelle Diktiersysteme anderer Hersteller mit entsprechenden Fußschaltern gibt. Der Redakteur des hessischen Rundfunks scheint allerdings die nötigen Klicks nicht gemacht zu haben; er porträtiert die beiden tatsächlich so, als wäre ihr Gerät - welches übrigens mit einer einzigen Taste auskommt und daher für jede Sekretärin indiskutabel ist - tatsächlich der erste seiner Art für Computer.

Und weil ich im Gegensatz zum hessischen Rundfunk Webseiten gerne etwas genauer anschaue, erfahre ich bei der Gelegenheit, dass es tatsächlich die Firma NCH in Australien noch gibt, die irgendwann eine kostenlose Software zur Verfügung gestellt haben, mit der sich DSS-Dateien abspielen lassen - sehr zum Ärger der drei Großen, die nicht nur das Format erfunden haben, sondern auch eifrig Lizenzgebühren dafür kassieren.

Letztlich eine Bastellösung, die für Studenten sicherlich vollkommen ausreicht, aber kein professionelles Diktatmanagement ersetzen kann. Deshalb wird auf der Website auch das Diktiersystem von Olympus als professionelle Workflow-Lösung mit verkauft.

Als Fußnote:

Die Betreiber haben das Sonderangebot von Olympus, ein WS-110 digitaler Notetaker im Paket mit Dragon NaturallySpeaking "Recorder Edition", getestet, stellen den Test inklusive Korrekturen auf der Webseite zur Verfügung, und siehe da - die Spracherkennung schlägt sich mehr als tapfer! Wenn wir davon ausgehen, dass die meisten Wörter, die nicht erkannt wurden, nicht vorher zum Wortschatz hinzugefügt worden, wie sich das eigentlich gehören würde, ist die Umsetzung tatsächlich fast fehlerfrei.

21 Juli 2008

Vortrag: Spracherkennung für Übersetzer - jetzt erhältlich

Der Vortrag "Spracherkennung als Hilfsmittel für einen modernen Übersetzer-Arbeitsplatz", den Cornelia Soldat und ich am 24.06.2008 in der Humboldt-Universität zu Berlin gehalten haben, ist jetzt transkribiert und als Manuskript erhältlich. Interessenten senden bitte eine kurze Mail an
cornelia.soldat [at] cs-spracherkennung.de.

16 Juli 2008

Google Lets You Search for Text in Some Videos

Google lässt Sie in Videos nach Text suchen - schreibt das Blog www.blogscoped.com.

Was hier vorgestellt ist, ist eigentlich Audio Mining und als solches eine schon lange gehegte Begehrlichkeit: Große Mengen von gesprochenem Text werden per automatischer Spracherkennung verschriftlicht und nach bestimmten Schlüsselwörtern durchsucht. (Erinnert sich noch jemand an die Witze nach dem 11. September, als man am Telefon so Sätze wie "Ich bin laden, sprach der LKW-Fahrer" sagte, um den CIA einzuschalten?)

Google hat dies jetzt weitergeführt: YouTube-Videos können nach bestimmten Wörtern durchsucht werden und die Suchmaschine gibt das passende Video aus, komplett mit Markierung, wo der Suchbegriff zu hören ist. Verfügbar ist das im Moment für Videos der amerikanischen Präsidentschaftskandidaten; die direkte URL ist http://speech.clients.google.com/elections2008videosearch/gadget.

Nun ist nicht jede Technologie, die Google den Massen anbietet, unbedingt der Durchbruch, aber es freut uns doch, wieder ein Beispiel für funktionierende Spracherkennung zu sehen!

(Dank an Michael Spehr für den Hinweis)

15 Juli 2008

Tipp: Eigenschaften bearbeiten, um falsche Erkennungen auszuschalten

Wenig bekannt ist die Möglichkeit, Eigenschaften einzelner Wörter zu bearbeiten. Dazu werde ich in der nächsten Zeit einige Beiträge verfassen. Heute geht es darum, mit Hilfe der Eigenschaften eines Wortes die ärgerlichen Fehlerkennungen zu vermeiden, bei denen trotz hartnäckigem Training immer wieder das selbe falsche Wort hingeschrieben wird.

Wenn ein Wort konstant falsch verstanden wird und immer dieselbe Alternative auftaucht (z.B. PDS statt PDF), ist es verlockend, im Fenster "Vokabular bearbeiten" einfach "PDS" als gesprochene Form für "PDF" einzutragen. Jedoch kann das zu Verwirrungen in Dragons akustischem Modell führen, in dem u.a. die Informationen über die Aussprache einzelner Laute gespeichert werden. Besser ist es daher, im Fenster "Vokabular bearbeiten" unter "Eigenschaften" die gewünschte Form einzutragen. Dies berührt das akustische Modell nicht.

Unter "Vokabular bearbeiten" wählen Sie das Wort aus, was statt des richtigen Wortes erkannt wird, und klicken auf "Eigenschaften". Setzen Sie einen Haken vor "Alternative Form" und tragen Sie in das Feld daneben das Wort ein, welches geschrieben werden soll. Bestätigen Sie mit OK.

Denken Sie daran, dass jetzt immer das andere Wort erscheint, Sie also z.B. "PDS" nicht mehr diktieren können! Aber die gibt es ja sowieso nicht mehr...

14 Juli 2008

Vergleich: Diktiergeräte für Spracherkennung

Welches Diktiergerät eignet sich am besten für Spracherkennung? Um dieser Frage nachzugehen, habe ich einen identischen Text von circa 150 Wörtern Länge mit vier verschiedenen Diktiergeräten gelesen und jeweils von Dragon NaturallySpeaking 9.5 mit einem neuen, nicht auf das Diktiergerät trainierten Profil umsetzen lassen. Beim Diktat des Referenztextes mit einem Handmikrophon oder Headset habe ich in der Regel keinen Fehler (es handelt sich um einen Demo-Text aus dem Bereich Radiologie, den ich bei Präsentationen verwende).

Geräte, die sowohl das DSS-Format als auch das DSS pro-Format unterstützen, habe ich (nach Möglichkeit) mit beiden Formaten getestet.

Bei den getesteten Diktiergeräten handelt es sich um die derzeit aktuellen Modelle der führenden Hersteller:

- Olympus DS-4000
- Olympus DS-5000
- Philips Digital Pocket Memo 9600
- Grundig Digta 420

Jetzt die Überraschung: die Abweichungen waren minimal. Egal ob DSS oder DSS pro, egal welches Gerät - die Fehlerquote bewegte sich zwischen zwei und vier Fehlern. Interessanterweise war beim DSS pro-Format keine Verbesserung gegenüber dem DSS-Format feststellbar, obwohl beim Abhören der Diktate ein deutlicher Qualitätsunterschiede zu hören ist.

Die Frage bleibt, wie sich dieses Ergebnis bewerten lässt: sind vier Fehler auf 150 Wörter statistisch aussagekräftig oder nicht? Auf den ersten Blick handelt es sich natürlich um eine doppelt so hohe Fehlerquote; aber der Text ist zu kurz, um wirklich zu entscheiden, ob es sich um einen statistisch nicht aussagekräftigen Zufall handelt oder tatsächlich um eine deutlich schlechtere Qualität des Diktiergerätes. Hier wäre es interessant, alle Diktiergeräte einmal mit einem deutlich längeren Text zu testen. Das Olympus DS-5000, welches ich im Moment als mein Arbeitsgerät benutze, hat im kurzen Test vier Fehler gemacht; bei einem Diktat von 15 Minuten Länge aber nur sieben echte Erkennungsfehler provoziert.

Offensichtlich gilt also: die Geräte sind praktisch identisch, was die Leistung mit Spracherkennung angeht. Wichtiger ist der Stil beim Diktieren, die Nebengeräusche, wie konzentriert man ist. Und für die Entscheidung für oder gegen eines der Diktiergeräte bleibt nach wie vor eher der persönlich empfundene Komfort bei der Bedienung ausschlaggebend als die Qualität.

Fazit dieses Tests also: Diktiergeräte sind Gefühlssache :-)

19 Juni 2008

Vortrag: Spracherkennung und Übersetzungswissenschaft

Der für die Lange Nacht der Wissenschaften in Berlin angekündigte, dann aber verschobene Vortrag

„Spracherkennung und Übersetzungswissenschaft“

von Cornelia Soldat und mir wird jetzt endgültig nachgeholt am

Dienstag, 24.6. 16.00 Uhr, Humboldt-Universität zu Berlin, August-Boeckh-Haus Raum 5.42
Dorotheenstr. 65, 10117 Berlin, S + U Friedrichstraße

Alle Interessenten sind herzlich eingeladen!

16 Juni 2008

Neu bei Olympus: WS-110 DNS Version

Olympus bietet den digitalen Recorder WS-110 jetzt im Bundle mit einer Dragon NaturallySpeaking Recorder Edition an. Diese habe ich mir mal genauer angesehen, denn das Paket klingt wirklich verlockend: ein digitales Diktiergerät (der Einsteigerklasse) und ein Dragon mit nicht weniger als sechs Erkennungssprachen für ca. 100 € - wer kann dazu schon nein sagen?

Die Firma Olympus hat mir dankenswerterweise eine DVD zur Verfügung gestellt, von der aus ich die Recorder Edition auch ohne Probleme installieren konnte (ein Diktiergerät war nicht dabei, so das ich hierzu leider nichts weiter sagen kann). Allerdings wurde ich schon zu Beginn stutzig (ich hatte vorher eine ältere Version von Dragon auf dem Rechner): Der Installer warnt davor, dass die Funktionalität, direkt in den PC zu diktieren, mit diesem Upgrade verloren geht.

So war es dann auch: zwar kann ich Englisch, Spanisch, Französisch, Italienisch, Niederländisch und Deutsch als Erkennungssprachen installieren, doch als Diktierquelle steht mir nur "Pocket PC" und "Audiodateien auf Festplatte" zur Verfügung. Damit bewahrheitet sich der Name: Die Recorder Edition unterstützt nur das sogenannte Offline-Diktat, d.h. die Umsetzung von zuvor aufgenommenen Aufnahmen.

Dies tut sie in gewohnter Dragon-Qualität und in sechs Sprachen, insofern kann man sie wirklich als Schnäppchen bezeichnen. Unter der Haube arbeitet eine Dragon NaturallySpeaking Preferred 9.5.

Startet man das Programm, wird man auf eine britische Website geführt, wo sich die Vollversion Dragon NaturallySpeaking Preferred für nur 99,99 Britische Pfund erwerben lässt. Doch Obacht: Diese Preferred ist dann eine ganz normale Preferred ohne die sechs Sprachern (ich frage mich sofgar, ob Deutsch dabei ist). Auch der Umrechnungskurs hat es in sich: rechne ich die 100 Pfund in Euro um, kostet die Preferred plötzlich 199 EUR - laut amtlichem Wechselkurs wären es ca. 125 EUR. Da bestellt man doch lieber woanders.

Bei der Beschreibung der Software ist ebenfalls Vorsicht geboten: automatische Zeichensetzung und Ausfiltern von Ähs und Öhs stehen z.B. im Deutschen nicht zur Verfügung, wie auch in allen anderen Dragon-Versionen nicht. Im Englischen sieht das anders aus; andere Sprachen beherrsche ich nicht so weit, dass ich damit diktieren könnte.

Fazit: Was kann die Recorder Edition und was nicht?

- Sie kann Diktate in sechs Sprachen von (beliebigen) digitalen Diktiergeräten umsetzen. Das mitgelieferte Olympus WS-110 ist übrigens für sein gutes Mikrofon bekannt und für Spracherkennung sehr gut geeignet.
- Sie kann nicht direktes Diktat in den Rechner ermöglichen. Dazu braucht man die Dragon NaturallySpeaking Preferred Edition oder eine der professionellen Editionen. Damit werden allerdings die sechs Sprachen eingeschränkt auf höchstens zwei; und der Bezug über den eingebauten Link ist nicht wirklich ratsam.

Wer braucht das Angebot also? Die Recorder Edition in Verbindung mit dem WS-110 ist für mich (andere mögen das anders sehen) eine sehr günstige Möglichkeit, Sprachnotizen aufzuzeichnen und hinterher per Spracherkennung umzusetzen. Dies ist für mich ein wichtiges Einsatzgebiet, welches ich in letzter zeit fast täglich nutze. Wer sich ohnehin mit dem Gedanken trägt, ein Diktiergerät der Notetaker-Klasse anzuschaffen, ist mit dem Paket hervorragend bedient. Als Einstieg in die Spracherkennung bietet die Recorder Edtition von Dragon NaturallySpeaking lediglich einen Vorgeschmack auf die Möglichkeiten, die das direkte Diktat in den PC - immer noch die Königsdisziplin der Spracherkennung - bietet. Für die paar Euro mehr kann ich aber jedem nur raten, die Spracherkennung mit zu kaufen und dann bei Gelegenheit umzusteigen.

Lange Nacht der Wissenschaften - fand leider nicht statt

Will sagen: natürlich fand die lange Nacht der Wissenschaften statt, aber leider ohne unsere Beteiligung. Da der Vortrag "Spracherkennung als Hilfsmittel für einen modernen Übersetzer-Arbeitsplatz" von Cornelia Soldat und mir erst sehr spät ins Programm genommen wurde, gab es bei der Veranstaltung ein Missverständnis, aufgrund dessen wir uns schließlich ohne Ort und ohne Beamer wiederfanden und beschlossen haben, den Vortrag demnächst in einem anderen Rahmen an der Humboldt-Universität zu wiederholen.

Die Ankündigung werde ich rechtzeitig veröffentlichen.

Vorteil: der Vortrag wird nicht zu ganz so nachtschlafender Zeit stattfinden, und der Eintritt wird frei sein.

Ich freue mich auf Ihren Besuch, man lernt seine LeserInnen gern mal persönlich kennen!