26 August 2008

Dragon 10-Kaffeesatzleserei

Ein paar Neuerungen von Dragon 10 habe ich letztens schon genannt; eine Menge steht in den Werbemails, die Nuance im Moment verschickt - aber was brigts tatsächlich auf dem Feld der Erkennung?

Die angekündigte, um 20% verbesserte Erkennungsgenauigkeit geht wirklich an die Grenze des Wahrnehmbaren: wo DNS 9 10 Fehler macht, macht DNS 10 nur noch 8. Ob das so viel ausmacht? "Da aber schon Dragon 9 im IDealfall nur eines von hundert Wörtern missverstand, ist dies nicht sehr brisant" - schreibt Dorothee Wiegand in der aktuellen c´t, weiß darüber hinaus aber auch noch nichts Neues.

Für mich wäre viel spannender zu erfahrten, wie die neue Version mit undeutlicher Aussprache und Dialekten umgeht. Da gab es schon mal einen Sprung, als - man höre und staune - die Erkennungsgenauigkeit weiblicher Stimmen an die der Männer angeglichen wurde (war das in DNS 8?) Bei mir hat sich ein Kunde allen Ernstes darüber beschwert, dass Dragon am Abend schlechter erkenne als am Morgen - ob denn die Software müde würde? An ihm konnte es ja nicht liegen. Für mich werden aber genau hier die Schlachten der Zukunft geschlagen, und zumindest bei Nuance Deutschland ist man sich dessen bewusst. Auch das heißt aber nichts, bis das mal nach USA dringt...

Zum Thema Hardware, um Missverständnisse zu vermeiden: Die Mindestanforderungen sind nicht gestiegen, die empfohlenen Ressourcen haben sich mal eben verdoppelt. Wer daraus ableitet, DNS 10 habe keine höheren Systemansprüche als die Vorversion, beschönigt da wohl etwas. Wie es im Vergleich zu DNS 9 auf demselben Rechner aussieht, muss ich aber auch erst noch testen - mein Urlaub ist noch nicht vorbei, außerdem ist DNS 10 noch gar nicht erhältlich...

Stay tuned!

24 August 2008

Nuance und 4voice statten die nordrhein-westfälische Justiz aus

Nuance Pressemitteilungen Sind mir normalerweise keine Hinweise wert, in diesem Falle aber schon, weil hier eine Geschichte zum vorläufigen Abschluss kommt, die bereits seit meinem Eintritt bei der 4voice AG vor sich hin geköchelt hat: die Ausschreibung für die Justiz in Nordrhein-Westfalen. Eine Ausschreibung, die angefochten wurde, ein neues Ergebnis, die Auslieferung, Produkte, die nicht abgenommen worden und wieder zurückgegeben wurden - die Geschichte nahm kein Ende, und so ist es schon mit einer gewissen persönlichen Genugtuung verbunden, wenn Nordrhein-Westfalen sich jetzt doch wieder für den Anbieter entscheidet, der schon am Anfang eigentlich den Zuschlag erhalten sollte.

Soviel Stolz muss sein :-)

"Wie können sie jetzt Urlaub machen?" - weil doch DNS 10 da ist

"Wie können sie jetzt Urlaub machen?" - fragt mich einer meiner treuesten Leser und verweist auf die durch alle Newsticker gehende Agenturmeldung, dass Dragon NaturallySpeaking 10 jetzt erscheint.

Dabei ist noch gar nicht klar, wann es tatsächlich in die Läden kommt - nach meiner Information beginnt die Auslieferung Ende August. Nuance hat gar selbst noch die Version 9 auf der Website angekündigt.

Alles Neue habe ich aber schon vor meinem Urlaub onlinebestellkompatibel angekündigt. Wer also meine detaillierten Beschreibungen von Dragon NaturallySpeaking 10 lesen will, folge dem Link.

Der Fairness halber sei nicht unerwähnt, dass ich auch noch keine Vollversion 10 habe und mich daher auf Betas und Vorführungen verlassen muss, außerdem auf die Produktankündigungen des Herstellers.

Was auf jeden Fall cool wird, ist die Möglichkeit, in Befehle Variablen einzubauen, die nicht aus einer Liste stammen, sondern quasi frei sagbar sind. Dem Endanwender wird das v.a. an den Funktionen auffallen, die mit großem Aufwand angekündigt werden - der Möglichkeit, mit einem einzigen Sprachbefehl im Web zu suchen ("suche nach China-Restaurant in Berlin-Mitte"), und der Möglichkeit, ein Wort ohne vorheriges Markieren sofort zu formatieren ("schreib Dragon fett"). Dahinter steckt eine neue Technologie, die Variablen in Befehlen zulässt, welche nach Bedarf "gefüllt" werden können. Solche Variablen sollen demnächst auch in anderen Sprachbefehlen möglich sein, sicher weiß ich es von Textbausteinen, in denen man also beispielsweise einen kompletten Brief ablegen kann, bei der man bloß die Anrede als Variable markiert und dann per Sprache anspringt. Ob auch Skript-Befehle auf diese Weise möglich sein werden, wird sich zeigen - hier tun sich ungeahnte Möglichkeiten auf.

Gespannt bin ich darauf, welche Fehler und Ärgernisse der Version neun in Dragon NaturallySpeaking 10 ausgebügelt werden. Z.B. wird es möglich sein, einzustellen, welche Zahlen als Ziffer geschrieben werden sollen und welche nicht, so dass das lästige Formatieren im Vokabular oder aber korrigieren von Hand im Text oder der Befehl "schreib das als Zahl" weitestgehend der Vergangenheit angehören dürften. Wer, wie ein Arzt, eigentlich alle Zahlen als Ziffern braucht, stellt das einfach über ein Menü ein und fertig. Wie gut dann aber die Erkennungsgenauigkeit ist, muss auch die Praxis zeigen. Von der Beta-Version weiß ich, dass es hier noch Potenzial nach oben gab.

Andere Kleinigkeiten fallen mir kaum mehr auf, z.B. dass der Befehl "zum Absatzende" stillschweigend verschwunden ist. Vielleicht taucht er ja in der neuen Version wieder auf?

Stutzig machen mich die Systemvoraussetzungen, die mal wieder das Potential aktueller Hardware voll ausschöpfen (will sagen: auf älteren Rechnern die Grenze der Leistungsfähigkeit erreichen). Auch vor dem Hintergrund, dass Nuance die Spracherkennungstechnologie von Dragon NaturallySpeaking demnächst für Handys zur Verfügung stellen möchte, erscheint mir das nicht unbedingt zielführend. Ich bin sowieso gespannt, wohin diese Entwicklung noch geht - die Endgeräte werden immer leichter, Anwendungen werden im Netz zur Verfügung gestellt, aber meine Spracherkennung braucht (teilweise als letzte Anwendung) einen richtig leistungsstarken Prozessor und jede Menge Arbeitsspeicher. Hier bin ich sehr auf die nächsten Entwicklungen gespannt.

Das Kernstück, die Erkennungsgenauigkeit, kann ich natürlich ohne eine endgültige Version nicht beurteilen. Hier bin ich sehr gespannt, wenn mich das Paket erreicht, wie Dragon NaturallySpeaking 10 wohl im Vergleich zur Vorgängerversion abschneiden wird. Sie erfahren als erste davon - sobald ich aus dem Urlaub zurück bin!

08 August 2008

Ich bin dann mal weg.

When Your Computer Listens to You | New York Times Video

Mit diesem Beitrag verabschiede ich mich zunächst mal in den Urlaub - genau wie der freundliche Herr, der in dem Video zu sehen ist. Nur dass ich nicht nach Hawaii fliege, sondern nach Kreta. Das Video hat aber trotzdem alles mit dem Thema diese Blogs zu tun - aber das darf ich nicht sagen...

Ich melde mich dann bei Gelegenheit wieder mit meinen Netznotizen zu selbigem Thema!

05 August 2008

Linguatec kündigt neue Version seines Spracherkennungsprogramms Voice Pro an

Erster! Ich zitiere:

Der Münchner Sprachtechnologie-Experte Linguatec plant für Herbst 2008 die vollständig überarbeitete Neuauflage seines Spracherkennungsprogramms Voice Pro. Die Vorversion war 2004 Testsieger der Stiftung Warentest im Vergleich der Spracherkennungsprogramme.

Das Interesse an Spracherkennung ist immens. Kein Wunder – das Verfassen von Texten vielfältigster Art ist aus unserem beruflichen und privaten Alltag nicht wegzudenken, und wer würde nicht gerne „wie von Zauberhand“ schreiben können. Diktieren statt Tippen bedeutet eine spürbare Arbeitserleichterung und Entlastung für den Anwender. Auch Surfen und die Steuerung des Computers sind per Spracheingabe mühelos möglich.

Das Verblüffende an Spracherkennung ist die Geschwindigkeit, in der das Diktierte festgehalten wird. Nicht jeder kann von sich behaupten, so schnell zu tippen, wie er sprechen kann. Noch dazu sind beim Diktieren Rechtschreibfehler ausgeschlossen. In Kombination mit einer Erkennungsgenauigkeit von bis zu 99% bedeutet dies eine enorme Effizienzsteigerung für jede Schreibaufgabe.

Nach zwei Jahren intensiver Entwicklungsarbeit steht nun fest: Die neue Version der Spracherkennungssoftware Voice Pro kommt im Herbst auf den Markt. In einer engen Zusammenarbeit mit führenden Hochschulen in Deutschland, Österreich und der Schweiz wurde der Grundstock für eine neue Generation von Spracherkennung geschaffen. Besonderes Augenmerk legt die neue Version Voice Pro auf den Einsatz unter Windows Vista, eine deutlich verbesserte Erkennungsgenauigkeit und eine intuitive Bedienung.


Vista-Unterstützung war ja auch mal fällig, nicht wahr, Rike :-)

Ich bin gespannt, ob auch die Erkennungsmaschine mal überarbeitet wurde oder ob immer noch das alte ViaVoice vor sich hin werkelt. Ein Vorteil sind sicherlich die geringen Ansprüche, die die Software dann an den Rechner stellt. Wie es sich in der Praxis schlägt, werden wir nach Erscheinen feststellen.

Heute abend präsentiert Nuance in München übrigens auch neue Technologien. Obwohl in der Einladung von einem zehnfingrigen Drachen die Rede war, werde ich frühestens morgen erfahren, was es denn zu sehen gab und welche Wundertiere uns demnächst von dieser Seite ins Haus stehen, die dann bestimmt mächtig hungrig sind (nach GHz, RAM und so). Sicher weiß ich nur, dass ein sprachgesteuertes Auto zu sehen sein wird, weswegen das Event nicht im BMW-Tower stattfinden wird.

Test: Philips LFH 331 Ohrhörer-Mikrofon-Kombination

Ich habe mir testweise die Philips-Ohrhörer-Mikrophon-Kombination LFH 331 8zu sehen unter http://www.dictation.philips.com/index.php?id=53&CC=DE) für das digitale Diktiergerät DPM 9600 kommen lassen und gestern unter verschärften Bedingungen getestet - im doch recht starken Wind, an der Kreuzung Skalitzer Straße/Schlesische Straße in Berlin-Kreuzberg.

Vorgabe war festzustellen, ob das Gerät eine vernünftige Geräuschunterdrückung bietet.

Leider scheint es so zu sein, dass das Mikrophon keine spürbare Verbesserung bei der Aufnahme bringt. Dies mag am Wind liegen, der alles andere übertönt; aber auch was die Nebengeräusche durch Autos angeht, kann ich nicht wirklich eine qualitative Veränderung feststellen. Dies bezieht sich explizit auf die Spracherkennung eines aufgenommen Diktats, die Qualität des Diktats scheint mir subjektiv besser zu sein. Die Sprache selbst klingt klarer als durch das eingebaute Mikrophon des Diktiergerätes.

Das erste Fazit ist also, dass das Gerät durchaus dafür geeignet ist, in vertraulichen Situationen zu diktieren, in denen man nach Möglichkeit niemand mithören lassen will. Vor allem das abhören des Diktats geschieht für die Außenwelt geräuschlos; das Diktat selbst produziert natürlich immer noch gesprochene Sprache :-) Auch ein Diktat im Auto, bei dem ich die Hände weitgehend frei haben will, ist gut möglich; der Vorteil besteht halt darin, die Hände frei zu haben.

Um aber in einer lauten Umgebung Nebengeräusche herauszufiltern, würde ich ein anderes Gerät nehmen, also eines der Aufsteckmikrofone, die alle drei Anbieter im Programm haben.

So ist das eben - für jede Situation die passende Lösung. Leider nicht eine Lösung für alle Situationen...

22 Juli 2008

Fußschalter neu erfunden! (Belesenheit schützt vor Neuentdeckungen)

Michael Spehr macht mich aufmerksam auf einem Beitrag des hessischen Rundfunks, indem die Erfinder des Fußschalters für computergestützte Konstruktion von digitalen Diktaten erfunden werden - und Überraschung: es handelt sich um zwei Studenten aus Hessen. "Belesenheit schützt vor Neuentdeckungen" - pflegte mein verehrter Lehrer zu sagen.

Den Vorwurf brauchen wir den Erfindern gar nicht zu machen. Wie der Webseite der beiden Studenten zu entnehmen ist, sind sie sich durchaus dessen bewusst, dass es auch professionelle Diktiersysteme anderer Hersteller mit entsprechenden Fußschaltern gibt. Der Redakteur des hessischen Rundfunks scheint allerdings die nötigen Klicks nicht gemacht zu haben; er porträtiert die beiden tatsächlich so, als wäre ihr Gerät - welches übrigens mit einer einzigen Taste auskommt und daher für jede Sekretärin indiskutabel ist - tatsächlich der erste seiner Art für Computer.

Und weil ich im Gegensatz zum hessischen Rundfunk Webseiten gerne etwas genauer anschaue, erfahre ich bei der Gelegenheit, dass es tatsächlich die Firma NCH in Australien noch gibt, die irgendwann eine kostenlose Software zur Verfügung gestellt haben, mit der sich DSS-Dateien abspielen lassen - sehr zum Ärger der drei Großen, die nicht nur das Format erfunden haben, sondern auch eifrig Lizenzgebühren dafür kassieren.

Letztlich eine Bastellösung, die für Studenten sicherlich vollkommen ausreicht, aber kein professionelles Diktatmanagement ersetzen kann. Deshalb wird auf der Website auch das Diktiersystem von Olympus als professionelle Workflow-Lösung mit verkauft.

Als Fußnote:

Die Betreiber haben das Sonderangebot von Olympus, ein WS-110 digitaler Notetaker im Paket mit Dragon NaturallySpeaking "Recorder Edition", getestet, stellen den Test inklusive Korrekturen auf der Webseite zur Verfügung, und siehe da - die Spracherkennung schlägt sich mehr als tapfer! Wenn wir davon ausgehen, dass die meisten Wörter, die nicht erkannt wurden, nicht vorher zum Wortschatz hinzugefügt worden, wie sich das eigentlich gehören würde, ist die Umsetzung tatsächlich fast fehlerfrei.

21 Juli 2008

Vortrag: Spracherkennung für Übersetzer - jetzt erhältlich

Der Vortrag "Spracherkennung als Hilfsmittel für einen modernen Übersetzer-Arbeitsplatz", den Cornelia Soldat und ich am 24.06.2008 in der Humboldt-Universität zu Berlin gehalten haben, ist jetzt transkribiert und als Manuskript erhältlich. Interessenten senden bitte eine kurze Mail an
cornelia.soldat [at] cs-spracherkennung.de.

16 Juli 2008

Google Lets You Search for Text in Some Videos

Google lässt Sie in Videos nach Text suchen - schreibt das Blog www.blogscoped.com.

Was hier vorgestellt ist, ist eigentlich Audio Mining und als solches eine schon lange gehegte Begehrlichkeit: Große Mengen von gesprochenem Text werden per automatischer Spracherkennung verschriftlicht und nach bestimmten Schlüsselwörtern durchsucht. (Erinnert sich noch jemand an die Witze nach dem 11. September, als man am Telefon so Sätze wie "Ich bin laden, sprach der LKW-Fahrer" sagte, um den CIA einzuschalten?)

Google hat dies jetzt weitergeführt: YouTube-Videos können nach bestimmten Wörtern durchsucht werden und die Suchmaschine gibt das passende Video aus, komplett mit Markierung, wo der Suchbegriff zu hören ist. Verfügbar ist das im Moment für Videos der amerikanischen Präsidentschaftskandidaten; die direkte URL ist http://speech.clients.google.com/elections2008videosearch/gadget.

Nun ist nicht jede Technologie, die Google den Massen anbietet, unbedingt der Durchbruch, aber es freut uns doch, wieder ein Beispiel für funktionierende Spracherkennung zu sehen!

(Dank an Michael Spehr für den Hinweis)

15 Juli 2008

Tipp: Eigenschaften bearbeiten, um falsche Erkennungen auszuschalten

Wenig bekannt ist die Möglichkeit, Eigenschaften einzelner Wörter zu bearbeiten. Dazu werde ich in der nächsten Zeit einige Beiträge verfassen. Heute geht es darum, mit Hilfe der Eigenschaften eines Wortes die ärgerlichen Fehlerkennungen zu vermeiden, bei denen trotz hartnäckigem Training immer wieder das selbe falsche Wort hingeschrieben wird.

Wenn ein Wort konstant falsch verstanden wird und immer dieselbe Alternative auftaucht (z.B. PDS statt PDF), ist es verlockend, im Fenster "Vokabular bearbeiten" einfach "PDS" als gesprochene Form für "PDF" einzutragen. Jedoch kann das zu Verwirrungen in Dragons akustischem Modell führen, in dem u.a. die Informationen über die Aussprache einzelner Laute gespeichert werden. Besser ist es daher, im Fenster "Vokabular bearbeiten" unter "Eigenschaften" die gewünschte Form einzutragen. Dies berührt das akustische Modell nicht.

Unter "Vokabular bearbeiten" wählen Sie das Wort aus, was statt des richtigen Wortes erkannt wird, und klicken auf "Eigenschaften". Setzen Sie einen Haken vor "Alternative Form" und tragen Sie in das Feld daneben das Wort ein, welches geschrieben werden soll. Bestätigen Sie mit OK.

Denken Sie daran, dass jetzt immer das andere Wort erscheint, Sie also z.B. "PDS" nicht mehr diktieren können! Aber die gibt es ja sowieso nicht mehr...

14 Juli 2008

Vergleich: Diktiergeräte für Spracherkennung

Welches Diktiergerät eignet sich am besten für Spracherkennung? Um dieser Frage nachzugehen, habe ich einen identischen Text von circa 150 Wörtern Länge mit vier verschiedenen Diktiergeräten gelesen und jeweils von Dragon NaturallySpeaking 9.5 mit einem neuen, nicht auf das Diktiergerät trainierten Profil umsetzen lassen. Beim Diktat des Referenztextes mit einem Handmikrophon oder Headset habe ich in der Regel keinen Fehler (es handelt sich um einen Demo-Text aus dem Bereich Radiologie, den ich bei Präsentationen verwende).

Geräte, die sowohl das DSS-Format als auch das DSS pro-Format unterstützen, habe ich (nach Möglichkeit) mit beiden Formaten getestet.

Bei den getesteten Diktiergeräten handelt es sich um die derzeit aktuellen Modelle der führenden Hersteller:

- Olympus DS-4000
- Olympus DS-5000
- Philips Digital Pocket Memo 9600
- Grundig Digta 420

Jetzt die Überraschung: die Abweichungen waren minimal. Egal ob DSS oder DSS pro, egal welches Gerät - die Fehlerquote bewegte sich zwischen zwei und vier Fehlern. Interessanterweise war beim DSS pro-Format keine Verbesserung gegenüber dem DSS-Format feststellbar, obwohl beim Abhören der Diktate ein deutlicher Qualitätsunterschiede zu hören ist.

Die Frage bleibt, wie sich dieses Ergebnis bewerten lässt: sind vier Fehler auf 150 Wörter statistisch aussagekräftig oder nicht? Auf den ersten Blick handelt es sich natürlich um eine doppelt so hohe Fehlerquote; aber der Text ist zu kurz, um wirklich zu entscheiden, ob es sich um einen statistisch nicht aussagekräftigen Zufall handelt oder tatsächlich um eine deutlich schlechtere Qualität des Diktiergerätes. Hier wäre es interessant, alle Diktiergeräte einmal mit einem deutlich längeren Text zu testen. Das Olympus DS-5000, welches ich im Moment als mein Arbeitsgerät benutze, hat im kurzen Test vier Fehler gemacht; bei einem Diktat von 15 Minuten Länge aber nur sieben echte Erkennungsfehler provoziert.

Offensichtlich gilt also: die Geräte sind praktisch identisch, was die Leistung mit Spracherkennung angeht. Wichtiger ist der Stil beim Diktieren, die Nebengeräusche, wie konzentriert man ist. Und für die Entscheidung für oder gegen eines der Diktiergeräte bleibt nach wie vor eher der persönlich empfundene Komfort bei der Bedienung ausschlaggebend als die Qualität.

Fazit dieses Tests also: Diktiergeräte sind Gefühlssache :-)

19 Juni 2008

Vortrag: Spracherkennung und Übersetzungswissenschaft

Der für die Lange Nacht der Wissenschaften in Berlin angekündigte, dann aber verschobene Vortrag

„Spracherkennung und Übersetzungswissenschaft“

von Cornelia Soldat und mir wird jetzt endgültig nachgeholt am

Dienstag, 24.6. 16.00 Uhr, Humboldt-Universität zu Berlin, August-Boeckh-Haus Raum 5.42
Dorotheenstr. 65, 10117 Berlin, S + U Friedrichstraße

Alle Interessenten sind herzlich eingeladen!

16 Juni 2008

Neu bei Olympus: WS-110 DNS Version

Olympus bietet den digitalen Recorder WS-110 jetzt im Bundle mit einer Dragon NaturallySpeaking Recorder Edition an. Diese habe ich mir mal genauer angesehen, denn das Paket klingt wirklich verlockend: ein digitales Diktiergerät (der Einsteigerklasse) und ein Dragon mit nicht weniger als sechs Erkennungssprachen für ca. 100 € - wer kann dazu schon nein sagen?

Die Firma Olympus hat mir dankenswerterweise eine DVD zur Verfügung gestellt, von der aus ich die Recorder Edition auch ohne Probleme installieren konnte (ein Diktiergerät war nicht dabei, so das ich hierzu leider nichts weiter sagen kann). Allerdings wurde ich schon zu Beginn stutzig (ich hatte vorher eine ältere Version von Dragon auf dem Rechner): Der Installer warnt davor, dass die Funktionalität, direkt in den PC zu diktieren, mit diesem Upgrade verloren geht.

So war es dann auch: zwar kann ich Englisch, Spanisch, Französisch, Italienisch, Niederländisch und Deutsch als Erkennungssprachen installieren, doch als Diktierquelle steht mir nur "Pocket PC" und "Audiodateien auf Festplatte" zur Verfügung. Damit bewahrheitet sich der Name: Die Recorder Edition unterstützt nur das sogenannte Offline-Diktat, d.h. die Umsetzung von zuvor aufgenommenen Aufnahmen.

Dies tut sie in gewohnter Dragon-Qualität und in sechs Sprachen, insofern kann man sie wirklich als Schnäppchen bezeichnen. Unter der Haube arbeitet eine Dragon NaturallySpeaking Preferred 9.5.

Startet man das Programm, wird man auf eine britische Website geführt, wo sich die Vollversion Dragon NaturallySpeaking Preferred für nur 99,99 Britische Pfund erwerben lässt. Doch Obacht: Diese Preferred ist dann eine ganz normale Preferred ohne die sechs Sprachern (ich frage mich sofgar, ob Deutsch dabei ist). Auch der Umrechnungskurs hat es in sich: rechne ich die 100 Pfund in Euro um, kostet die Preferred plötzlich 199 EUR - laut amtlichem Wechselkurs wären es ca. 125 EUR. Da bestellt man doch lieber woanders.

Bei der Beschreibung der Software ist ebenfalls Vorsicht geboten: automatische Zeichensetzung und Ausfiltern von Ähs und Öhs stehen z.B. im Deutschen nicht zur Verfügung, wie auch in allen anderen Dragon-Versionen nicht. Im Englischen sieht das anders aus; andere Sprachen beherrsche ich nicht so weit, dass ich damit diktieren könnte.

Fazit: Was kann die Recorder Edition und was nicht?

- Sie kann Diktate in sechs Sprachen von (beliebigen) digitalen Diktiergeräten umsetzen. Das mitgelieferte Olympus WS-110 ist übrigens für sein gutes Mikrofon bekannt und für Spracherkennung sehr gut geeignet.
- Sie kann nicht direktes Diktat in den Rechner ermöglichen. Dazu braucht man die Dragon NaturallySpeaking Preferred Edition oder eine der professionellen Editionen. Damit werden allerdings die sechs Sprachen eingeschränkt auf höchstens zwei; und der Bezug über den eingebauten Link ist nicht wirklich ratsam.

Wer braucht das Angebot also? Die Recorder Edition in Verbindung mit dem WS-110 ist für mich (andere mögen das anders sehen) eine sehr günstige Möglichkeit, Sprachnotizen aufzuzeichnen und hinterher per Spracherkennung umzusetzen. Dies ist für mich ein wichtiges Einsatzgebiet, welches ich in letzter zeit fast täglich nutze. Wer sich ohnehin mit dem Gedanken trägt, ein Diktiergerät der Notetaker-Klasse anzuschaffen, ist mit dem Paket hervorragend bedient. Als Einstieg in die Spracherkennung bietet die Recorder Edtition von Dragon NaturallySpeaking lediglich einen Vorgeschmack auf die Möglichkeiten, die das direkte Diktat in den PC - immer noch die Königsdisziplin der Spracherkennung - bietet. Für die paar Euro mehr kann ich aber jedem nur raten, die Spracherkennung mit zu kaufen und dann bei Gelegenheit umzusteigen.

Lange Nacht der Wissenschaften - fand leider nicht statt

Will sagen: natürlich fand die lange Nacht der Wissenschaften statt, aber leider ohne unsere Beteiligung. Da der Vortrag "Spracherkennung als Hilfsmittel für einen modernen Übersetzer-Arbeitsplatz" von Cornelia Soldat und mir erst sehr spät ins Programm genommen wurde, gab es bei der Veranstaltung ein Missverständnis, aufgrund dessen wir uns schließlich ohne Ort und ohne Beamer wiederfanden und beschlossen haben, den Vortrag demnächst in einem anderen Rahmen an der Humboldt-Universität zu wiederholen.

Die Ankündigung werde ich rechtzeitig veröffentlichen.

Vorteil: der Vortrag wird nicht zu ganz so nachtschlafender Zeit stattfinden, und der Eintritt wird frei sein.

Ich freue mich auf Ihren Besuch, man lernt seine LeserInnen gern mal persönlich kennen!

11 Juni 2008

Spracherkennung in der Langen Nacht der Wissenschaft, Berlin

Am kommenden Samstag, 14.6.2008, führen meine Kollegin Dr. Cornelia Soldat und ich im Rahmen der Langen Nacht der Wissenschaften in Berlin Spracherkennung vor. Die Einladung stammt vom Institut für Slawistik der Humboldt-Universität zu Berlin (wo ich promoviert habe, falls noch mal jemand nach der Herkunft meines Doktortitels fragt), weshalb der Vortrag überschrieben ist mit "Spracherkennung als Hilfsmittel für einen modernen Übersetzer-Arbeitsplatz". Auch Nicht-Übersetzer werden aber auf ihre Kosten kommen, und sei es in der anschließenden Diskussion.

Themen sind u.a. die Erstellung und Bearbeitung von Fachwortschätzen, das technische Rüstzeug für Spracherkennung, aber auch die Funktionsweise solcher Anwendungen und die lingustischen Hintergründe.

Der Vortrag beginnt um 21h im Foyer der "Kommode", August-Bebel-Platz 1, Berlin-Mitte (gegenüber von Staatsoper und Humboldt-Universität).

Anschließend findet auf dem Platz - 1933 Ort der Bücherverbrennung - eine Lesung statt zum Thema: Verb(r)annte Interkulturalität Auch übersetzte Bücher fremdsprachiger Autoren wurden vor 75 Jahren dem Feuer anheim gegeben.

Am Bebelplatz, dem Ort der Bücherverbrennung, lesen Studierende Texte in Originalsprache und auf Deutsch. LESUNG: 22.00-23.30 Uhr

Herzliche Einladung an alle Interessierten! Weitere Informationen, Eintrittspreise usw. entnehmen Sie bitte der Website der Langen Nacht der Wissenschaften.

29 Mai 2008

BlackBerry zum Diktat – Diktiersoftware für BlackBerrys von Thax

BlackBerry zum Diktat – Diktiersoftware für BlackBerrys - kündigt Golem.de an. Thax Software hat eine Ergänzung des Findentity-Diktiersystems für Anwälte vorgestellt, bei dem sich der Blackberry als Diktiergerät verwenden lässt. Die Features - Tastenbedienung, Einfügen, Überschreiben, Indexmarken usw. - klingen völlig professionell; im Unterschied zu dem Versuch von Dictanet sollen die die Aufzeichnungen auch mit Spracherkennung bearbeiten lassen. Ein wenig Gedanken machr mir der verwendete Audio-Codec .amr statt des (lizenzpflichtigen) DSS. Das sieht nach proprietärer Lösung aus... einen PC-Player gibt es aber kostenlos dazu, notfalls lässt sich auch der Real Player verwenden. Spracherkennung braucht allerdings WAV; mal schauen, wir das gelöst wird.

Die Software soll 149 € zzgl. Mwst. kosten; derzeit gibt es sie zum kostenlosen Download zur Evaluation.

Ich warte seit Jahren auf eine vernünftige Lösung für den Pocket PC; Thax verspricht da was für "in ca. 3 Monaten". Ich bin gespannt!

(Dank an Ronny Jaekel)

16 Mai 2008

Test Headsets für Spracherkennung: Logitech vs. Terratec - wer hört besser zu?

Test Headsets für Spracherkennung: Logitech vs. Terratec - wer hört besser zu?

Der Titel sagt alles. Einen Hinweis habe ich noch: Die Zahl im Audioassistenten von Dragon gibt lediglich das Verhältnis von Sprache zu Nebengeräuschen an und ist kein Indikator für die spätere Erkennungsgenauigkeit! Ich hatte mal 37 Punkte mit einem Mikrofon, das so leise war, dass es überhaupt keine Nebengeräusche, aber auch nur sehr wenig Sprache aufgezeichnet hat. Wenn übrigens am Notebook alle Mikrofone brummen, würde ich mal den USB-Anschluss checken.
Das aber nur am Rande - Danke für den aufwändig recherchierten Test an Wolf-Dieter Roth (von dem wir auch nur Gutes gewöhnt sind).

Ich bleibe trotzdem bei meinem GN 9350, alternativ VXI Parrott Talk Pro - aber ich muss ja nicht auf den Pfennig schauen, was diese Geräte angeht. Abgesehen davon lohnt sich die Ausgabe für ein gutes Mikro immer - aber noch mehr der Aufwand, vernünftig zu diktieren (ceterum censeo...)

Nuance - Sprechen Sie Dragon?

Der Welt will ich diesen Wettbewerb nicht vorenthalten: Nuance - Sprechen Sie Dragon?

Ich spreche Dragon, um mein Blog schneller zu betexten :-)

Tipps und Tricks: Eigenschaften bearbeiten

Eine wenig genutzte Funktionen im Menü "Vokabular bearbeiten" ist die Möglichkeit, Worteigenschaften zu definieren. Hier hat man beispielsweise Gelegenheit festzulegen, ob vor oder nach einem Wort eine Leerstelle kommt, groß oder klein weitergeschrieben wird und dergleichen mehr. Außerdem -- und für die tägliche Anwendung meist wichtiger -- lässt sich das Verhalten von Zahlen vor oder nach einem Wort regeln und eine alternative Form in Abhängigkeit vom Kontext eingeben.

Dragon NaturallySpeaking bietet die Möglichkeit, Worteigenschaften zu ändern. Dazu öffnet man den Vokabulareditor (in Dragon NaturallySpeaking: Wörter - Vokabular anzeigen/bearbeiten), sucht das betreffende Wort und klickt dann auf „ Eigenschaften". Im folgenden Dialog lassen sich verschiedene Eigenschaften eines Wortes definieren, zum Beispiel ob das Wort mit oder ohne vorhergehende oder nachfolgende Leerstelle geschrieben wird, oder ob in einem bestimmten Kontext eine alternative Form geschrieben werden soll.

Über diese Funktion lässt sich zum Beispiel definieren, dass vor einer Zahl das Wort "Paragraph" als § geschrieben wird. Dazu wählt man unter "alternativen Schreibweise" die korrekte Schreibweise - in diesem Fall das § - und wählt zusätzlich "Immer alternativen Schreibweise verwenden - vor einer Zahl" und unter "Abstände": mit Leerstelle.

Analog lässt sich zum Beispiel definieren, dass das Wort "zirka" vor einer Zahl immer als "ca." geschrieben wird.

Über die Funktion "Zahlen immer als Ziffern schreiben" lassen sich auch Maßeinheiten definieren: wenn ich angebe, dass eine Zahl immer als Ziffer geschrieben werden soll, wenn sie vor diesem Wort steht, kann ich auch so exotische Maßeinheiten wie „ pmol/kg Körpergewicht" so bearbeiten, dass zahlen immer als Ziffern geschrieben werden, wenn sie vor der Maßeinheit stehen (und ich nicht sowieso grundsätzlich alle Zahlen immer als Ziffern schreiben will).

Damit Dragon NaturallySpeaking in einem Ausdruck wie "drei bis 4 cm" das Wort drei korrekt als Ziffer und "bis" als "-" schreibt, lässt sich über die Funktion "Eigenschaften" das Wort "bis" mit der alternativen Form "-"versehen. Diese alternative Form soll nur dann gebraucht werden, wenn vorher eine Zahl diktiert wurde.

Natürlich sind hier verschiedene Möglichkeiten, je nach Kontext, möglich. Leider können aber verschiedene Formatierungen nicht miteinander kombiniert werden; diese wird vielleicht in späteren Versionen der Software einmal der Fall sein.

15 Mai 2008

Tipps und Tricks: Zahlenformatierung

So erreicht man in Dragon NaturallySpeaking 9.5, dass Zahlen von null bis neun immer als Ziffern geschrieben werden, unabhängig vom Kontext:

Unter "Vokabular bearbeiten" ruft man sich jedes einzelne Zahlwort auf und bearbeitet die Eigenschaften so:

- Alternative Schreibweise: hier die Ziffer eingeben
- Abstände/Groß- und Kleinschreibung: "verbindet 2 Elemente mit dieser Eigenschaft" wählen

Zahlen werden jetzt unabhängig vom Kontext immer als Ziffern geschrieben, eine Reihe von Zahlen - z.B. eine Telefonnummer - wird ebenfalls korrekt geschrieben, das heißt ohne Lehrstellen zwischen den einzelnen Ziffern.

Anm.: Nicht beseitigt wird dadurch der Fehler, dass bei einem Datum mit nachfolgendem Punkt das Datum falsch geschrieben wird, also zum Beispiel "15.05.2000 8." anstatt "15.05.2008." - hier muss man eine Pause zwischen dem Datum und dem Punkt machen, damit das Datum korrekt geschrieben wird.


Wichtig: auch die groß geschriebenen Zahlwörter müssen mit diesen Eigenschaften versehen werden, ansonsten wird am Anfang eines Absatzes eine Zahl weiterhin als Wort geschrieben.

Richtig: 5 Wochen
Falsch: Fünf Wochen

Da mit diesen Einstellungen Zahlen immer als Ziffer geschrieben werden, sollte man sich überlegen, ob man wirklich diesen Weg geht - der Duden sieht als Standard vor, dass die Zahlwörter bis 10 ausgeschrieben werden, wer sich nach diesem Standard richten will oder richten muss, sollte eine Alternative dazu wählen:

Um die Zahlen von 0-9 nur im Kontext von anderen Zahlen als Ziffern zu schreiben (z.B. bei Postleitzahlen), gehen Sie so vor wie oben beschrieben. Setzen Sie aber zusätzlich in den Eigenschaften unter "Alternative Schreibweise" noch einen Haken vor "Immer alternative Schreibweise verwenden nach einer Zahl" und wählen Sie "Abstände - ohne Leerstelle".

Nuance liefert für DNS 9.5 folgende Hinweise zum Standard-Verhalten von Zahlen, die man sich natürlich auch angewöhnen kann:

Zur Eingabe von fünf- oder mehrstelligen Zahlen im Standardmodus möchten wir Sie auf die unterschiedlichen Eingabemöglichkeiten und die daraus resultierenden Zahlendarstellungen hinweisen:

1. "Direktes" Diktat der Zahl liefert als Ausgabe die Zahl formatiert mit Tausendertrennzeichen, z.B. "dreiundsiebzigtausendfünfhundert" - "73.500"
2. Eingabe der Zahl durch Diktieren von Ziffern liefert dies als Fließtext, z.B. "sieben drei fünf null null" - "sieben drei fünf null null"
3. Eingabe der Zahl durch Diktieren von Ziffern gefolgt von "Schreib das als Zahl" liefert diese als Ziffern getrennt durch Leerschritte, z.B. "sieben drei fünf null null" "Schreib das als Zahl" - "7 3 5 0 0"
4. Eingabe der Zahl durch Diktieren des Wortes "Ziffer" gefolgt von den Ziffern liefert die Zahl ohne Formatierung, z.B. "Ziffer sieben drei fünf null null" - "73500" 5. Eingabe der Zahl durch diktieren des Wortes "Nummerierung" gefolgt von den Ziffern liefert die Zahl ohne Formatierung, z.B. "Nummerierung sieben drei fünf null null" - "73500"
Bitte beachten Sie, dass im Zahlenmodus die letzten beiden Möglichkeiten nicht zur Verfügung stehen und die zweite Möglichkeit als Ergebnis "7 3 5 0 0" liefert.
Für weitere Möglichkeiten zur Eingabe von Zahlen und Ziffern bitten wir Sie, sich auf das Kapitel "Zahlen diktieren" in der Online-Hilfe zu beziehen.


Dies als Update zu diesem Beitrag.