21 Mai 2007

Zahlen, Zahlen, immer nur zahlen

Sofern die Zahlen 1-9 immer als Ziffern geschrieben werden sollen, ist dies auch dadurch zu erreichen, dass man Dragon für jede dieser Zahlen die entsprechende Ziffer als "alternative Schreibweise" bekannt macht. Dazu gehen Sie wie folgt vor:

1. Laden Sie bitte Ihren Sprecher/Ihr Vokabular und wählen Sie dann "Wörter - Anzeigen/bearbeiten"
2. Suchen Sie sich in der Liste der Wörter den Eintrag mit geschriebener Form "eins" und markieren Sie diese Eintrag durch Anklicken. Am schnellsten geht es vermutlich, wenn Sie im Eingabefeld "Geschriebene Form" das Wort "eins" tippen.
3. Klicken Sie dann auf "Eigenschaften".
4. Setzen Sie das Häkchen vor "Alternative Schreibweise" und geben Sie im Eingabefeld dahinter die entsprechende Ziffer (1) ein, wenn sie nicht ohnehin schon vorgeblendet wird.
5. Klicken Sie auf OK.

Nach genau dem selben Muster verfahren Sie nun bei den restlichen Ziffern. Führen Sie hierzu die Schritte 2-5 bei den weiteren Wörtern "zwei" bis "neun" und auch bei den groß geschriebenen Varianten "Eins" bis "Neun" durch. Zum Schluß schließen Sie bitte noch den Dialog "Vokabular bearbeiten" und erhalten nun jeweils die Ziffer hingeschrieben, wenn Sie eine Zahl zwischen 1 und 9 diktieren. Bitte denken Sie auch daran, dass Sie Ihr Sprecherprofil speichern müssen, um die soeben durchgeführten Änderungen zu sichern.

[Courtesy of Martin Müller]

So, das muss für die Zahlen reichen. Alles weitere in DNS 10 :-)

14 Mai 2007

Bitte Zahlen!

Nach Auskunft von Nuance ist es zwecklos, die Zahlen von 1-9 zu trainieren, damit sie als Ziffern geschrieben werden - seit DNS 7 sei dies nicht mehr möglich, da es keine getrennten Einträge mehr für "1" und "eins" usw. gibt.

Damit Dragon NaturallySpeaking die Zahlen von 1 bis 9 korrekt als Ziffern schreibt, ist es nötig, diese Ziffern mit dem Wort "Ziffer" auszusprechen, also "Ziffer 1", "Ziffer 2" und so weiter.

Will man den Ausdruck "Ziffer 1" diktieren (also z.B. ein Rechtsanwalt), sagt man das Wort "Ziffer" zweimal, also zum Beispiel diktieren: "Ziffer Ziffer 1", damit korrekt "Ziffer 1" geschrieben wird.

27 April 2007

Die Unterstützergruppe

"Die Unterstützergruppe" schrieb Dragon heute morgen statt meiner Unterschrift "Viele Grüße, Stephan Küpper". Das kommt davon, wenn man nach einem 16-Stunden-Tag noch nicht wach genug ist, um den Mund beim Sprechen zu öffnen - aber gleichzeitig der schmeichelhafteste Wumbaba, den ich je hatte!

25 April 2007

Umsteigen auf Firefox?

Allerdings - umsteigen könnte sich lohnen. Als alter Opera-Nutzer war ich ja immer dagegen, so Firefox zu wechseln - ich hatte ja alles. Was ich aber nicht hatte und was ich jetzt habe, ist eine komplette Steuerung mit Dragon NaturallySpeaking! Sogar einen Link kann ich per Sprache anwählen! Vom Diktat ganz zu schweigen.

Vielleicht sollte man doch mal den Standard wechseln. Nur schade, dass es zwei Tage dauert, bis man alle Einstellungen in Firefox so gemacht hat, wie man es von Opera gewöhnt ist - und man muss auch ständig irgendwelche Erweiterungen herunterladen. Dann ist er auch nicht mehr schneller.

Wumbaba!

Ich weiß, ich habe in letzter Zeit wenig geschrieben. Das liegt daran, dass ich so viel unterwegs war, dass ich kaum die Zeit hatte, meine Erlebnisse einmal zu veröffentlichen. Heute Abend gibt es daher auch nur zwei schöne Fehler beim erkennen von Eigennamen:

Aus "Rechtsanwälte Wehr und Schäfer" macht Dragon NaturallySpeaking "Rechtsanwälte mehr und schärfer".

[2. Fehler wurde auf Anfrage entfernt]

Noch etwas: die neueste Version von Blogger arbeitet offensichtlich nicht mehr anständig mit dem Opera-Browser zusammen. Schon in der letzten Version gab es Probleme, die Opera relativ schnell beheben konnte, aber Google ist halt immer einen Schritt voraus mit der Technik und baut neue Fehler ein. Ich prangere das an und diktiere hiermit in Firefox! (und siehe da - alles funktioniert hervorragend. Ich sollte vielleicht umsteigen.)

09 März 2007

Neues Diktiergerät: Philips Digital Pocket Memo 9600 mit DSS Pro

Das neue Philips Digital Pocket Memo 9600 ist das erste Diktiergerät, das den neuen DSS Pro-Standard unterstützt. Als wichtigstes Merkmal lassen sich mit diesem Standard Diktate verschlüsseln – wenn die Speicherkarte mal wegkommt, kann die Diktate keiner abhören.

Nimmt man das Gerät in die Hand, fälllt zuerst die angenehme Haptik auf, die sehr an das Olympus DS-4000 erinnert. Mit den alten Pocket Memos bin ich nie richtig warm geworden; das 9600 liegt dagegen gut in der Hand, das Metall fühlt sich sehr angenehm an und der Schiebeschalter ist sehr angenehm zu bedienen. Auch die fünf Tasten auf der Vorderseite sind intuitiv zu bedienen. Das Display, angeblich das größte auf dem Markt, zeigt nicht nur die üblichen Informationen an, sondern auch die Belegung des Schiebeschalters – die lässt sich nämlich anpassen an den Olympus-, Grundig- oder Philips-Standard. Das 9600 funktioniert dabei wie ein Olympus-Gerät, dessen Schalter oben zur Aufnahme einrastet. Das 9620 hat dagegen den bekannten Philips-Schiebeschalter, der - wie auch der von Grundig - nach oben und unten gefedert ist, d.h. in der obersten Position nicht einrastet. Meine Wahl ist klar - ich brauche die Aufnahmeposition ganz oben, sonst vertue ich mich ständig.

Ein ganz cooles Feature ist die als Zubehör erhältliche LAN-Docking Station, die die Übertragung von Diktaten ohne PC ermöglicht. Man steckt das Gerät ein, und das Diktat wird verschickt. Wie genau, schaue ich mir heute auf dem Nuance-Event näher an.

Nachtrag: Die LAN-Station war leider noch nicht vorhanden.

27 Februar 2007

Das Ende der Mythen

Wer noch einmal mit einer hohen Tonqualität im Dragon-Audioassistenten angibt, sehe zuerst dies an - erreicht vom Kollegen Martin Müller aus der 4voice-Entwicklung!



Das Grundig Digta 415 Diktiergerät gibt es im 4voice-Shop zu kaufen :-)

Aber Obacht - ein Diktat war nach diesem Ergebnis nicht mehr ordentlich möglich.

Warum? Weil die "Tonqualität" in Wirklichkeit das Verhältnis von Geräusch (d.h. Sprache) und Nebengeräusch angibt, und weil die Aufnahmequalität so schlecht war, dass erst gar keine Nebengeräusche empfangen wurden. Dragon regelt die Aufnahmelautstärke so weit runter, dass beim Diktat nichts mehr ankommt.

Bevor Sie aber jetzt Ihre Bestellung widerrufen - der Fehler lag an einer Einstellung des Diktiergerätes. Die Voice Activation war eingeschaltet, und damit kamen diese Resultate. Nach der Deaktivierung war der Wert wieder normal (zwischen 15 und 20).

Was lernt uns das? Ein hoher Wert im Audio-Assistenten ist kein zuverlässiger Indikator für eine hohe Tonqualität vom Eingabegerät (ich hatte mal 36 mit einem Grundig ProMic, und die Erkennungsrate war auch nicht besser als sonst). Er kann im Gegenteil sogar ein Hinweis auf eine Fehlfunktion sein.

Geben wir uns also weiterin mit unseren Durchschnittswerten zufrieden und verwenden wir unsere Energie lieber, wie es im Training heißt, auf eine klare und deutliche Aussprache beim Diktieren!

26 Februar 2007

Sprachbefehle für Fortgeschrittene

Control your computer by voice - wie das gehen kann, zeigt Sean Wenzel auf seiner Website. Nicht für den Durchschnitts-Diktanten geeignet, eher für Technikbegeisterte.

23 Februar 2007

Und noch einmal: Hinzufügen von Wörtern zum Vokabular

Unerwartet viel Rückmeldung gab es auf meine Entdeckung, wie sich die Optionen von Dragon NaturallySpeaking so einstellen lassen, dass eine Korrektur dann und nur dann ins Vokabular übernommen wird, wenn sie über das Buchstabierfenster vorgenommen wird.

Kollege Patrick Staisch stellte beim Test fest, dass jede Änderung, die über das Dialogfeld "Optionen" in Dragon NaturallySpeaking gemacht wird, dafür sorgt, dass die von Hand gemachten Änderungen der Datei options.ini verloren gehen. Dies kann ich bestätigen - es reicht sogar aus, einfach nur das Dialogfeld "Optionen" aufzurufen und mit Klick auf "Okay" wieder zu schließen - man muss noch nicht einmal etwas verändern.

David Peters, dem ich den ersten Hinweis auf das Verhalten von Dragon NaturallySpeaking verdanke, auch einfach im Text von Hand vorgenommene Änderungen ins Vokabular zu übernehmen, freut sich verständlicherweise über den Hinweis und ergänzt, dass es vollkommen normal ist, dass Dragon NaturallySpeaking sämtliche Änderungen in der Datei options.ini überschreibt, sobald man im Dialogfeld "Optionen" irgendetwas verändert. Man hat also die Wahl, entweder dieses Dialogfeld zu verwenden (und dann nicht auf einige Funktionen zurückgreifen zu können) oder aber immer nur die Datei zu editieren.

Fazit: die einmal gemachten Einstellungen sollte man sorgfältig wählen und dann nicht mehr verändern. Außerdem gilt hier wie immer: bevor man eine Systemdatei editiert, sollte man ein Back-up von ihr machen.

Und für die nächste Version wünschen wir uns dann, dass man solche doch recht wichtigen Änderungen nicht nur durch editieren einer Systemdateien machen kann, sondern - wie in anderen Programmen üblich - in der Benutzeroberfläche. Und weil es eine Spracherkennung ist, vielleicht sogar per Sprachbefehl.

So, dieser Beitrag markierte ein kleines Jubiläum: Netznotiz Nummer 100! Glückwünsche werden gerne entgegengenommen.

19 Februar 2007

Neues DSS Pro-Format

NTZ Online berichtet über das neue DSSPro-Format für digitale Sprachaufzeichnungen, welches von den 3 großen Herstallern Olympus, Philips und Grundig entwickelt wurde. Eine höhere Abtastrate von 16 kHz und eine eingebaute Verschlüsselung scheinen die wesentlichen Neuheiten dieses Formats zu sein. Letzteres war ja auch mal nötig, damit man Diktate auch wirklich sicher per Mail versenden kann; ersteres ist explizit dafür bestimmt, Spracherkennung zu verbessern. Jetzt müssen sich nur noch die Hersteller herablassen, DSSPro auch zu unterstützen - was bei Nuance nach meinem Wissen noch nicht geplant ist.

Ein Player soll demnächst kostenlos bei den Herstellern erhältlich sein; im Moment habe ich aber nur die alte Software gefunden (und selbst die Pressemitteilung ist noch nicht überall online - da wirds wohl mal wieder was dauern).

Wie merkwürdig ist das denn?

Heute Morgen habe ich einen anderen Windows-Benutzer geladen, und Dragon NaturallySpeaking funktioniert ohne Schwierigkeiten. Diesen Beitrag diktiere ich. Wenn mir irgendjemand sagen kann, warum das Diktat mit dem einen Windows-Benutzer geht und mit dem anderen Windows-Benutzer nicht geht, wäre ich ihm sehr dankbar. Übrigens ist mir der Drache gerade schon wieder abgestürzt, aber ein Neustart hat das gelöst.

Und jetzt der Tipp des Tages: Befehle lassen sich auf einfache Weise trainieren. Man muss dazu gar nicht das Befehlscenter öffnen - es reicht vollkommen, wenn man im Menü "Wörter - trainieren" den Befehl eintippt, der trainiert werden soll, und dann das Training durchführt. (Natürlich kann man den Befehl nicht einfach diktieren - er würde dann ja ausgeführt werden.)

Noch ein Tipp: Trainieren Sie das Wort oder den Befehl in diesem Fenster so häufig, bis der graue Punkt, der normalerweise zu sehen ist, einmal kurz Grün aufleuchtet. Besser zweimal. Auf diese Weise habe ich sogar den ansonsten sehr störrischen Befehl "nimm zwei" in den Griff bekommen.

16 Februar 2007

Jetzt brauche ich auch mal Hilfe

Seit neuestem erkennt DNS 9 Pro zwar noch meine Sprachbefehle, aber nicht mehr mein Diktat. Ich bin im Standardmodus, also liegt es nicht an einem offensichtlichen Einstellungsfehler; weil die Befehle funktionieren, auch nicht am Headset o.ä. Neuinstallation und neuer Benutzer haben nicht geholfen. Wer weiß was? Antworten bitte an stephan [at] soldatkuepper.de!

15 Februar 2007

Video: Spracherkennung bei PC Pro

Das Video ist zwar nicht mehr ganz neu, aber immer noch aktuell: PC Pro-Redakteur Ingo Böhme führt Dragon NaturallySpeaking 9 vor. Als Einführung geeignet für alle, die "mal sehen wollen, ob es funktioniert".

Nuance bewirbt jetzt Spracherkennung als Tool für Blogger -

- und ich bin auch dabei!

Ungefragt natürlich, und ohne mich selbst eingetragen zu haben. Wer sich einträgt, bekommt ein Dragon Standard geschenkt - als ob ich das nötig hätte.

Ich gestehe: Ich diktiere nicht alles in diesem Blog. Wenn Nuacne mal den Opera Web Browser unterstützen würde, sähe das womöglich anders aus.

Nachtrag: Automatisches Hinzufügen von Wörtern beeinflussen

Noch ein Nachtrag: Anscheinend hatte ich mich im letzten Beitrag nicht deutlich genug ausgedrückt - die Änderungen in der options.ini, die ich vorschlage, haben mit DNS Comfort nichts zu tun, sondern beziehen sich nur auf DNS 9. In DNS 8 kann man allerdings mit einem ähnlichen Eintrag in der Options.ini einiges an Unheil verhindern (einfach die beiden genannten Zeilen einkopieren).

DNS Comfort geht einen Schritt weiter und bietet eine Übersicht über die hinzugefügten Wörter an. Die Schönheit daran ist, dass man entscheiden kann, was man wirklich behalten möchte, und damit einen besseren Überblick über das Vokabular hat. Ob man es braucht, ist wohl (wie so oft) eine Frage der persönlichen Vorlieben.

Eine kostenlose Testversion gibt es unter http://www.fachvokabulare.de. Dort ist auch beschrieben, was DNS Comfort sonst noch kann.

12 Februar 2007

Automatisches Hinzufügen von Wörtern beeinflussen

Bug oder Feature?

Hier und hier hatte ich schon einmal davon berichtet, dass Dragon NaturallySpeaking auch Wörter, die über die Tastatur korrigiert werden, unaufgefordert zum Vokabular hinzufügt - in Dragon NaturallySpeaking 9 kann man dieses Verhalten jetzt wenigstens abstellen. Dazu nimmt man unter "Optionen - Korrektur" den Haken vor "Wörter automatisch zum Vokabular Hinzufügen" raus.

Nachteil: auch Wörter, die ich über das Buchstabierfenster neu eingegeben habe, werden dann nicht mehr ins Vokabular übernommen. Es besteht nur noch die Möglichkeit, neue Wörter über "Vokabular bearbeiten" hinzuzufügen - nicht sehr schön.

Willy Sander hat ein Werkzeug bereitgestellt, welches zumindest die gröbsten Fehler bei der Übernahme neuer Wörter ins Vokabular beseitigt, aber das eigentliche Problem nicht löst: ich will nicht, dass Dragon NaturallySpeaking irgendetwas, was ich mit der Tastatur eingebe, versehentlich in den Wortschatz aufnimmt. Ich will aber, dass alle meine Korrekturen aufgenommen werden.

Abhilfe schafft da ein Eintrag in der Datei options.ini, zu finden unter: C:\Dokumente und Einstellungen\All Users\Anwendungsdaten\Nuance\NaturallySpeaking9\Users\[Benutzername]\current. Nimmt man wie beschrieben den Haken raus, werden zwei neue Zeilen in diese Datei geschrieben:

Automatically Add Words=0
Add Words on Correction=0

Ändert man diese Zeilen zu:

Automatically Add Words=0
Add Words on Correction=1

So werden Wörter, die über das Buchstabierfenster eingegeben werden, ins Vokabular übernommen; Wörter, die während des Diktats eingetippt werden, aber nicht. Somit haben wir endlich das Verhalten, das - zumindest mir - logisch erscheint.

08 Februar 2007

Berliner Zeitung : Bitte sprich nicht mit mir, Windows Vista!

Berliner Zeitung : Bitte sprich nicht mit mir, Windows Vista! / Wenn der PC zu brabbeln anfängt,...

Der Vista-Spracherkennungs-Bug ist jetzt auch in der Tagespresse angekommen und wurde auch gleich vom Kunden thematisiert. Meine Meinung dazu: wer mit offenem Schiebedach unter einem Tabenschlag herfährt, soll sich nicht wundern, wenn ihm was auf den Kopf fällt...

Abgesehen davon legen all diese Beiträge eine bemerkenswerte Ignoranz an den Tag, was die Arbeit mit Spracherkennung angeht. Wenn ich nicht diktiere, schalte ich mein Mikrofon ab. Dasselbe bringe ich auch all meinen Kunden bei. Und zwar nicht aus Angst von "präparierten Dateien", sondern wegen ganz normalen Nebengeräusche.
Also:

Nach dem Sprechen Mikrofon ausschalten.
Vor dem Schreiben Gehirn einschalten.

Ganz einfach, oder?

07 Februar 2007

Wumbaba!

Habe ich in diesem Blog schon auf das Buch "Der weiße Neger Wumbaba" von Axel Haake, mit wunderbaren Bildern von Michael Sowa, hingewiesen? In seiner Kolumne in der Süddeutschen Zeitung sammelte Haake über längere Zeit lustige oder skurrile Verhörer, darunter auch die titelgebenden Person ("... und aus den Wiesen steiget / der weiße Neger Wumbaba).

Bei dem Thema stößt man sehr schnell auf www.kissthisguy.com, eine Site, die Verhörer in Popsongs sammelt. Dort heißen solche Verhörer "Mondegreens" (hier steht warum). Um die deutsche Sprache nicht mit einem ihr phonetisch wie orthoepisch fremden, ohnehin ausgedachten Fremdwort zu überlasten, schlage ich als deutsches Äquivalent, hierin Haake folgend, "Wumbaba" vor - wobei im Kontext dieses Blogs explizit der "Verhörer" einer beliebigen Spracherkennungssoftware gemient sein soll.

Und hier ist auch schon mein Wumbaba des Tages:

Start bei Systemstart Firewall deaktivieren
schreibt Dragon so:
Staatsanwältin statt einer Orgie aktivieren

Tusch! Weitere Einsendungen gern an mich oder anonym als Kommentar.

Warnung aus mal wieder gegebenem Anlass: Keine Spracherkennung der Welt produziert Fehlerkennungen, die "zufällig" einen Link zu einer Porno- oder sonstwie gearteten Spamseite produzieren. Solche Beiträge werden weiterhin gnadenlos gelöscht.
 

01 Februar 2007

Gemein: Vista's Spracherkennung führt Befehle aus!

Vista Speech Command exposes remote exploit - derart investigativen Journalismus treibt man bei ZDnet. Wenn die Sprachsteuerung von Vista eingeschaltet ist, ein Benutzer den 
Lautsprecher weit genug aufdreht, gleichzeitig sein Mikro eingeschaltet hat und dann eine präparierte 
Audiodatei mit Sprachbefehlen öffnet, kann es sein, dass diese Sprachbefehle über das Mikrofon 
aufgenommen werden und dann natürlich auch ausgeführt werden. Damit könnte man z.B. - ja was für Gemeinheiten ausführen? Mir fehlt da anscheinend die kriminelle Energie, mir etwas auszudenken, nicht aber dem Kollegen von ZDnet und PCmag, de dies zu einem ernstzunehmenden Sicherheitsrisiko hochschreiben. Wobei die beiden auch nicht so genau wissen, was eine solche Datei dem Rechner sagen sollte - dazu müsste man ja auch wissen, wozu Sprachbefehle standardmäßig überhaupt in der Lage sind.

Jedenfalls fordert man, dies Feature unbedingt abzustellen, ein Kommandowort vorzuschalten (als ob man das 
nicht in besagter Audiodatei speichern könnte), und PCmag versteigt sich sogar zu der Frage, "warum Microsoft überhaupt gestattet, dass Sprachbefehle für Vista vom eigenen Computer kommen dürfen." Ja woher soll das Mikrofon denn wissen, wer da redet?

Und jetzt der Schocker: Das geht auch mit Dragon Professional. Seit Jahren. Nur hat Dragon nicht so eine schlechte gute Presse wie Microsoft. Schicken Sie mir mal eine schöne Audiodatei, ich probier dann aus. was Sie mit meinem Rechner für Gemeinheiten planen.

(über Fefe's Blog mit Dank an R. Murschall und PC Mag mit Dank an R. Jaekel)

24 Januar 2007

c't-Bericht: Spracherkennung

 "Die Spracheingabe von Windows Vista tritt gegen etablierte Diktiersysteme an" - so titelte die c't in ihrer Ausgabe 3/2007. Der vierseitige Bericht über die drei derzeit am Markt erhältlichen Spracherkennungssysteme - Dragon NaturallySpeaking Preferred, Linguatec VoicePro und die Spracherkennung von Windows Vista - gibt einen recht ausführlichen Überblick über den Nutzen der jeweiligen Systeme für Einzelanwender. Außerdem wird zum ersten Mal die Windows Vista-Spracherkennung wirklich ausführlich mit den bereits bekannten Systemen verglichen.

Ohne jetzt ins Detail gehen zu wollen, zeigt sich, dass Dragon NaturallySpeaking nach wie vor das überlegene System ist. Linguatec VoicePro ist dagegen technisch abgeschlagen, was daran liegt, dass IBM das Produkt nicht mehr wirklich weiterentwickelt. Der einzige Vorteil ist das mitgelieferte 
Headset (Sennheiser PC 25).

Windows Vista liegt in der Mitte - gelobt wird die Erkennungsrate (wie bekannt) und die Möglichkeit, den PC per Sprache zu steuern. Dieses wird sogar als die eigentlich herausragende Funktion der Spracherkennung in Windows Vista genannt, weil das Diktat in Nicht-Microsoft-Anwendungen nämlich schlicht und ergreifend nicht funktioniert. Auch werden viele Headsets nicht unterstützt - ein Fakt, auf den Michael Spehr bereits in seinem Test hingewiesen hat (siehe unten). Positiv hervorgehoben wird die Bedienung und die schlanke Oberfläche, gegen die die beiden anderen Programme "antiquiert" wirken.

Endlich wissen wir auch, dass einige andere Funktionen in Windows Vista nicht enthalten sind. So können keine Diktate vom Diktiergeräte umgesetzt werden, das Vokabular kann nicht exportiert werden und wird auch nur mit großen Mühen bearbeitet, einige schnelle Formatierungsfunktionen während des Diktierens fehlen ganz, und auch Makros können nicht definiert werden. Schließlich ist es auch nicht möglich, ein Diktat zwischenzuspeichern und später zu korrigieren. Selbstverständlich kann der Text gespeichert werden, die Aufnahme jedoch ist verloren - was bei Dragon NaturallySpeaking Preferred auch der Fall ist und der Professional-Version vorbehalten bleibt. Von den preiswerten Spracherkennung kann das nur Linguatec VoicePro. Da allerdings bei diesem Programm sämtliche Netzwerkfunktionen fehlen, ist es auch nicht wirklich als Alternative für einen professionellen Diktanten geeignet, der nicht viel Geld ausgeben möchte.

Und das ergänzt Michael Spehr:

nach längerem Arbeiten mit der Vista-Spracherkennung komme ich immer mehr zu dem Eindruck, dass sie nur Teil einer Sprachbedienung des Betriebssystems ist und damit a) sich an Behinderte richtet und b) was die Business-Funktionen betrifft, nur den Funktionsumfang einer Light-Version hat. Es ist wirklich kein Ersatz für den Drachen, inbesondere weil man bei der Korrektur nicht eben schnell einen Eigennamen via Tastatur eingeben kann. Tut man das, lernt das System nicht dazu. Begriffe mit Umlauten bekommt man im Buchstabiermodus nur ganz schlecht hin. Insofern kann man also nicht mit Dragon vergleichen. Korrektur durch eine Sekretärin: m.W. nein, Netzwerk: nein, Vokabular-Werkzeug: nur rudimentär.
Profis, bleibt dem Drachen treu!

23 Januar 2007

Elektronischer Dolmetscher in Albuquerque

Reaching Across the Language Barrier
- titelt das Speech Technology Magazine im November/Dezember 2006. Vorgestellt wird ein System, mit dem die Polizei von Albuquerque, New Mexico, mit dort auffällig gewordenen Personen kommuniziert, die nur spanisch und kein Englisch sprechen.

Es handelt sich um eine Kombination aus maschineller Übersetzung und Spracherkennung: der Polizist beziehungsweise die zu vernehmende Person spricht in den Computer, die spracherkannte Äußerung wird über ein Übersetzungsprogramm in die andere Sprache übertragen. Es zeigt sich, dass die Polizisten eine Erfolgsquote von 100% haben, ihre Kunden allerdings nur von ungefähr 70%. Das wird damit begründet, dass die Polizisten sowohl die Spracherkennung auf ihre Art zu sprechen trainieren konnten wie auch solche Äußerungen zu bilden gelernt haben, die von der maschinellen Übersetzung einfach übertragen werden können, während dies natürlich bei den Leuten, die vernommen werden, nicht der Fall ist - abgesehen davon, dass einige von ihnen natürlich wenig kooperationsfreudig sind.

Man mag zu dem Projekt stehen, wie man will, aber technisch zeigt es, dass ein automatischer Dolmetscher offensichtlich inzwischen wirklich praxistauglich ist. Allerdings wird auch ganz genau definiert, wofür er taugen muss: es geht nicht um grammatikalische Korrektheit, sondern einfach darum, den Inhalt einer Aussage verständlich in die Zielsprache zu übertragen. Somit misst sich der Erfolg an der gelungenen Kommunikation beziehungsweise der gelungenen Übertragung der Sprecherintention, nicht an irgendetwas anderem.

Nicht das schlechteste Kriterium - vor allen Dingen eines, was in der Praxis taugt, und von den Diskussionen über irgendwelche Prozentzahlen ablenkt. Es kommt halt immer darauf an, wozu man ein Werkzeug einsetzt.

Lieferant ist übrigens SpeechGear, Inc., das Produkt heißt Interact speech translation system. Wenn man sich anschaut, was die sonst noch haben, ist das entweder eine der heißesten Entwicklungsfirmen auf dem Sprachenmarkt oder der größte Produzent von Vaporware (oder warum kann ich nur die Hälfte der Produkte tatsächlich bestellen?) Zu den Partnern gehören u.a. PROMT und Nuance - das kann nicht ganz schlecht sein :-)

18 Januar 2007

Software-Konzern: Weltspitze im Gespräch mit dem Rechner - Wirtschaft - SPIEGEL ONLINE - Nachrichten

Spiegel Online über die Geschichte von Visioneer - Scansoft - Nuance, OCR, sprecherbhängige und -unabhängige Software. Wer sich für das Unternehmen hinter dem Drachen interessiert, erhält hier die Fakten schön aufgeführt, und auch die Absichten für die nächsten Jahre - u.a. die Hardware-Anforderungen zu senken. Da ist DNS 9 ja schon ein Schritt in die richtige Richtung :-)

Instrument der Kundenbindung

"Kommen Sie solide rein" - das hat mit diesem Blog nicht ganz geklappt. 
Kaum war der letzte Beitrag abgeschickt, wurde ich von Blogger abgemeldet - wegen Spamverdacht. Es gebe viele Blogs, die nur den Zweck verfolgten, Links auf kommerzielle Seiten zu setzen, damit die Ergebnisse von Suchmaschinen verfälschten usw. - und ich sei im Verdacht, genau dies zu tun. Ein Blick auf einen Kommentar zu meinem letzten Post zeigt tatsächlich, dass sich hier jemand eingeschlichen hat, der genau dies tat und jede Menge italienischer Porno-Links eingetragen hat - und ich muss drunter leiden :-( 

Heute morgen dann die Entwarnung: ich darf weiter posten, dieses Blog wurde als nicht-kommerziell oder zumindest als nicht-spammend eingestuft. Was es ja auch ist. Suchmaschinen-Marketing habe ich lange genug gemacht, um die Tricks zu kennen und zu wissen, welche man besser nicht anwendet, wenn man an langfristigem Erfolg interessiert ist. Und eine (inzwischen von mir entfernte) Linkliste zu dubiosen Seiten ist, wie man sieht, kein Mittel für lang anhaltenden Erfolg.

Jetzt will ich gar nicht leugnen, dass dieses Blog aus kommerziellen Interessen entstanden ist. Wenn jemand, der mit Spracherkennung Geld verdient, ein Blog über Spracherkennung macht, 
dann natürlich auch mit dem Hintergedanken, Kunden zu binden und evtl. neu zu werben. In der letzten Zeit ist dies allerdings für mich in den Hintergrund getreten; diese Site entwickelt sich mehr zu einem Kommunikationsweg mit anderen Anwendern, von denen einige auch mal Kunden waren. Ist das so okay?

Ein Kommentator wünscht sich mehr Tipps für Sprachbefehle. Bitte sehr:

"Schreib das als Zahl" wandelt die Zahlwörter von eins bis neun in Ziffern um, und zwar ALLE Zahlwörter in der letzten Äußerung. Beispiel:

- "Um Eierkuchen zu backen, brauche ich ein"
- "Schreib das als Zahl"
-> "Um Eierkuchen zu backen, brauche ich 1"
... "Ei und zwei"
- "Schreib das als Zahl"
-> "Ei und 2"
... "Esslöffel Mehl pro Person."

Das ist umständlich und langsam, also sprechen Sie den Satz mutig in einem Atemzug durch und dann erst den Befehl. Das funktioniert genauso gut:

- "Um Eierkuchen zu backen, brauche ich ein Ei und zwei Esslöffel Mehl pro Person."
- "Schreib das als Zahl"
-> "Um Eierkuchen zu backen, brauche ich 1 Ei und 2 Esslöffel Mehl pro Person."

Zahlenformatierung ist überhaupt ein weites Feld - demnächst mehr davon. Als Instrument der Kundenbindung lebt dieses Blog ja davon, dass Sie regelmäßig was zu lesen haben, da will man nicht all sein Pulver auf einmal verschießen...

02 Januar 2007

 "Kommen Sie solide rein!" und "Betrunken ist man erst, wenn man nicht mehr liegen kann, ohne sich festzuhalten" - zwischen diesen Ratschlägen spielte sich mein Übergang ins Neue Jahr ab. Ab heute bin ich also wieder solide und berichte weiter in unregelmäßigen Abständen aus der schönen Welt der Spracherkennung und des digitalen Diktierens.

Blogger ist inzwischen auf eine neue Version umgestiegen, so dass ich vor kurzem auch das Design des Blogs geändert habe. Leider ist das neue Blogger noch im Beta-Stadium, so dass es manchmal Probleme mit dem Layout, besonders mit den Zeilenumbrüchen, gibt. Das bitte ich zu entschuldigen.  (Sehen Sie, was ich meine? :-)

Was mich angeht, so dürfte sich inzwischen herumgesprochen haben, dass ich im November 2006 von abitz.com zur 4voice AG gewechselt bin. Dort mache ich technischen Vertrieb, d.h. kümmere mich darum, dass unsere 
Kunden auch wirklich das System erhalten, was sie brauchen. In den ersten zwei Monaten hieß das konkret:
reisen und installieren. War nicht so geplant, hat auch dazu geführt, dass die Beiträge hier seltener geworden sind, soll aber demnächst mal wieder anders werden. 

Auf jeden Fall habe ich für alle Anfragen ein offenes Ohr, auich wenn die Antwort manchmal etwas länger dauert. Ich gebe auch gern weiterhin Tipps "off the record", also ohne spezifisches Verkaufsinteresse. Allerdings muss ich auch sagen: Wenn ich nicht überzeugt wäre, dass 4voice tatsächlich eine sinnvolle Lösung für Spracherkennung in einem professionellen Umfeld mit mehreren Arbeitsplätzen, evtl. Korrekturplätzen usw., böte, wäre ich nicht gewechselt. Vielleicht schreibe ich ja demnächst mal was darüber, was wir besser machen als Nuance, bzw. wo wir dem Drachen auf die Sprünge helfen (mein Chef wirds mir danken :-).

Jetzt über den eigenen Tellerrand hinaus:

Im letzten Jahr hat im Bereich Spracherkennung v.a. Microsoft von sich reden gemacht. Die Spracherkennung in Windows Vista wird allgemein gelobt, auch wenn sie offenbar noch nie jemand wirklich im Einsatz hatte - auch ich nicht; meinen neuen Rechner habe ich ein paar Wochen vor der Vista-Einführung erhalten. Es gibt bei Microsoft jetzt eine neue Community, in der Vista Spracherkennung 
genauer beschrieben wird.

Auch Nuance hat mit Dragon NaturallySpeaking 9 eine neue Version auf den Markt gebracht, die die ohnehin gute Spracherkennung noch einmal verbessert hat, aber nichts wirklich revolutionär neues brachte. 
Dies ist aber auch nicht unbedingt zu erwarten, solange man das Haupteinsatzgebiet im Diktieren sieht. Hier ist die Technik weitgehend ausgereizt; es kann nur noch darum gehen, die Erkennung auch für den letzten Stotterer (no offence meant) noch zu optimieren.

Der Dritte im Bunde, IBM, hat sich aus dem Diktiergeschäft de facto verabschiedet. Nur Linguatec hört nicht auf, dem Eindringling Widerstand zu leisten aus alter Freundschaft ViaVoice weiterzuvertreiben, und hat in der Version 11 die dialektalen Varianten des Deutschen besser eingearbeitet. Somit ist vielleicht nicht jeder Stotterer, aber mancher Niederbayer jetzt mit Linguatec Voice Pro 11 besser bedient als mit dem Vorgänger.

Das Urteil der Jury lautet aber nach wie vor: Dragon ist der Platzhirsch. Uneinig ist man sich jedoch, wie die Vista-Spracherkennung wirken wird - ob MS "den Netscape macht", ob - wie ich befürchte - eine Reihe Heimanwender Spracherkennung ausprobiert und erfolglos wieder sein lässt (und damit allen Herstellern schadet), oder ob Vista der Spracherkennung zum Durchbruch verhelfen könnte. Ich sehe eine Chance v.a. in der Sprachsteuerung, die bei Dragon bisher unterschätzt wurde. Nicht, weil sie nicht möglich ist - im Gegenteil, mit der Dragon-eigenen Skriptsprache ließen sich auf Wunsch ganze Anwendungen schreiben. Aber viele Anwender kennen nicht einmal den Befehl "geh schlafen", oder wenigstens die Taste zum Ein- und Ausschalten des Mikros (die Plus-Taste am Nummernblock - jetzt wssen Sie es auch), sondern klicken tatsächlich brav mit der Maus auf das Symbol oben links in der Ecke.

Ach, wenn man wollte, wie man könnte! Dann würde ich allen meinen Kunden - sei es meinen alten Bekannten von abitz.com, sei es meinen neuen Profidiktierern aus dem 4voice-Kundenstamm - Sprachbefehle beibringen, dass der Cursor nur so tanzt. Fangen wir doch einfach zum neuen Jahr mal an:
"verbinde [Wörter]"
vereinigt zwei (oder mehr) Wörter zu einem - und setzt im Zweifel sogar ein korrektes Fugen-S! Probieren Sie es aus: 

"Das Neujahr Konzert der Berliner Philharmoniker"
verbinde Neujahr Konzert
"Das Neujahrskonzert der Berliner Philharmoniker"

Ein, wie der Berliner wünscht, gesundes Neues Jahr Ihnen allen, und Dank an alle Leser, Beiträger, Kommentatoren!

21 Dezember 2006

Gastbeitrag: Spracherkennung in Windows Vista

"Ich habe jetzt einige Stunden mit der eingebauten Spracherkennung in Windows Vista (finale Version) experimentiert. Erste Beobachtungen: Es gibt ein empfehlenswertes Benutzertraining wie bei Dragon, ungefähr in der gleichen Länge. Anschließend ist die Erkennungsleistung sehr, sehr hoch. Ich schätze mal ungefähr so gut wie bei Dragon 9. Das gesamte Auftreten der Spracherkennung wirkt modern und frisch, manches wünscht man sich auch bei dem Drachen. Statt einer oberen Menüleiste existiert nur ein kleiner Indikator-Button, der den aktuellen Zustand anzeigt. Wie bei Dragon läßt sich das Vokabular durch Analyse der eigenen Word-Dokumente und E-Mails ergänzen. Das habe ich nicht getan, und trotzdem werden nicht alltägliche Begriffe wie "DSL-Gebühren" oder "Thyssen-Krupp" von Anfang an verstanden (offene Frage: wird dynamisch mit dem Erstellen neuer Text aktualisiert?). Insgesamt ist die Ausstattung so etwas wie "Dragon light". Es fehlen also viele Optionen und Möglichkeiten eines professionellen Systems und es wird Appetit gemacht auf "mehr". Man kann sich gut eine Plus-Version vorstellen. Mein gewichtigster Einwand gegen die Microsoft-Spracherkennung ist das Korrekturverhalten. Man kann falsch Verstandenes im Korrekturfenster mehrfach neu vorsprechen. Häufig wird es dann richtig erkannt. Aber es ist definitiv nicht möglich, schnell einen Eigennamen oder Fachbegriff per Tastatur einzugeben. Man muß vielmehr buchstabieren, und das ist eine Qual. Schon aus diesem Grund wird der professionelle Diktierer vorerst beim Drachen bleiben. Indes ist das alles ein sehr erfolgversprechender Anfang. Die Spracherkennung hat übrigens die Versionsnummer 8, die Textausgabe ist nur amerikanisch möglich. Das Parrot-Headset arbeitet nicht mit Vista zusammen, ich habe also mit dem Olympus-Diktiermikro DR-2000 gearbeitet. Dr. Michael Spehr, 19.12.06" 

Vielen Dank für den Beitrag!

18 Dezember 2006

Dragon 9 Service Pack 1

Das Service Pack 1 für Dragon NaturallySpeaking 9 ist da. 
Hier findet sich die Ankündigung und Technote bei Nuance. 

Willi Sander hat einen direkten Download-Link und eine teilweise Übersetzung hier bereitgestellt:
http://www.fachvokabulare.de/
und dann Klick auf "Programme".

Hier noch seine Ankündigung und eine kleine Forumsdiskussion über die richtige Installation.

Interessant für Entwickler ist v.a. die Bearbeitung des VocTools, mit dem jetzt hoffentlich wieder möglich ist, ein Vokabular inkrementell, also Schritt für Schritt aufzubauen.

Nach der Installation kann ich für meinen Teil feststellen, dass zumindest das Zahlenformat, welches angeblich jetzt besser laufen soll, immer noch nicht ganz alltagstauglich ist - "22 per Dezember 2006" kommt immer noch genauso häufig wie 22.12.2006.  

10 Dezember 2006

FAZ-Test von Linguatec Voice Pro

Hier noch der Nachtrag zu den letztlich gebloggten Kritiken von Linguatec Voice Pro 11: 

Michael Spehr, FAZ-Spezialist fürs digitale Diktat, hat Voice Pro in der Ausgabe vom 5.12.2006 getestet. Sein Fazit: zu loben sind die hohe Erkennungsrate, der günstige Preis von 200 € und die verhältnismäßig bescheidenen Systemanforderungen (Kunststück – der verwendete Erkenner ist ViaVoice 10.5, das ist drei der vier Jahre alt). Auch die Arbeit mit Anwendungen, die im Browser laufen, gehe flüssiger als mit Dragon. Outlook Web Access funktioniert laut Testbericht mit VoicePro besser als mit Dragon. Im professionellen Einsatz sei Linguatec VoicePro jedoch keine Alternative zu Dragon NaturallySpeaking: der Lernprozess der Software sei deutlich komplizierter, und das zu erzielende Lernergebnis in der Spracherkennung niedriger.

Dies deckt sich mit meinen Erfahrungen, die ich vor Jahren mit Voice Pro 10 gemacht habe: die Ansätze sind gut, die Erkennung schwankte zwischen fehlerfrei und völlig indiskutabel, und die Korrektur war gewöhnungsbedürftig. Mir fielen außerdem schon damals die vielen kleinen Ärgerlichkeiten auf, die der Tester auch jetzt wieder erwähnt – viele Funktionen sind einfach nicht sauber umgesetzt, das Wechseln zwischen den Fenstern dauert elend lange, die Kompatibilität mit Word war nur im Prinzip gewährleistet, und was dergleichen Bugs mehr sind.

05 Dezember 2006

Linguatec VoicePro 11 im Test

Gut, das Nuance-Forum ist nicht unbedingt der Ort, an dem man Lob von ViaVoice, 
und sei es in seiner Inkarnation als Linguatec Voice Pro,  erwarten würde. Insofern stimmt ganz hoffnungsvoll, dass einige Anwender durchaus ein positives Wort darüber verlieren - auch wenn der Drache weiterhin für sie erste Wahl bleibt.

So schreibt Willi Sander:

Wie nicht anders zu erwarten war, verbirgt sich hinter VoicePro 11 die 10.5er Engine von ViaVoice. Trotzdem ist die Erkennungsgenauigkeit erstaunlich gut. [...] Die Bearbeitung der benutzerdefinierten Wörter ist immer noch ein Krampf, das Austauschen von Wortlisten ist nicht möglich.
Alles in Allem eine Alternative für Hobbyanwender [...].
Rolf Richter:

Seit fast zwei Wochen bin ich im Besitz der Version 11 von ViaVoice.  [...] Die Firma Linguatec hat ziemlich gute Arbeit geleistet, die befürchteten Defizite waren meist nicht mehr vorhanden.
[...] 
Trotzdem, wenn ich ein Resümee ziehen sollte-ich bleibe natürlich bei Dragon, dies ist doch die bessere Alternative. Die Genauigkeit bei der Erkennung ist um einiges besser, auch die Korrektur ist schneller bewerkstelligt, die Übernahme neuer Wörter in das Vokabular ist ungleich effektiver, den größten Vorteil finde ich, dass man direkt in das Vokabular gehen kann, um dort Veränderungen vorzunehmen, zum Beispiel löschen usw. es ist bei ViaVoice eigentlich kaum möglich.  [...] Dieser Beitrag wurde mit ViaVoice verfasst, ohne größere Verzweiflung.
Georg Eisenmann:

Nach einem recht langen Training, bei dem das erste Wort eines Satzes oft nur schwer vestanden wurde, habe ich dann drauf los diktiert. Leider war das Ergebnis nicht berauschend. In jedem Satz mehrere Fehler. Nicht einmal das Wort VoicePro wurde verstanden. Darüber recht geschockt versuchte ich mich anschließend mit dem neuen Mikrofon (von Sennheiser) an Dragon. Hier wurde dann weitaus mehr verstanden, dann und wann ein Fehler im Satz, aber passabel.
Der kurze Vergleich war fair: Weder VoicePro noch Dragon wurde mit alten Dokumenten gefüttert oder anderweitig optimiert wurde. Es fand auch nur jeweils das Anfangstraining statt (ca. 5 Minuten bei Dragon und bestimmt 15 Minuten bei Voicepro. Ein echter Test war das natürlich nicht.
Wie mir mein Vater gerade sagt, steht auch in der FAZ heute ein Test, der ähnliche Ergebnisse liefert - das Diktat ist an sich nicht schlecht, das Vokabular lässt sich aber nur umständlich bearbeiten. So muss fast jedes neue Wort trainiert, d.h. vorgesprochen werden - das hatten wir doch überwunden geglaubt? Sobald ich den Test vorliegen habe, trage ich ihn hier nach.

Einen eigenen Test werde ich aber wohl kaum durchführen können, wo ich doch jetzt bei der Konkurrenz bin, Rike...

04 Dezember 2006

Elektronischer Dolmetscher erhöht die Glaubwürdigkeit - ?!?

Das US-Militär testet den elektronischen Dolmetscher Englisch-Arabisch "Mastor" von IBM - so vermeldet die PC-Welt online.  

Der Anwender, beispielsweise ein US-Soldat, würde dann ganz normal in das Mikrophon sprechen, worauf die IBM-Software simultan mit der Übersetzung beginnt und den Inhalt auf Arabisch per Lautsprecher ausgibt. Umgekehrt wird die Antwort auf Arabisch ins Englische übersetzt. Darüber hinaus werden die Sätze zu Kontrollzwecken sowohl in der Originalsprache als auch in der Übersetzung auf dem Display angezeigt und der übersetzte Satz wird zugleich in die Originalsprache zurück übersetzt, um es dem Originalsprecher zu ermöglichen, Missverständnisse oder falsche Übersetzungen schnell zu erkennen und gegebenenfalls zu korrigieren.
Ob das funktioniert? Meine Ergebnisse mit Dragon-Spracherkennung und PROMT-Übersetzung waren nicht wirklich alltagstauglich. Auch die Rückübersetzungsfunktion scheint mir nicht 
die beste Kontrollmöglichkeit, ob das Gegenüber wirklich das Gemeinte verstanden hat. Wer die einschlägigen Seiten für maschinelle Übersetzung kennt, weiß, dass hier gerne mal "Stille Post" gespielt wird. Legendär die Hin- und Her-Übersetzung des "Adobe Acrobat Reader" als "Lehmziegel Seiltänzer Leser" oder noch schöner "Ziegelsteinseiltänzerleser". Den Ernstfall möchte man sich nicht wirklich vorstellen. 

Einerseits: wenn die US Army mit dem entsprechenden Kapital dahintersteckt, kommt ja vielleicht wirklich was dabei rum...

Andererseits: eine kurze Recherche fördert diesen Artikel der Netzeitung zutage. Wenn es darum geht, dass eine Maschine vertrauenswürdiger [sic!] 
übersetzt als ein Mensch, und das auch noch jemand glaubt (!), 
dann sind wir wirklich weit gekommen - aber nicht unbedingt technologisch.

03 Dezember 2006

Der Blaupapagei

Seit einer Woche diktiere ich mit dem Bluetooth-Headset B150 GTX von VXI (auch unter BlueParrott bekannt) und kann nur sagen: so viel Spaß hatte ich selten beim Diktieren. Sehr guter Tragekomfort, ausgezeichnete Erkennung und kein Kabel - bei dem Gerät werde ich in der nächsten Zeit bleiben. Für mich allein schon wegen des Tragekomfort wesentlich besser als Xovox, auch wenn ein Kopfbügel natürlich nicht jedermanns Sache ist.

Das Gerät ist sehr robust gebaut, mit einem metallenen Kopfbügel und einem stabilen Mikrofonarm. Auch das Ohrpolster ist aus robustem Kunstsoff, lediglich der Mikrofonschutz sitzt - wie immer bei VXI - etwas locker und sollte fixiert werden. Am Headset selbst git es drei Tasten - eine Multifunktionstaste für an, aus, pairing; je eine für lauter bzw. leiser, wobei ein viersekündiger Druck auf die "Lauter"-Taste das Mikro stumm schaltet.

Die Reichweite des Headsets habe ich mit Skype ausprobiert. Sie beträgt mit dem Anycom-Dongle ca. 10m, wobei die Wände nicht zu dick sein sollten. Aus dem Nebenzimmer funktioniert es, aber über den Flur wird es langsam kritisch, und die Übertragungsqualität sinkt rapide. Aus der Entfernung wird aber niemand diktieren wollen.

Einen kleinen Abstrich musste ich beim Ladegerät machen, das für den mobilen Einsatz konzipiert ist und daher nicht sehr standfest ist. Die Handelsausgabe wird mit einem stabilen Ladegerät geliefert (s. Bild).

Dafür habe ich einen Anschluss an den Zigarettenanzünder, so dass man das Headset zur Not auch im Auto laden kann - wer's fürs Handy braucht. (Persönliche Meinung: fürs Handy ist es zu schade, zum Telefonieren tuts jedes billige Ding, aber für Spracherkennung - und die geht nicht wirklich im Auto - muss es was Gutes sein.) Es gelten natürlich wie immer die üblichen Abstriche für Bluetooth, also dass man zum Beispiel bei jedem Start des Rechners wie auch nach dem Laden die Verbindung neu herstellen muss.

Obwohl Dragon 9 explizit Bluetooth-Headsets unterstützt, habe ich das Gerät als Standard Mic-Line In angelegt, und es hat nicht geschadet. (Hintergrund: gelegentlich speichere ich Diktate zur späteren Korrektur, und dann fordert Dragon dasselbe Eingabegerät, welches auch zum Diktieren benutzt wurde. Ich habe schon erlebt, dass Korrekturplätze nicht gearbeitet haben, wenn nicht das Original Philips Speechmike dranhing. Mit Mic/Line in ist man da auf der sicheren Seite: kein Qualitätsverlust beim Diktieren, und bei der Korrektur wird nur abgeprüft, ob eine interne Soundkarte vorhanden ist.) Das Diktat läuft sehr flüssig und mit minimaler Fehlerrate. Im Vergleich zum VXI Parrott TalkPro USB, meinem ehemaligen Standardmikro, konnte ich eher eine leichte Qualitätsverbesserung feststellen, v.a. in der Geschwindigkeit der Umsetzung.

Eine Vorschau des Headsets gibt es unter http://www.jolodata.de/vxi/parrottb150gtx_deutsch.htm, dort hoffentlich bald auch Preise.

29 November 2006

Macht Vista-Spracerkennung den Netscape mit Nuance?

Microsoft Vista to silence IBM ViaVoice, Nuance - titelte der Inquirer schon vor einiger Zeit. Keine Ahnung mehr, ob ich den Artikel damals gebloggt habe, gelesen hab ich ihn auf jeden Fall schon mal.

Wird Spracherkennung jetzt eine Massenanwendung, einfach weil sie so vielen Nutzern kostenlos zur Verfügung steht? Und wird Microsoft damit dasselbe mit Nuance / Dragon machen, was sie im Browserkrieg mit Netscape gemacht haben? Die Antowrt hängt m.E. davon ab,

- wie gut die Spracherkennung wirklich ist, und das heißt: wie alltagstauglich für den ungeschulten Anwender;
- wenn sie es ist: wie viele Leute den Nutzen von Spracherkennung zu schätzen lernen, und ob damit eine so kritische Masse erreicht wird, dass es wirklich ein Massenphänomen wird wie damals das Internet
- und das wird ein Graswurzelphänomen sein: "Probier das mal aus, das ist klasse".
- womit wir wieder beim ersten Punkt wären: Jeder Depp muss mit Vista diktieren können, damit es ein Erfolg wird.

QED: Hat irgendwer wirklich die Spracherkennung von MS Office XP genutzt?

Übrigens: Laut Chuck Runquist, der es wissen muss, hat Nuance / Scansoft keinen Code geliefert, sondern die Entwicklung hat MS allein gemacht - wenn auch unter Berücksichtigung von L&H-Technologie.

Dass sich Vista in vielem wie Dragon benimmt und z.B. auf dieselben Befehle hört, scheint also eher eine Marketing-Entscheidung zu sein.

21 November 2006

Are you talking to me? No! I'm talking to my computer! Check out this new Voice Recognition program.

Endlich hatte ich Zeit, mir dieses Video anzusehen: Spracherkennung in Windows Vista (Englisch, natürlich).

Den Stil der Darbietung muss man mögen - Frage und Antwort dienen hier eigentlich mehr zur zweistimmigen Präsentation der Spracherkennung in Windows Vista. Aber so ist Amerika. Viel beeindruckender sind die Möglichkeiten, die gezeigt werden - und die Dragon NaturallySpeaking alle schon seit Urzeiten enthält :-)

Wirklich schön ist die Tatsache, dass man anscheinend zwei Sprachbefehle direkt hintereinander sagen kann, ohne eine Pause machen zu müssen. Das funktioniert in Dragon NaturallySpeaking nun wirklich nicht.

Auch der Rest - nicht ganz neu, aber beeindruckend. Nun gehen wir natürlich davon aus, dass ein amerikanischer Interviewer, wenn er schon in diesem Stil das Gespräch führt, nicht daran interessiert ist, Fehler zu zeigen. Aber wenn es noch halbwegs in Echtzeit aufgenommen wurde, was da präsentiert wird, so ist die Leistung wirklich sehr gut. Und wenn nicht, wenn ist die Umsetzung in den Film immer noch gelungener als die beiden Nuance, wo der Diktant Herr Meyer "Neue Zeile" sagt und die Spracherkennung einen neuen Absatz macht.

Also: nehmen Sie sich 12 Minuten Zeit und sehen Sie sich das Video an. Interessant ist es auf jeden Fall. Und im Hause Nuance, wenn man keinen Geheimvertrag mit Microsoft abgeschlossen hat (worauf allerdings manche Details schließen lassen), sollte man sich jetzt warm anziehen.

14 November 2006

Wozu man Spracherkennung wirklich braucht (Video)

Nuance hat ein paar Videos bei YouTube eingestellt, von denen Büro Meier - Hilfe endlich zeigt, wozu man Spracherkennung wirklich braucht.

Der Liebesbrief hat auch was, ihm fehlt aber ein wenig der Realitätsbezug - ich nehm das Headset vorher ab :-)

Und die Beschwerde ist vorhersagbar...

Und zum Schluss die Kapitalismuskritik: hier finden sich alle drei Videos in einem schon weniger basisdemokratischen Kontext.

01 November 2006

Aufnahme unerwünschter Wörter in das Vokabular

Die Aufnahme unerwünschter Wörter in das Vokabular kann mit einem Tool von Willi Sander namens dns.comfort.local unterbunden werden. Dieses Werkzeug listet am Ende einer Sitzung alle neu hinzugefügten Wörter auf und lässt die Aufnahme ins Vokabular bestätigen. Auch nicht schlecht; und wohl ein Spin-off von Speechpool, welches diselbe Funktion enthält (aber für die Aufnahme in den Pool, nicht nur ins individuelle Vokabular). Anfragen unter www.oa-sa.de, eine direkte Bestellmöglichkeit gibt es leider nicht.

Noch ein Hinweis auf das Forum, das Willi Sander unterhält - mit guten Tipps, und wenig Diskussion.

Patch A für Dragon 9

Willi Sander weist auf den Patch A für Dragon 9, und zwar für alle Sprachversionen, hin. Dieser Patch verhindert laut Eintrag in der Nuance Knowledge Base das Einfrieren von Dragon während langer zusammenhängender Äußerungen. Den Patch gibt es dortselbst zum Download.

Herr Sander meint, dass der Patch noch ein paar Probleme mehr behebt. Ich kam bisher auch ohne ganz gut zurecht, werde es aber nachher mal probieren.

Nachtrag:
Dragon für 4voice läßt sich damit nicht aktualisieren - ist schon drin, sagt der Installer. Die Nuance-Version hab ich gerade nicht greifbar.

Ich bin jetzt bei der 4voice AG

Persönliche Neuigkeit: ab heute bin ich bei der 4voice AG als Technical Sales Consltant (whatever that means) tätig. Geneigte Leser erreichen mich also ab sofort unter stephan.kuepper [at] 4voice.de.

Natürlich spekuliere ich gern weiter über Fragen, warum der Drache das tut, was er tut, und welches Headset jetzt das beste ist (demnächst im Test das neue BlueParrott). Mein Geld verdiene ich aber mit der Beratung zur Anschaffung größerer Systeme.

Bei der Gelegenheit sollte ich vielleicht noch ein paar Sachen nachtragen, die während des Jobwechsels vergessen wurden oder zu kurz kamen:

- Dictanet macht den Vertrieb jetzt wieder komplett über die Software AG, nachdem die Vertriebs-GmbH fast komplett zu Philips gegangen ist. Zur Strafe verkauft Dictanet jetzt keine Philips-Mikros mehr, sondern rät zu Olympus. Ich höre Philips weinen.

- In der Frankfurter Allgemeinen Sonntagszeitung war letztlich ein Test von Dragon 9, wieder von Michael Spehr. Ich habe drauf verzichtet, ihn großartig zu bloggen, es steht nämlich nichts neues drin (schade, Herr Stückmann, aber die FAZ und FAS wird eben nicht von Dragon-Profis gelesen).

(Danke an Arnd Müller)

26 Oktober 2006

Linguatec berücksichtigt jetzt de Oberbayern

Im Technology Review spricht Dr. Reinhard Busch, Chef von Linguatec, über das neue Linguatec Voice Pro 11 und die verbesserten Akustikmodelle. Einerseits beschreibt er sehr schön die Neuheiten in den verwendeten "akustischen Profilen" (die offensichtlich also nicht auf einer veränderten Spracherkennungsengine beruhen), gibt aber auch für Anfänger interessante Hinweise über die Technik hinter der Spracherkennung (hier noch mehr).

Bisher ist Voice Pro 11 noch gar nicht ausgeliefert. Wenn sich die ersten Erfahrungen einstellen, kommt vielleicht auch ein neuer Post dazu -)

Abhilfe gegen die Aufnahme unerwünschter Wörter in das Vokabular

Im Nuance-Forum werde ich nicht nur zitiert :-) sondern auch ergänzt:

Um Dragon davon abzuhalten, unerwünschte Wörter heimlich ins Vokabular aufzunehmen, kan man nicht nur unter "Optionen" den Haken bei "Dem Vokabular Wörter automatisch hinzufügen" herausnehmen (und dann manche Wörter, z.B. Komposita, manuell hinzufügen müssen). Willi Sander bietet auch ein Tool namens dns.comfort an, welches diese und andere Aufghaben übernimmt. Auf der Website www.oa-sa.de ist das Tool allerdings nicht zu finden. Wem die Forumsdiskussion Appetit gemacht hat, der wendet sich am besten direkt an Herrn Sander.

Übrigens unterhält er auch ein Forum mit vielen interessanten Tricks.

19 Oktober 2006

Linguatec Voice Pro 11 kommt!

Totgesagte leben länger: Linguatec bringt die Spracherkennung Voice Pro in Version 11 auf den Markt - mit einer überarbeiteten Erkennungsmaschine von IBM ViaVoice! Und alle sagen, IBM arbeitet nicht mehr an der Diktiersoftware, sondern konzentriert sich auf Server und Embedded-Lösungen.

VIaVoice ist bei IBM nach wie vor auch nicht als Produkt gelistet, auch Nuance kennt nur VV 10 - die wollen ja auch Dragon verkaufen. Linguatec hat aber immer gute Verbindungen zu IBM gehabt (war ja mal eine Tochtergesellschaft), und da hat man die Entwickler wohl doch noch zur Arbeit an der Diktiersoftware bewegen können.

Linguatec hat nach eigener Aussage die Oberfläche so gelassen, wie sie ist, aber die Erkennung deutlich verbessert. Man ist gespannt, wie es sich in der Praxis schlägt. Die andere Frage ist immer noch, wie es mit der Bedienung aussioeht - da war Dragon immer besser und schneller.

(Mit Dank an Ronny Jaekel)

18 Oktober 2006

C´t über Vista´s Spracherkennung

"Die Diktierfunktion kann noch nicht mit fortgeschrittenen Lösungen wie Dragon NaturallySpeaking mithalten, blamiert sich aber auch nicht.
Immerhin folgt Vista deutschen Befehlen ... und blendet auf das Wort "Mausraster" ein durchnummeriertes Gitter an, das Anwender per Stimme ansteuern können."

(C´t 21/2005)

Rike Bacher hat´s auf Deutsch getestet und war positiv überrascht, auch wenn in ihrer Beta die Befehle nicht funktionierten. V.a. Die Kommandozentrale hatte es ihr angetan.

04 Oktober 2006

KnowBrainer Forum neu designt!

Das KnowBrainer Forum, das beste Dragon-Forum im Internet, hat endlich ein neues, zeitgemäßeres Design. Leider ist es jetzt nicht mehr so einfach zu lesen :-)

Dafür ist es aber weit strukturierter; und man soll die Hoffnung nicht aufgeben, dass vielleicht irgendwann so etwas wie eine FAQ-Liste aus den immer wiederkehrenden Themen erwächst. T3echnisch sollte es jetzt zu realisieren sein. Unter http://speechwiki.org/SR/NaturallySpeakingFAQ.html stelt Ian (Natajus), ein eifriger Mitleser und -schreiber, aber gerade welche zusammen, und deutschsprachige Leser kennen vielleicht auch die Dragon-FAQs bei abitz.com, die vom Autor dieser Zeilen zusammengestellt wurden.

22 September 2006

VXI Roadwarrior Bluetooth-Headset

Die Firma VXI ist bekannt für ihre robusten Headset-Lösungen, die darüber hinaus eine hervorragende Tonqualität für Spracherkennung mit Dragon NaturallySpeaking bieten. Das VXI Parrott TalkPro ist seit längerer Zeit das Headset meiner Wahl, weil es bequem sitzt und unter günstigen Umständen eine praktisch hundertprozentige Erkennung meiner Sprache garantiert. In Amerika sind schon länger Bluetooth-Lösungen von VXI auf dem Markt, von denen die ersten Geräte jetzt auch in Deutschland getestet werden. Ich hatte die Möglichkeit, ein solches Gerät - blueparrott RoadWarrior B150 - vom Distributor Jolo Data zum Test zu erhalten. Das Headset selbst wendet sich, wie der Name schon sagt, eigentlich an Lkw-Fahrer, die unterwegs mobil telefonieren möchten und eventuell auch den Computer nützen möchten - zumindest ist auf der Verpackung ein rustikal aussehender Herr im Führerhaus eines Lkw mit einem Notebook auf den Schoß zu sehen.

Die solide Ausführung des Headset bezieht sich also auf den potentiellen Einsatzbereich. Jedoch wurde das Headset auch von Nuance für Dragon NaturallySpeaking zertifiziert; um es mit einem PC zu verwenden, muss diese entweder Bluetooth-fähig sein oder man benötigt einen Bluetooth-Adapter. In kurzer Zeit soll aber ein fertiges Paket mit Headset und Bluetooth-Adapter lieferbar sein.

Voraus schicken muss ich, dass Bluetooth und ich zwei verschiedene Welten sind. Es ist mir noch nie gelungen, ein Bluetooth-Gerät auf Anhieb anzuschließen und zu benutzen. Vor diesem Hintergrund ging es erfreulich schnell, das Headset mit meinem PC zu verbinden. Nachdem es über Nacht aufgeladen wurde, ließ es sich problemlos verbinden und als Standard-Gerät einstellen.

Auch der Einsatz mit der Spracherkennung Dragon NaturallySpeaking gestaltet sich verhältnismäßig unproblematisch. Wichtig ist, das Bluetooth-Headset als zusätzliche Diktierquelle anzulegen. Man muss man leider noch einmal ein vollständiges Benutzertraining absolvieren, bevor man anfangen kann zu diktieren. Es hilft nicht, einfach nur den Audio-Assistenten auszuführen - die Erkennungsgenauigkeit ist danach absolut unzureichend.

Auch beim Anlegen des Bluetooth-Headset als neuer Diktierquelle hatte ich das Problem, dass am Anfang die Übertragung anscheinend nicht ausreichend war. Zumindest erschien im Audio-Assistent beim Einstellen der Lautstärke eine Fehlermeldung, es war unmöglich, weiter zu gehen. Im letzten Schritt erzielte ich dann immerhin 17 Punkte. Dies ist etwas unter meinem gewöhnlichen Durchschnitt.

Zunächst mal kann ich sagen, dass das Headset sehr bequem sitzt. Es wird nicht am Ohr befestigt, sondern mit einem Überkopf-Bügel, welcher anscheinend derselbe ist wie beim VXI Parrott TalkPro. Jedenfalls ist das Gerät sehr bequem. Optisch etwas gewöhnungsbedürftig ist die relativ große Sendestation am Ohr, die darüber hinaus während der Arbeit blinkt - die Kollegin beschwert sich schon über die Leuchtzeichen, die ich aussende. Das Gewicht und der ausgeübte Druck sind auf jeden Fall sehr gut auch über längere Zeit zu ertragen.

Am Gerät selbst sind drei Knöpfe - ein Multifunktions-Knopf, mit dem sich zum Beispiel das Headset stummschalten oder auch Telefongespräche annehmen lassen, zwei Knöpfe zur Lautstärkeregelung.

Jetzt zur Qualität der Spracherkennung. Das erste System, auf dem das Gerät getestet wurde, ist ein Computer mit einem Pentium vier-Prozessor, 3,4 GHz, 1 GB RAM. Der verwendete Bluetooth-Strecke stammt von der Firma BlueSoleil - zu meiner Schande sei's gesagt, aber es ist ein einfacher Aldi-Rechner. Die erste Zählung von Wörtern und die Ermittlung des Fehlerquotienten ergibt:

516 Wörter, 13 Erkennungsfehler (wenn man die regelmäßige Fehlerkennung von Bluetooth als Lotus nur einmal wertet) - also eine Erkennungsgenauigkeit von 97,5% nach der Formel 100-(Fehler*100/Wörter) = Erkennungsrate in %.

Ein Test auf einem Notebook (Pentium M. 1,8 GHz, 1 GB RAM) ergibt ein ähnliches Bild. die Erkennung läuft hier etwas schneller als auf dem Desktop-PC, bei der Konfiguration beziehungsweise beim Benutzertraining ergab sich dasselbe Problem mit der Lautstärke Einstellung des Mikrophons.

Als Bluetooth-Stack kommt ein Dongle zum Einsatz, das ursprünglich für die Verbindung mit einem Sony Ericsson-Headset vorgesehen war (im Paket als Xovox Communicator erhältlich). Angeblich ist dieser Bluetooth-Stack besonders gut zur Zusammenarbeit mit Spracherkennung geeignet. Im übrigen habe ich das Sony Ericsson-Headset früher mit beiden Rechnern verwendet, konnte aber keine großen Unterschiede in der Qualität auf dem einen oder anderen Rechner feststellen.

Bezüglich der Spracherkennungsqualität lässt sich feststellen, dass die Übertragung um einiges schneller geht als bei dem Olympus-Mikrophon, welches ich sonst verwendet hatte. Der gesprochene Text erscheint schneller auf dem Bildschirm. Allerdings machten sich bei beiden Testrechnern Verzögerungen bei der Erkennung von Befehlen bemerkbar. Dies ist in Dragon NaturallySpeaking 91 bekanntes Problem. (Auch wie diese ärgerliche Zusammensetzung von einer Zahl und dem unbestimmten Artikel zu einer anderen Zahl - aber dazu gibt es ja Tricks, wie man es vermeiden kann. Man muss nur daran denken, zum Beispiel "Dragon NaturallySpeaking 9 Leertaste ein bekanntes" zu sagen.)

Auffällig ist in dieser Kombination, dass nicht nur die Geschwindigkeit der Spracherkennung besser ist, sondern auch die Qualität. Abgesehen von völlig unbekannten Wörtern wird mein Diktat nach DragonPad mit fast 100 prozentiger Genauigkeit erkannt. (Und auch hier zeigt sich wieder eine Schwäche von Dragon NaturallySpeaking: sobald man anfängt, dass Programm zu loben, macht es Fehler.)

Nach Korrektur aller Erkennungsfehler und Abzug der Wörter, die nicht im Wörterbuch enthalten sind, ergibt sich eine Erkennungsgenauigkeit von 98%.

Inwiefern also ratsam ist, eine bestimmte Bluetooth-Software zu verwenden, sei einmal dahingestellt; ein Unterschied von einem halben Prozent in der Erkennungsgenauigkeit ist hier nicht wirklich aussagekräftig, schon gar nicht, wenn zwei verschiedene Rechner verwendet werden. Jedenfalls lässt sich schon nach einer oberflächlichen Betrachtung sagen, dass das VXI Roadwarrior-Headset eine gute Wahl ist, wenn man ein robustes, bequem zu tragendes schnurloses Headset sucht. Wenn dann demnächst der entsprechende Bluetooth-Adapter mitgeliefert wird, könnte es mein neues Lieblings-Headsets werden.

Huh!

"Endlich versteht dich jemand" - wirbt Nuance für Dragon NaturallySpeaking 9. Politisch korrekt ist die Verständnis heuchelnde Dame aber nicht :-)

Und eine hübsche Sammlung von Missverständnissen aus dem medizinischen Bereich (Englisch) gibt es beim Knowbrainer.

20 September 2006

Wie Zahlen funktionieren

Wie das Diktat von Zahlen funktioniert, erklärt Dieter Ruckstuhl von Mevotec im Dragon-Forum. Hilfreich auch die Hinweise von D. Peters und Carsten Stückmann in Antwort-Postings bezüglich der alten Probleme des Diktats von 20ern, Daten, und dem unbestimmten Artikel vor oder nach einer Zahl. Immer noch Workarounds, aber es geht.

Was mir auffiel, ist dass das Diktat von Ordnungszahlen in DNS Legal 9 einwandfrei funktioniert, in Professional hingegen nicht :-(

11 September 2006

Interview with Oliver Scholz: Vista Speech UX Program Manager at istartedsomething

Interview with Oliver Scholz: Vista Speech UX Program Manager at istartedsomething


Long Zheng's Blog heute mit einem Interview: Oliver Scholz, Produktmanager bei Microsoft und verantwortlich für die "User Experience" (d.h. die Benutzerführung bzw. Bedienbarkeit) der Spracherkennung in Windows Vista, hat eine Menge dazu zu sagen.

Richtig interessant wird die Spracherkennung wohl erst in ein, zwei Jahren, wenn Makro-Unterstützung, Vokabularfähigkeit und Mehrsprachigkeit eingebaut sind ... aber ich bin gespannt.

08 September 2006

Dinge, die die Welt nicht braucht

Nuance integriert Spracherkennung Dragon NaturallySpeaking in Tulip-Ego-Designernotebooks - und zwar DNS Standard in ein Notebook für schlappe 3.975,00 € - hier kann man es sich ansehen. Wenn man lange genug sucht, findet man auch die technischen Spezifikationen - 1 GB RAM, untere Grenze für DNS 9, und ein AMD Turion Prozessor.

Ist das jetzt die Reaktion auf die Spracherkennung in Vista? Immerhin bekommt man einen Zebra-Skin für das Notebook gratis dazu (normal 375 €), wenn man mal so richtig auffallen will. Ich seh Paris Hilton schon intime Details in ihr Zebra quatschen.

07 September 2006

Auffälliges Korrekturverhalten in Dragon

Unter phorum - Unofficial NaturallySpeaking Public Forum - Re: Revision and error correction revisited berichtet David Peters von folgendem Phänomen:

Diktiert man ein Wort, welches nicht im Vokabular von Dragon NaturallySpeaking enthalten ist, markiert man sodann dieses Wort und gibt man direkt das richtige Wort ein, ohne die Korrekturfunktion von Dragon NaturallySpeaking zu benutzen, so wird das Wort in das Vokabular aufgenommen! Dies gilt für Dragon NaturallySpeaking 8.

Das wollte ich immer schon einmal testen. In Dragon NaturallySpeaking 9 habe ich daher das Wort "Vattenfall" aus gegebenem Anlass ein diktiert und korrigiert. Ergebnis: wenn in den Optionen die Option "Wörter automatisch zum Vokabular hinzufügen" aktiviert ist, wird dieses Wort tatsächlich hinzugefügt!

Das heißt:

- ich diktiere "Vattenfall", Dragon schreibt "Daten Fall".

- ich sage "korrigier das", Dragon markiert die Phrasen und öffnet das Korrekturmenü.

- ich tippe einfach das Wort "Vattenfall" über die Markierung.

Ich diktiere noch einmal "Vattenfall", Dragon schreibt es korrekt und übernimmt das Wort mit einem roten Stern markiertes Vokabular.

Und jetzt die wirklich schlechten Neuigkeiten: Dragon NaturallySpeaking macht das auch, wenn ich ein diktiertes Wort nicht per Sprachbefehl markiere oder den Korrekturbefehl benutze, sondern wenn ich das Wort per Tastatur markiere und überschreibe. Damit nicht genug - selbst wenn ich das Wort lösche, welches Dragon NaturallySpeaking geschrieben hat, und danach eine Korrektur von Hand mache, wird das Wort in den Wortschatz aufgenommen!

Unter diesen Umständen kann ich nur empfehlen, die Option "automatisch Wörter hinzufügen" abzustellen. Wenn amn sich vorstellt, dass auch die Korrektur nur einiger Buchstaben dann in das Vokabular übernommen wird, wird einen ganz anders - und man versteht plötzlich, wo her die vielen, vielen benutzerdefinierten Müll-Einträge kommen, die sich im Laufe der Jahre ansammeln.

05 September 2006

"Wunderbare Erfahrungen!" FAZ-Rezension von Dragon 9

Heute erschien in der FAZ die Rezension von Dragon NaturallySpeaking 9. Aus urheberrechtlichen Gründen kann ich sie nicht ganz wiedergeben, daher hier nur einige Höhepunkte:

Der Rezensent (Dr. Michael Spehr) ist von Dragon NaturallySpeaking 9 begeistert. Zwar merkt er an, dass die Erkennungsgenauigkeit der Software sehr stark vom Diktierstil abhängt, nur unter bestimmten Bedingungen zu erreichen sind. "Der ungeübte Nutzer mit einem reichhaltigen Vokabular, ein Schriftsteller etwa, wird eher bei 95% liegen." Dafür hält er es für möglich, dass ein Arzt oder Rechtsanwalt mit einem klar definierten Wortschatz und häufig wiederkehrenden Formulierungen eine Genauigkeit von 100% erreicht. Übrig bleibt natürlich der Anspruch an den Diktanten, "druckreif" zu formulieren, also nicht die Gedanken erst niederzuschreiben und dann zu ordnen.

Nach Meinung des Rezensenten ist es nötig, das Benutzertraining mit Dragon NaturallySpeaking zu absolvieren, auch wenn die Software inzwischen ohne Training nur mit der Einstellung des Mikrophons gute Ergebnisse liefert. Außerdem empfiehlt er die Dokumentenanalyse von E-Mails und eigenen Dateien, um Dragon NaturallySpeaking mit dem eigenen Vokabular und der eigenen Schreibweise vertraut zu machen. [Dieser Analyse halte ich so, wie sie im Benutzerassistenten vorgenommen wird, sogar für schädlich: es wird wesentlich mehr Schrott aufgenommen als Wörter, die man tatsächlich braucht. Besser ist es, später im Erkennungscenter eine Analyse ausgewählter Dokumente vorzunehmen.] Die Wichtigkeit der Korrektur wird hervorgehoben; das Fehlen eines USB-Mikrophon zu angemerkt.

Positiv fällt auch auf, dass Dragon NaturallySpeaking 9 offensichtlich besser und schneller lernt als die Vorversionen.

Einige Hinweise gibt es auch zur Verwendung mit Diktiergeräten. Dragon NaturallySpeaking unterstützt in der aktuellen Version zusätzliche Audioformate wie MP3, WMA und WAV, und die Qualität der Umsetzung von mit einem digitalen Diktiergerät aufgenommene Diktate hat sich deutlich verbessert. Allerdings muss man gerade hier darauf achten, sauber zu diktieren, möglichst wenige Nebengeräusche zu produzieren und einen gleichmäßigen Abstand zwischen Mund und Diktiergerät einzuhalten. Dann erreicht man "sehr gute Resultate bei der Umsetzung von Aufnahmen, die im fahrenden Auto entstanden".

Weitere Neuerungen sind die Anwendung von Bluetooth-Mikrophonen, das Speichern der Benutzerdateien in einem Netzwerk und die automatische Umsetzung von Aufnahmen, die in einem vorher definierten Verzeichnis abgelegt werden.

Schließlich macht die verbesserte Kompatibilität von Dragon NaturallySpeaking mit zahlreichen Programmen viel Freude. Manchmal (wie z.B. beim Diktat dieses Eintrags) ist es allerdings auch noch nötig, dass Diktierfenster von Dragon NaturallySpeaking zu benutzen, in das sich doch sehr viel besser diktieren lässt als in nicht vollständig unterstützte Anwendungen. Dieses Diktierfenster ist allerdings - entgegen der Rezension - keine Neuerung in der aktuellen Version. Kritisch wird noch angemerkt, dass das Diktierfenster durchaus auch in einigen Anwendungen benötigt wird, die eigentlich unterstützt werden sollten - so gibt es im Internet Explorer oder in Firefox immer mal wieder Probleme.

Schließlich zitieren wir noch den letzten Absatz, der sich anhört, als käme er direkt aus der Marketing-Abteilung :-)

"Das neue Dragon ist also sehr empfehlenswert. Es gibt keine bessere Spracherkennung, und das Update auf Version 9 lohnt in jedem Fall."

PS Hier gibt's den Artikel, in DNS gelesen und ordnungsgemäß transkribiert von Willi Sander.

01 September 2006

Sneak Preview: Empfehlungen für Dragon NaturallySpeaking 9

Soeben fertig geworden und online gestellt:

- Empfehlungen beim Upgrade auf Dragon NaturallySpeaking
- Software- und Hardware-Empfehlungen

(beides als PDF).

Feedback bitte!

media|NRW - Nachricht: Sprachbarrieren in Europa überwinden

media|NRW - Nachricht: Sprachbarrieren in Europa überwinden

Neuen Nachrichten von meinem anderen Hobby - maschinelle Übersetzung, diesmal in Zusammenarbeit mit Spracherkennung. An so einem automatischen Dolmetscher arbeitet man ja mit unterschiedlichen Erfolgen schon seit längerer Zeit, wir erinnern nur an das damals viel zu früh gekommene (und verschiedene) Verbmobil-Projekt. Zum Spaß habe ich so etwas auch schon einmal mit Dragon NaturallySpeaking und @promt™ programmiert.

So, und jetzt eröffne ich die Diskussion über die Qualität einer Maschine, bei der beide Komponenten dafür bekannt sind, gerne einmal Fehler zu produzieren, die einem Menschen niemals unterlaufen würden. (Dass Menschen ganz andere Fehler unterlaufen, der eine Maschine niemals machen würde, steht auf einem anderen Blatt.)

Siehe dazu auch unten den Link zu der Übersetzung eines Forumsbeitrags :-)

Windows Vista bringt Nuance und IBM zum Schweigen

Microsoft Vista to silence IBM ViaVoice, Nuance

Der Inquirer sieht die Zukunft von Dragon und ViaVoice in dunklen Tönen. Die Integration von Spracherkennung in Windows ist er habe denselben Effekt wie der Internet Explorer ihn damals auf Netscape gehabt habe - Anwender werden nicht etwa das bessere Produkt auswählen, weil sie die Wahl zischen zwei Produkten haben, sondern sie werden gar nicht wählen und stattdessen das Produkt nehmen, das bereits auf Ihrem Rechner installiert ist.

Gleichzeitig fragt er, wie so IBM die Entwicklung von IBM ViaVoice praktisch eingestellt hat und damit zum Beispiel der Linux-Gemeinde Spracherkennung grundsätzlich vor enthält, wieso die Entwicklung bei Microsoft wesentlich zielstrebiger vor sich zu gehen scheint als bei Nuance, wieso Nuance sich nicht auf alternative Betriebssysteme konzentriert- um im bilde zu bleiben, schlägt er Nuance damit eine Art Mozilla-Rolle vor, also ein alternatives, besseres Produkt für mehr Plattformen, welches die Nische besetzt, die der Platzhirsch nicht bedienen kann oder will.

Die Reaktion von Nuance sieht allerdings, wie der Artikel berichtet, eher aus wie die Reaktion, die man ansonsten vom Platzhirsch erwarten würde: das Produkt sei überlegen, enthalte juristische und medizinische Wortschätze, welche der Konkurrenz fehlten, sei erhältlich für mehrere Sprachen... abgesehen davon, dass auch die Spracherkennung im Windows Vista in mehreren Sprachen erhältlich sein wird (deutsch ist eine von ihnen), mag es ja vielleicht sein, dass Ärzte und Juristen eine spezialisierte Anwendung verwenden werden. Genauso wird in Firmen ein Dokumenten-Management eingesetzt, aber der Heimanwender benutzt einfach den Windows Explorer (wenn er denn überhaupt so weit denkt).

IBM, früher der Pionier für Spracherkennung, hat bereits vor 10 Jahren ein Betriebssystem entwickelt, welches sich über Sprache steuern ließ. Dies ist aber komplett untergegangen. Eine Linux-Distribution von IBM ViaVoice ist ebenfalls seit längerer Zeit nicht mehr erhältlich (auch wenn einige Linux-Freunde immer mal wieder darauf hinweisen). Auch hier zitiert der Artikel nur ausweichende Stellungnahmen von IBM.

Der Hinweis auf diesen Artikel kommt aus einem Blog eines Microsoft-Entwicklers - immerhin. Dem darf man natürlich unterstellen, dass er sein eigenes Produkt besser findet als die der Konkurrenz. Ist ja auch sein gutes Recht. Umso mehr rechnen wir ihm an, dass er noch auf einige andere Punkte hinweist, die Dragon NaturallySpeaking im Moment Windows ist er voraus hat. So liegt Dragon NaturallySpeaking der Spracherkennung ein Headset bei (wobei ein Headset dieser Qualität nun wirklich kein Vorteil ist :-) Schon wesentlich interessanter sind die Makro-Fähigkeiten von Dragon NaturallySpeaking. Allerdings, wie man nicht ohne Grund anmerkt, liefert Microsoft ein SdK an Entwickler kostenlos aus, wohingegen das von Nuance richtig teuer ist, und auch OEM-Hersteller werden sich nicht nehmen lassen, ihren Computern demnächst Headsets beizulegen, gegen vielleicht sogar besser sind als die in einer Schachtel mit Dragon NaturallySpeaking (was ja, wie gesagt, auch nicht weiter schwer ist).

Meine Meinung: ich fürchte, sie haben recht. Nuance wird sich etwas ausdenken müssen, um das Produkt entsprechend zu positionieren. Das Schlimmste, was natürlich passieren kann, ist das die Microsoft Spracherkennung beim durchschnittlichen Benutzer dieselben Ergebnisse liefert wie in jener Produktdemonstrationen, und das Spracherkennung damit mal wieder für die nächsten Jahre von der Agenda verschwindet. Und es soll keiner glauben, dass Nuance dann sagen kann: "nehmt Dragon NaturallySpeaking, es funktioniert im Gegensatz zu Windows Vista". Die Leute werden immer nur sagen, dass Spracherkennung erwiesenermaßen eben nicht funktioniert.

Wie ich darauf komme? Fünf Jahre Telefon.

(diktiert mit Dragon NaturallySpeaking 9)

28 August 2006

Neuigkeiten in Dragon NaturallySpeaking 9 - Teil 3

Wenn man erst einmal mit der Arbeit beginnt, fallen einem dann die kleinen Sachen auf, die in der neuen Version entweder nicht verbessert worden oder sich anders verhalten als gewöhnt. Hier einige Auszüge:

- Getwords-Putwords funktioniert nicht mehr.
- das Befehlcenter sieht jetzt ganz anders aus und ist wesentlich schneller. Die Bearbeitung ist noch gewöhnungsbedürftig, es scheint aber einfacher zu gehen als in der Vorversion.
- das Thema Ordinalzahlen ist leider immer noch nicht gelöst. In Dragon NaturallySpeaking Legal mit dem juristischen Wortschatz funktioniert es, mit dem normalen Wortschatz nicht.
- ähnlich sieht es mit "§2" usw. aus - mit dem Wortschatz von Dragon NaturallySpeaking Professional lässt sich dieses Symbol mit der Zahl zusammen nicht ohne Eingriffe diktieren. (kleiner Tipp: man kann die Eigenschaften des Wortes Paragraph editieren, so dass es vor einer Zahl immer korrekt als § erscheint; eine genaue Anleitung veröffentliche ich vielleicht später).
- der Befehl "verbinde das" funktioniert nicht immer zuverlässig - mancher verbindet er nämlich gar nichts.
- auch das Problem mit dem Diktat von Zahlen nach Microsoft Excel ist noch nicht gelöst. Hier ist aber von dritter Seite eine Lösung in Sicht.

Noch etwas: eine maschinelle Rohübersetzung der Hinweise zur Bearbeitung des Vokabulars für das Upgrade nach Dragon NaturallySpeaking 9 findet sich unter f. Adresse:
http://tinyurl.com/rz5l4

(übersetzt mit PROMT, www.promt.info)

leider muss man "Periode" mal durch "Rechtschreibung" und mal durch "." Ersetzen, um den Sinn richtig zu verstehen - soweit ist die maschinelle Übersetzung leider noch nicht. Auf der Basis arbeite ich aber an einem Dokument, das die staunende Öffentlichkeit demnächst zur Kenntnis nehmen darf.

Ich darf übrigens ergänzen, dass ich diesen Beitrag natürlich diktiere - und zwar direkt nach Opera, wo er schnell und genau geschrieben wird. Das ist auch gut so, weil die Korrektur nämlich in diesem Fenster nicht funktioniert :-) aber wozu auch?

Hints for cleaning up your Word List.

Hinweise zur Bearbeitung einer Wortliste für den Import nach DNS 9 (englisch) gibt DSteiNeuro, einer der größten Gurus im Knowbrainer-Forum (s. Link rechts).

Jetzt ist die Chance da, all die Bugs und Fehler auszumerzen, die uns die letzten Monate genervt haben!

Mehr Neuigkeiten zu Dragon 9

Nach ein paar weiteren Installationsversuchen hier noch ein paar Erfahrungen:

1. einen Roaming User kann man doch updaten, wenn man eine Verbindung mit dem Server-Laufwerk hat, auf dem er gespeichert ist. Mit der lokalen Kopie geht das nicht. Allerdings ist es mir bei zwei Usern nur mit einem gelungen, also vielleicht doch lieber erst den Roaming User in der alten Version als lokalen Benutzer importieren, oder - noch besser - in DNS 8 eine Wortliste exportieren, in DNS 9 einen neuen Benutzer anlegen und die Wortliste importieren.

Perfektionisten werden einen Benutzer upgraden, sein Vokabular komplett mit Verwendungsinformationen exportieren, einen neuen Benutzer anlegen und das Vokabular importieren. Der Zwischenschritt muss sein, weil DNS 9 kein Vokabular aus DNS 8 direkt importieren kann (das wäre mal ein Feature, das man wirklich braucht). Weil aber die Algorithmen in jeder Version angepasst werden, ist nur ein Nutzer, der mit der aktuellen Version angelegt wurde, wirklich auf dem neuesten Stand.

2. Während der Installation gibt es eine Option: "Einstellungen für alle Benutzer verändern". Kreuzt man sie an, so werden alle unter "Optionen" gewählten Einstellungen für alle Benutzer auf diesem Rechner übernommen (z.B. Zugriffstasten, Anzeige oben oder in Taskleiste usw.) Sehr praktisch für Leute wie mich, die mehrere Benutzer auf einem Rechner haben und stark in die Programmoptionen eingreifen.

3. Ebenso lässt sich schon während der Information das Verzeichnis für den Roaming User eingeben - einfach die Option "Administrative Einstellungen verändern" ankreuzen.

25 August 2006

Erste Erfahrungen mit Dragon NaturallySpeaking 9

Zuerst die gute Nachricht:

Die Erkennungsgenauigkeit von Dragon NaturallySpeaking 9 ist von Anfang an sehr gut. Interessanterweise hatte ich bessere Resultate, wenn ich den Benutzer nicht trainiert habe. Nach 1. Rückmeldungen von Kollegen gibt es verschiedene Erfahrungen - alle sagen zwar, dass auch ohne Training die Erkennungsgenauigkeit bereits beeindruckend sei, einige raten jedoch trotzdem zu Training, während andere der Meinung sind, dass man jetzt gut darauf verzichten könnte. Möglicherweise hängt es davon ab, wie konzentriert man den Trainingstext vorliest - nachdem ich ihn beinahe auswendig kann, neige ich dazu, beim Lesen schlampig zu werden. Das wirkt sich dann natürlich auf die Qualität des Diktates aus.

Jetzt einige Beobachtungen und Hinweise für das eigentliche Upgrade. Ich habe zunächst auf einem Notebook, 1 GB Arbeitsspeicher, Centrino-Prozessor mit 1,8 GHz, die neue Version installiert und mehrere neue Benutzer angelegt sowie vorhandene Benutzer zumindest versucht in die neue Version zu übernehmen.

Die Installation einer Vollversion über eine bestehende Installation von Dragon NaturallySpeaking funktioniert problemlos. Da die Upgrades noch nicht angekommen sind, ist im Moment noch nicht ganz klar, was passiert, wenn man eine Upgrade-Version versucht auf einem Rechner ohne Installation von Dragon NaturallySpeaking neu zu installieren. In früheren Versionen musste man zuerst die alte Version installieren, um dann das Upgrade vornehmen zu können; gerüchteweise reicht es jetzt, die alte Programm-CD bei der Hand zu haben.

Vorhandene Benutzer im Standard-Verzeichnis werden schon am Ende der Installation auf den neuesten Stand gebracht, wenn man das will. Ansonsten gibt es wieder wie schon in Version 8 einen Upgrade-Assistenten, mit dem vorhandene Benutzer aktualisiert werden können. Einstellungen werden dabei übernommen, auch mehrere Vokabulare oder mehrere Diktierquellen.

Gescheitert bin ich dabei, Roaming Users zu aktualisieren. Wenn man das Standardverzeichnis angibt, in dem die Roaming Users gespeichert sind, erhält man eine Fehlermeldung. Es hilft auch nicht, sie in das "Users"-Verzeichnis zu kopieren. Offensichtlich müssen sie erst aus Version 8 exportiert werden, damit man sie nach Version 9 importieren kann.

Was aber hervorragend funktioniert, ist der Export und Import von benutzerdefinierten Wörtern. Wählt man "Wörter - exportieren", so erzeugt Dragon NaturallySpeaking 1 Wortliste im Textformat, die sich abspeichern lässt und unter Dragon NaturallySpeaking 9 über "Wörter - importieren" in einer neu angelegten Benutzer importiert werden kann - und zwar mit gesprochenen Formen.

Jetzt zum Thema Ressourcen: die Systemanforderungen für Dragon NaturallySpeaking 9 sind gegenüber denen von Dragon NaturallySpeaking 8 noch einmal gestiegen. In der Praxis macht sich allerdings auf meinem Notebook kein Unterschied in der Geschwindigkeit des Diktierens bemerkbar - wenn das Diktat erst einm das dauert nämlich deutlich länger. Während des Diktates wird der Arbeitsspeicher allerdings stark beansprucht - 30 bis 40% Auslastung sind Durchschnitt, während Korrekturen kann es auch schon einmal zu Spitzen von 100% kommen. Ein neuer Rechner muss also nicht unbedingt her.

In der Bedienung fallen einige Verbesserungen gegenüber der Vorversion auf - hier sind also offensichtlich bekannte Fehler beseitigt worden.

1. das Diktat von Ordinalzahlen funktioniert wieder. Es lassen sich also wieder per Sprachbefehl nummerierte Listen erstellen. Dafür werden jetzt allerdings wieder mehr Zahlen in den Fließtext eingebaut, was vor allem beim unbestimmten Artikel unschön ist.
2. nach einem Punkt wird in Word jetzt wieder korrekt weiter geschrieben, auch wenn zwischendurch korrigiert wurde. Der neue Satz fängt also korrekt mit einem Großbuchstaben und nicht mit einem kleinen Buchstaben an.
3. das Hinzufügen neuer Wörter zum Wortschatz während des Diktates ist jetzt eine Option. Dies wurde in verschiedenen Foren bereits heiß diskutiert - tendenziell ist es eine Fehlerquelle, dass Dragon NaturallySpeaking während des Diktates selbstständig Wörter zum Wortschatz hinzufügt, teilweise ohne den Benutzer zu fragen. Dies war vor allem bei Komposita ein Problem, weswegen ich die Option "Komposita selbstständig bilden" auch ausgeschaltet hatte und stattdessen lieber 2 Wörter mit dem Befehl "verbinde das" zusammengefügt habe. Ein derart gebildetes Kompositum wird jetzt automatisch zum Wortschatz hinzugefügt - für mich eine Erleichterung. Andere gehen vielleicht lieber anders vor, deaktivieren das automatische Hinzufügen von Wörtern zum Vokabular und lassen die eigenständige Komposita Bildung lieber eingeschaltet.

Wie sich Dragon NaturallySpeaking 9 tatsächlich in der Praxis bewährt, werde ich erst in der nächsten Woche ausführlich testen. Weitere Beiträge stehen also bevor.

Schließlich: diesen Beitrag habe ich parallel mit 2 Mikrophonen in 2 Rechner diktiert, der eine mit Dragon NaturallySpeaking 8, der andere mit Dragon NaturallySpeaking 9. Zieht man die Erkennungsfehler der Version 9 ab, die daraus resultieren, dass ich noch nicht den Wortschatz vollständig angepasst habe, ergibt sich ein Verhältnis von:

Dragon NaturallySpeaking 8 mit einem Benutzer, der seit einiger Zeit im Einsatz ist: 18 Fehler
Dragon NaturallySpeaking 9 mit einem neu angelegten, trainierten Benutzer: 14 Fehler (die ich aber weitgehend korrigiert habe :-)
Für mich eine eindeutige Verbesserung "out of the box".

24 August 2006

Schnittstelle zwischen Olympus DSS-Player und Dragon 9

Eine Schnittstelle für den Olympus DSS Player pro zu Dragon NaturallySpeaking 9 enthält die neueste Version 4.8.5 des DSS-Player, die unter folgender Adresse heruntergeladen werden kann:

http://www.olympus.de/consumer/2590_software.cfm

(Dort die entsprechende Software auswählen).

Außerdem wurden einige Bugs beseitigt.

22 August 2006

"Doppelt die Killer": heise online über Microsofts Panne mit Vistas Spracherkennung

Das zugehörige Video kursiert ja schon in den einschlägigen Foren, ist ja auch nett anzusehen. Der Mehrwert des Heise-Berichts (Danke, Frau Wiegand!) liegt aber im Kommentar: Das Problem, das der Microsoft-Spezialist hat, ist wohl jedem Anwender von Spracherkennung schon mal passiert, worauf dankenswerterweise hingewiesen wird.

Allerdings meist nicht in einem solchen Rahmen :-)

Außerdem danke für den Hinweis, dass die Vista-Spracherkennung zwar für Deutsch "fest geplant" ist, jedoch noch nicht fest steht, ab wann. Das passt dazu, dass die Ankündigung - wie schon gebloggt - eine Zeit lang auf der österreichischen MS-Site zu sehen war, dann wieder nicht, und dass Beta-Tester schon über die ersten Erfahrungen mit Spracherkennung berichtet haben.

Ach übrigens: Willkommen zurück. Nach Krankheit und Urlaub werden die Meldungen jetzt wieder häufiger kommen. Demnächst z.B. über die ersten Erfahrungen mit DNS 9 - die Installation läuft gerade auf dem Notebook.

18 Juli 2006

Dragon 9 erscheint in den USA!

PRELIMINARY VERSION 9 REVIEW in Knowbrainer-Phorum

Die genauen Termine für die deutsche Version werden wohl noch heute bekanntgegeben - stay tuned. August wird es auf jeden Fall.

11 Juli 2006

Effizient korrigieren mit Dragon NaturallySpeaking

Die Korrektur von Erkennungsfehlern ist der einzige Weg, die Erkennungsgenauigkeit von Dragon NaturallySpeaking weiter zu verbessern. Noch mehr als das: wird ein Erkennungsfehler nicht korrigiert, geht Dragon NaturallySpeaking davon aus, das Wort korrekt erkannt zu haben. Der Fehler setzt sich also fest! Schon aus diesem Grunde sollten Sie jeden Erkennungsfehler konsequent korrigieren.

1. Korrektur per Sprachbefehl

Wenn Sie konsequent alles per Sprachbefehl machen wollen, werden Sie den Befehl "korrigier [Wort oder Wörter]" benutzen. Dieser Befehl markiert das Wort, welches Sie korrigieren wollen, und öffnet ein Fenster, in dem Ihnen verschiedene Korrekturen angeboten werden. Sagen Sie "nimm 1" oder "nimm 2" usw., um die korrekte Alternative auszuwählen, oder "schreib das", wenn sie nicht dabei ist. Es öffnet sich ein Fenster, in welches Sie das Wort einbuchstabieren können. Sie können die Buchstaben sagen oder - besser - das Buchstabieralphabet nützen, also z. B. "Anton" für "a", "Berta" für "b". Vor einem Großbuchstaben sagen Sie "Groß", also z.B. "groß Anton" oder "groß a" für "A". Sie können aber auch in dieses Fenster tippen - die meisten Leute finden das schneller und bequemer. Sie können auch die Rücktaste, Leertaste, Löschtaste und die Pfeiltasten benutzen. Mit der Eingabetaste übernehmen Sie die Korrektur in den Text.

2. Korrektur mit Tastatur und Maus

Schneller, bequemer und sicherer als per Sprachbefehl öffnen Sie das Korrekturmenü mit einer Funktionstaste. Markieren Sie das Wort, das Sie korrigieren möchten, und rufen Sie das Korrekturmenü mit einem Druck auf die Minustaste am Ziffernblock ganz rechts auf Ihrer Tastatur auf. Im Menü "Optionen" können Sie die Tastenbelegung ändern und eine andere Taste benutzen.

Im Korrekturmenü markieren Sie einfach die korrekte Alternative mit den Pfeiltasten und drücken Sie die Eingabetaste, um die Korrektur in Ihren Text zu übernehmen. Wenn die richtige Alternative nicht dabei ist, drücken Sie einfach noch einmal die Minustaste am Ziffernblock, um das Buchstabierfenster zu öffnen.

Lange bevor sich die Maus als Eingabegerät für den Computer durchsetzte, konnte man mit der Tastatur schon ganze Wörter, Sätze und Absätze markieren. Das funktioniert auch heute noch! Probieren Sie es einmal aus: Drücken Sie die Steuerungstaste, halten Sie sie gedrückt und drücken Sie die Pfeiltasten, um in Ihrem Text schnell vom Anfang eines Wortes zum nächsten Wortanfang zu springen.

Um ein Wort oder mehrere Wörter zu markieren, setzen Sie den Cursor neben das erste Wort, drücken Sie die Steuerungstaste, die Umschalttaste und die jeweilige Pfeiltaste und markieren Sie das gewünschte Wort beziehungsweise die gewünschten Wörter. Drücken Sie dann die Minustaste am Ziffernblock, um das Korrekturmenü aufzurufen. Weiter geht es wie oben beschrieben.

Vorteil dieser Methode: Markieren mit der Tastatur geht meist viel schneller als Markieren mit der Maus, und genauer ist es außerdem. Und ein paar Tastaturbefehle zu lernen sollte wirklich keinen überfordern!

Das Ziel ist, Erkennungsfehler möglichst schnell zu korrigieren. Benutzen Sie deswegen die Methode, die Ihnen am bequemsten und schnellsten erscheint. Das ist wahrscheinlich eine Mischung aus Sprachbefehl, Tastatur und Maus. Je effizienter Sie korrigieren, desto schneller sind Sie bei der Arbeit!

07 Juli 2006

Wie mache ich intelligente Fehler?

Common sense boosts speech software - berichtet das TRNmag. Forscher des MIT haben eine Technologie entwickelt, die verspricht, einer Spracherkennung ein gewisses Weltwissen beizubringen. So werden Kontextinformationen zur Auswahl der korrekten Alternative herangezogen, und bei der Korrektur erscheinen die Alternativen ganz oben, die im Zusammenhang am plausibelsten erscheinen (und nicht die phonetisch ähnlichen).

Natürlich treten auich weiterhin Erkennungsfehler auf, aber die Fehler folgen einem dem menschlichen Denken vertrauteren System.

"One surprising thing about testing interfaces like this is that sometimes, even if they don't get the absolutely correct answer, users like them a lot better," said Lieberman [der Entwickler]. "This is because they make plausible mistakes, for example 'tennis clay court' for 'tennis player', rather than completely arbitrary mistakes that a statistical recognizer might make, for example 'tennis slayer'," he said.


Und seien wir ehrlich - wir verstehen auch nicht jedes Wort, bemühen uns aber so gut es geht um Sinnkonstanz, d.h. versuchen eine unverständliche Aussage so zu interpretieren, dass sie im gegebenen Kontext Sinn ergibt. Wieder ein Schritt auf dem Weg, den Computer dem Menschen anzunähern - und sei es in der Art der Fehler, die er macht.

[Quelle ursprünglich Jen's Weblog]

05 Juli 2006

Korrekturbefehl ändern in Dragon

Im Nuance-Forum findet sich ein Hinweis darauf, wie man den Dragon NaturallySpeaking-Befehl "korrigier das", welcher die letzte Eingabe korrigiert, beliebig ändern kann. Ich weiß nicht, ob man hier nicht ein wenig mit Kanonen auf Spatzen schießt und ob man den Befehl nicht auch im Befehlcenter umbenennen könnte (ich habe grade mal nachgesehen, der Befehl "korrigier das" kann nicht einfach editiert werden), aber möglicherweise ist das eine interessante Alternative für alle, die nicht immer das Wort "das" korrigieren wollen. Oder für Leute, die genau dieses Wort korrigieren möchten, weil der Drache ist mit der Rechtschreibung mal wieder nicht hatten und vergisst, dass das das [diese drei Worte hat er auf Anhieb richtig geschrieben!] mit Doppel-S nur nach einem Komma stehen kann. Schließlich vielleicht auch eine Alternative für alle, die in mehreren Sprachen diktieren, sich aber nicht immer neue Befehle angewöhnen wollen.

Wer übrigens nicht auf Dragon NaturallySpeaking 9 warten möchte, indem sich das Diktiertextfeld in Größe und Layout vollständig anpassen lässt, kann mich eventuell auch lieb darum bitten, dass ich ihm ein bisschen Hilfestellung gebe :-)

Ich diktiere gerade selbst mit dem modifizierten Diktiertextfeld in ein Opera-Browser Fenster, und der Vorteil besteht darin, dass man in diesem Feld auch mit Sprachbefehlen korrigieren kann. Der Nachteil besteht darin, dass es auch sehr nötig ist zu korrigieren - wenn mir irgend jemand erklären kann, wieso die Erkennungsgenauigkeit in manchen Programmen besser ist als in anderen, und ob sich daran etwas ändern lässt, wäre ich dieser Person zu ewigem Dank verpflichtet.

03 Juli 2006

Dragon NaturallySpeaking Hints, Articles, Recommendations, Softnet Systems, Inc., Speech Recognition Specialists

Unter dieser Adresse gibt es zahllose Hinweise zum Thema "Verbesserung der Erkennungsgenauigkeit von Dragon NaturallySpeaking". So kann man sie zusammenfassen:

- Benutzen Sie ein gutes Mikrofon und ein schnelles System
- Sprechen Sie klar und deutlich, v.a. gleichmäßig
- Benutzen Sie die Hilfsmittel, die Dragon zur Verfügung stellt.

Alle drei Punkte werden ausführlich diskutiert und enthalten für Anfänger und Fortgeschrittene zahlreiche Hinweise - leider nur auf Englisch, aber das Meiste passt auch auf uns deutschsprachige Diktatoren.