06 November 2009

Zeit der Sprachsteuerung ist gekommen

Microsoft sagt: die Zeit der Sprachsteuerung ist gekommen - So berichtet der online-Dienst WinFuture.de. Wenn ein Konzern wie Microsoft dies tatsächlich in den Vordergrund stellt, und die Technologie entsprechend ist (was mit der Spracherkennung in Windows 7 durchaus gegeben sein dürfte), so machen wir Spracherkennungsbegeisterten einen großen Schritt nach vorn. Diktat und Steuerung des Rechners per Sprache entlastet einfach bei der Arbeit, sorgt dafür, schneller zu sein und bequem arbeiten zu können. Schon jetzt ist die Steuerung von Windows Vista und insbesondere Windows 7 durch Sprache vorbildlich und baut viele Hürden ab. Mit Dragon NaturallySpeaking lässt sich das meiste auch machen, wenn auch vielleicht nicht immer so intuitiv - dafür können aber die Befehle, die Microsoft nicht kann oder uns aus anderen Gründen vorenthält, mit Dragon NaturallySpeaking Professional nachprogrammiert werden.

Ich merke immer mehr, wie sehr ich mich auf mein Mikrofon verlasse und wie ungern ich noch die Maus in die Hand nehme. Dabei spielt natürlich eine wichtige Rolle, dass mir vom Sprechen die rechte Hand nicht weh tut und sich die Schultern nicht verspannen.

Dabei fällt mir ein, dass ich vor einigen Wochen gar nicht darüber berichtet habe, dass eine große Agentur die Spracherkennung ebenfalls als Technologie einstufte, die das Tal der Tränen inzwischen durchschritten hat und sich auf dem Hang der Erleuchtung befindet. Und als ich am Mittwoch auf der Veranstaltung der Firma Thax Software waren, die unter anderem Anwaltskanzleien ausstattet, hieß es dort, dass eine moderne Anwaltskanzlei eine Spracherkennung haben sollte - und sei es nur für die Fälle, wenn die Sekretärin nicht mehr zum Schreiben zur Verfügung steht.

04 November 2009

Dragon NaturallySpeaking jetzt offiziell für Windows 7 zertifiziert

Wie der Hersteller berichtet, ist Dragon NaturallySpeaking 10.1 jetzt offiziell auch für Windows 7, sowohl 32 Bit wie auch 64 Bit, zertifiziert.

Ankündigung im Nuance-Blog

Ankündigung auf der Nuance-Website

Da die Meldungen aus den USA kommen, wo Dragon Medical 10.1 erhältlich ist, wird dort nicht zwischen den verschiedenen Versionen von Dragon NaturallySpeaking unterschieden. In Deutschland sind wir leider technisch noch nicht so weit, daher hier das Ergebnis meiner eigenen Tests mit Dragon NaturallySpeaking 10.0 sowie 10.1 unter Windows 7, 32 Bit und 64 Bit:

Dragon NaturallySpeaking 10.1 in allen Versionen läuft tatsächlich unter Windows XP, Windows Vista 32 Bit und 64 Bit, Windows 7 32 Bit und 64 Bit.

Dragon Medical 10.0 deutsch läuft (wie auch die anderen Editionen von Dragon NaturallySpeaking 10.0) unter Windows XP, unter Windows Vista und unter Windows 7 32 Bit - aber weder unter Windows Vista 64 Bit noch unter Windows 7 64 Bit.

Soweit alles klar?

Was die gängigen Eingabegeräte angeht, so habe ich inzwischen ungefähr 10 verschiedene Mikrofone getestet und nirgendwo ein größeres Problem festgestellt.

Es bleibt noch der Hinweis, dass es sich bei Windows 7 um ein Betriebssystem handelt, das neuer ist als die Anwendersoftware, die darauf läuft, und es von daher trotz aller möglicher Tests, Zertifizierungen usw. durchaus möglich ist, dass das Zusammenspiel mit Dragon NaturallySpeaking auf einigen Rechnern nicht funktioniert. Hierfür übernehme ich explizit keine Verantwortung!

22 Oktober 2009

Dragon und Windows 7

Heute ist Windows 7 erschienen - dies an sich ist keine Neuigkeit, für die man diese Netznotizen braucht, sind doch alle Zeitungen voll davon. Interessant ist die Frage, ob Dragon NaturallySpeaking unter Windows 7 läuft. Ohne dass ich es bisher selbst ausprobiert hätte, gibt es genug Leute, die dies getan haben und ihre Erfahrungen in diversen Foren veröffentlicht haben. Fazit:

Dragon 10.1 ist kompatibel sowohl mit Windows 7 32-bit als auch mit Windows 7 64-bit in allen Editionen. Frühere Versionen, und damit auch Dragon Medical 10.0, laufen zumindest unter Windows 7 64-bit nicht (ebensowenig wie unter Vista 64-bit). Versionen früher als Dragon NaturallySpeaking 10.1 werden auch unter Windows 7 32 Bit nicht offiziell unterstützt, es sind Kompatibilitätsprobleme bekannt geworden.

Inwieweit alle Mikrofone, Headsets usw. reibungslos unter Windows 7 32 Bit und/oder 64 Bit laufen, würde hier den Rahmen sprengen. Aller Erfahrung nach sollten Geräte, die unter Windows Vista 32 Bit und Windows XP funktionieren, auch unter Windows 7 32 Bit funktionieren. Geräte, die unter Windows Vista 64 Bit funktioniert haben, sollten auch unter Windows 7 64 Bit funktionieren. Im Zweifel wenden Sie sich an die entsprechenden Hersteller.

Nuance-Blog zum Thema Windows 7

Ältere Posts

09 Oktober 2009

MacSpeech Dictate Deutsch ist da

Wie der deutsche Vertrieb meldet, ist MacSpeech Dictate jetzt in neuer Version 1.5.5. auf Deutsch erhältlich. Der Vertrieb redet zwar etwas drum herum, und die Versionsnummer gibt es auch nicht her, aber die wesentliche Neuerung ist, dass jetzt Dragon NaturallySpeaking als Spracherkenner verwendet wird. Daher ändert sich die Produktbezeichnung auch - früher hieß die Mac-Spracherkennung iListen.

Von Preis und Umfang dürfte Dictate somit jetzt mit Dragon NaturallySpeaking Preferred vergleichbar sein. Das nicht mehr ganz taufrische iListen hat damit einen mehr als würdigen Nachfolger, und die Apfelfreunde müssen sich nicht mehr mit Parallels und ähnlichen Hilfskonstruktionen abmühen.

Selber testen kann ich leider nicht, daher verweise ich auf den recht positiven Test in Macwelt. Mit 1,8 wird eine gute Note gegeben, das Diktat funktioniert sehr gut in Deutsch, Englisch, Französisch und Italienisch, lediglich bei der Sprachsteuerung merken die Tester Schwächen an.

Hier die Herstellerseite.

29 September 2009

Mehrere Großbuchstaben hintereinander diktieren

Vor dem Diktat von mehreren Buchstaben, die alle groß geschrieben werden sollen, sagt man statt "groß Anton", "groß Berta" usw. einfach "Großbuchstaben Anton Berta". "Großbuchstaben Emil Gustav Siegfried" erzeugt also beispielsweise den Firmennamen "EGS".

Das funktioniert auch mit Autokennzeichen. Um z.B. folgendes Ergebnis zu erhalten:

ME-GS 157

Sagt man:

Großbuchstaben Martha Emil Bindestrich Großbuchstaben Gustav Siegfried Leertaste eins fünf sieben

26 August 2009

Autoformat, Nummerierung, Aufzählungszeichen

Auto Format während der Eingabe ist während des Diktats mit Dragon NaturallySpeaking in Microsoft Word nicht möglich, da dieses von der SAPI (Speech Application Program Interface) nicht unterstützt wird. Das bedeutet auch, dass sämtliche automatischen Änderungen, typografische Anführungszeichen, automatische Nummerierung und Formatierung in Microsoft Word standardmäßig nicht funktioniert, sondern nur, wenn Select-and-Say nicht aktiviert ist. Sollte dies also funktionieren, handelt es sich eigentlich um einen Programmfehler.

Wie man einige dieser Zeichen trotzdem verwenden kann, habe ich bereits hier beschrieben.

Um eine Liste mit oder ohne Nummerierung in Microsoft Word zu erstellen, gehen Sie so vor:

Eine nummerierte Liste wird begonnen mit dem Befehl "nummeriert". Der nächste Listeneintrag wird automatisch erstellt, wenn Sie "Neue Zeile" sagen. Um die Liste zu beenden, ist die einfachste Möglichkeit, zweimal von Hand die Eingabetaste zu drücken (wie man es aus Microsoft Word kennt). Will man dies per Sprache erledigen, ist es nötig, noch einmal "neue Zeile" zu sagen, ein paar Wörter zu diktieren und danach den Befehl "nicht nummeriert" zu sagen.

Um eine Liste mit Aufzählungszeichen zu erstellen, sagt man am Anfang "Aufzählungszeichen". Die Beendigung geht genauso: erst "neue Zeile" sagen, der Befehl lautet "ohne Aufzählungszeichen".

24 August 2009

Warum heißt Dragon Dragon?

Angeblich weil auf dem Hochzeitsporzellan des Ehepaars Baker, den Erfindern der Software, Drachen zu sehen waren. Andere Frage: Warum haben sie sich ausgerechnet für dieses Porzellan entschieden?

Hier der Artikel aus der Frühzeit der Spracherkennung.

14 August 2009

Dragon und Windows 7

Dragon und Windows 7 wurden laut Eintrag in Nuance-Blog positiv im Zusammenspiel getestet, und zwar in der englischen und spanischen Version. Da es sich noch nicht um die endgültige Version von Windows 7 handelt, kann natürlich keine Garantie dafür übernommen werden, dass unter dem neuen Betriebssystem alles wie gewohnt läuft - aber das sind die bekannten Einschränkungen bei einem neuen Betriebssystem.

Durch einige Tester in Deutschland weiß ich, dass auch mit der deutschen Version von Windows 7 keine Probleme mit Dragon NaturallySpeaking zu erwarten sind.

18 Juli 2009

Zum Anfang, zum Ende, zurück

"Zum Anfang", "zum Ende" und "zurück" lauten drei weitgehend unbekannte Sprachbefehle für Dragon NaturallySpeaking. Die ersten beiden sprechen für sich, sie verkürzen das "zum Dokumentanfang" und "zum Dokumentende" um drei Silben bzw. stehen als Alternative zur Verfügung, wenn diese Befehle gerade mal nicht wollen.

"Zurück" setzt den Cursor an die letze Position zurück, z.B. nach dem Markieren und Formatieren eines Wortes. Der Befehl ist leichter auszuprobieren als zu beschreiben, also viel Spaß dabei!

(Tipps aus einem Forenbeitrag von Rüdiger Wilke)

02 Juli 2009

Plantronics und Linguatec bündeln Spracherkennung mit Bluetooth-Headset

Plantronics und Linguatec: Kooperation bei Spracherkennung mit Bluetooth-Headset.

Bluetooth-Headsets waren früher für Spracherkennung nicht wirklich geeignet, wie ich nicht müde wurde, zu betonen. Die Qualität des übertragenen Signals reicht einfach nicht aus, um eine vernünftige Erkennung zu gewährleisten, und darüber hinaus waren auch immer wieder Schwierigkeiten bei der Verbindung des Headsets mit dem PC zu verzeichnen (bei mir zumindest - soweit, das ich mich von Bluetooth als Verbindungsmedium meines PC verabschiedet habe).

Linguatec und Plantronics bieten jetzt eine Lösung an, die sowohl eine bessere Qualität der Übertragung gewährleistet wie auch (hoffentlich) mithilfe einer Ladestation eine sichere Verbindung zwischen Headset und Computer, die nicht abreißt. Alles zusammen wird im Paket als linguatec voice pro Wireless Edition für 249 € angeboten.

Ich habe übrigens vor kurzem ein neues Blue Parrott Bluetooth-Headset, ebenfalls mit größerer Bandbreite und verbesserter Qualität, zum Test erhalten, habe es aber noch nicht geschafft, das an einen Bluetooth-fähigen Rechner anzuschließen (was wirklich! an mir liegt). Sobald es mir gelingt, werde ich hier berichten.

Spracherkennung zum Spionieren (Kreative Wissenschaft)

Druckergeräusche verraten Patientenakten und Kontodaten, hat eine Forschergruppe der Universität des Saarlandes herausgefunden. Mithilfe einer Spracherkennung werden die charakteristischen Geräusche, die ein Nadeldrucker beim Ausdruck eines Wortes macht, analysiert und das Wort erkannt - mit ungefähr 70 prozentiger Genauigkeit. Dasselbe funktioniert auch bei Zahlen.

Der Nadeldrucker häufig noch in Arztpraxen und Banken im Einsatz sind, ist es hiermit theoretisch möglich, Kontonummer oder Patientendaten auszuspionieren. Wobei 70 % Erkennungsgenauigkeit bei einer Kontonummer nicht wirklich eine Sicherheitslücke sind - von 7 Stellen ist eine falsch, aber welche, und welche ist richtig? Da kann ich gleich einen Brute Force Attack starten :-)

Aber immerhin: wieder eine kreative Einsatzmöglichkeit für Spracherkennung.

08 Juni 2009

Dragon -Trainingsvideos

Nuance hat eine neue Serie von Trainingsvideos für Dragon NaturallySpeaking gestartet, die auf dem amerikanischen Kundenportal zu finden sind bzw. sein werden. Das erste Video behandelt das Anlegen eines Sprecherprofils, die Einstellung des Mikrofons, das Sprechertraining und die Hilfefunktionen - alles, was man vor dem Diktat braucht. Eine professionelle Schulung lohnt sich aber weiterhin :-)

05 Juni 2009

Blog "Digitale Diktiertechnik" - der natürliche Partner

Ich wusste bis heute noch gar nicht, dass es auch ein Blog zum Thema Digitale Diktiertechnik gibt - obwohl mir der Betreiber seit Jahren persönlich bekannt ist und wir auch schon das ein oder andere Projekt miteinander angegangen sind. Umso mehr freue ich mich, dass ich mich jetzt hier guten Gewissens noch stärker auf die Spracherkennung konzentrieren kann, da alles, was mit Diktiergeräten, Diktiermikrophonen usw. zusammenhängt, bei Herrn Carsten Schultes in allerbesten Händen ist. Wie ich berichtet auch er zwar aus Händlersicht, aber durchaus objektiv über neue Geräte und Technologien, und ich habe mich schon immer gerne bei ihm informiert (und er hoffentlich auch bei mir).

Sie können sich jetzt bei uns beiden informieren, was neueste Entwicklungen in Spracherkennung und digitaler Diktiertechnik angeht - viel Spaß!

04 Juni 2009

ComputerBild-Video über Dragon NaturallySpeaking

Die Computer Bild hat in der Ausgabe 12/2009 einen Vergleichstest von 3 Spracherkennungsprogrammen gehabt: Dragon NaturallySpeaking Standard, linguatec voice pro und der Microsoft Windows Vista-Spracherkennung. Testsieger ist Dragon NaturallySpeaking. Ein Video über die Arbeit mit der Spracherkennung ist sowohl bei der Computer Bild als auch inzwischen werbefrei bei YouTube erhältlich - gar nicht mal schlecht gemacht und sehr sachlich.

Ausführlich besprochen wird der Test und das Video hier, wobei dem nicht mehr viel hinzuzufügen ist - ComputerBild-Niveau, einige Naivitäten erstaunen (Warum kann man nirgends freie Vokabulare / Wortlisten runterladen? Note 6! - Warum macht die Software bei einem völlig unbekannten Wort keine Alternativvorschläge? Note 6!), auch über die Meinung zum Preis-/Leistungsverhältnis mag man staunen - aber die Computer Bild kostet ja auch nur 1 € und richtet sich an eine eher weniger solvente Kundschaft.

Mich erstaunt eher, dass Linguatec Voice Pro in der Erkennung (!) schlechter abgeschnitten hat als die "nackte" Vista-Spracherkennung - da hatte ich selbst bessere Erfahrungen gemacht. Meine 11jährige Tochter bestätigt dies Ergebnis allerdings: seit die neue Spracherkennung auf dem Rechner sei, verstünde er sie schlechter als vorher.

(Am Rande: Dragon ist für Kinder nicht gemacht, dort hat sie gar keine Chancen. Aber auch die Microsoft- und Linguatec-Akustischen Modelle scheinen eher auf tiefere Stimmen ausgelegt zu sein.)

So, und jetzt teste ich DNS Legal 10.1, für Profis, mit einem Preis-/Leistungsverhältnis jenseits der Vorstellungskraft des Bild-Lesers!

27 Mai 2009

Remote Audio für Windows 7

Kollege Müller macht mich aufmerksam auf dieses neue Feature in Windows 7: Terminal Services Team Blog : What’s New in Remote Audio for Windows 7?

Mit Win7/Server 2008R2 wird damit auch die Audioaufnahme unter reinem WTS unterstützt. Das heißt, dass Spracherkennung jetzt auch ohne zusätzliche Audiokanäle (Citrix, HOB, diverse proprietäre Geschichten der Gerätehersteller) in einer Windows Terminal Server-Umgebung eingesetzt werden kann, vulgo: dass ich von meinem Desktop direkt in eine Spracherkennung oder ein digitales Diktiersystem, die/das auf einem Server läuft, diktieren kann. Wer wie wir es häufig mit Großkunden zu tun hat, die genau diese IT-Landschaft einsetzen (wollen), für den tun sich ungeahnte Perspektiven auf. Da die Hersteller von Diktiergeräten und Mikrofonen (Grundig, Philips, Olympus) auch selbst alle an Audiokanälen für Windows Terminal Server etc. arbeiten bzw. diese schon bereitstellen, sollte da demnächst eine Menge möglich sein, auch wenn kein Windows 7 auf dem Arbeitsplatz läuft.

25 Mai 2009

Dragon Medical 10 jetzt offiziell erhältlich

Dragon Medical 10 ist seit dem deutschen Röntgenkongress offiziell angekündigt und erhältlich. Fertig war es wohl schon seit einiger Zeit, und es soll auch schon den ein oder anderen geben, der damit arbeitet - Praxisberichte liegen aber leider noch nicht vor. Erhältlich ist Dragon NaturallySpeaking Medical offensichtlich über die Dragon NaturallySpeaking-Fachhändler. Auf dem Röntgenkongress wurde es am Stand von Nuance Healthcare Solutions gezeigt, die aber auf der Webseite nicht als Bezugsquelle gelistet sind.

Wie auch bei Dragon NaturallySpeaking Legal handelt es sich im Prinzip um eine Dragon NaturallySpeaking Professional, welche um entsprechende Fachvokabulare (Radiologie, Orthopädie, Allgemeine und Innere Medizin, Chirurgie, Neurologie, Kardiologie) und einige Zusatzfunktionen erweitert wurde. Die Qualität der Vokabulare wird sich in der Praxis erweisen. Die 4voice AG und andere Anbieter bieten schon seit Jahren Vokabulare an, die in der Praxis längst erprobt sind; hier wird also wohl in nächster Zeit ein Wettbewerb beginnen.

Erstmals wird es in Dragon Medical möglich sein, dass das Diktierfenster auch dann Text empfängt und umsetzt, wenn der Cursor in einer anderen Anwendung steht. Dies ist zum Beispiel für Radiologen sehr praktisch, die am Bildschirm Bilder betrachten und dabei diktieren. Spezialisierte medizinische Diktiersysteme wie unser voice4medicine kennen diese Funktion allerdings schon längst.

Laut Ankündigung soll es in Zukunft mit Dragon Medical möglich sein, in elektronischen Patientenakten zu diktieren. Ob das im Umkehrschluss heißt, dass wer Dragon NaturallySpeaking Professional benutzt, sein TurboMed, Medistar oder was auch immer damit nicht mehr bedienen könnte - was im Moment in Deutschland allerdings problemlos funktioniert? Dass die Select-and-Say-Fähigkeit von Dragon NaturallySpeaking Medical einfach auf sämtliche elektronischen Patientenverwaltungssysteme ausgeweitet würde, heißt das mit Sicherheit nicht - dafür sind es einfach zu viele, und zu heterogen.

Einige andere genannte Merkmale sind bereits bekannt, so zum Beispiel das Ausfüllen von Formularen oder das Einfügen von Textvorlagen; auch was das Neue an der Auflistung der zur Verfügung stehenden Sprachbefehle sein soll, wäre mir jetzt nicht auf den 1. Blick transparent. Aber ich habe die Software ja auch noch nicht, um aus 1. Hand zu urteilen. Wenn es soweit ist, wird es hier sicherlich mehr Informationen geben - natürlich auch im Hinblick darauf, ob Dragon Medical eine Alternative zu bereits eingeführten medizinischen Diktiersystemen ist.

07 Mai 2009

"He, Nudlaug, wos is?" - Computer spricht jetzt wienerisch

"He, Nudlaug, wos is?" - Computer spricht jetzt wienerisch

So berichtet der Standard, meines Wissens das österreichische Äquivalent zur Bild-Zeitung, in seiner online-Ausgabe. Da die österreichische Fraktion in der Firma 4voice sich inzwischen verdoppelt hat, wäre eine solche Sprachausgabe für die interne Kommunikation vielleicht hilfreich?

Viel amüsanter sind übrigens die Kommentare, die uns Piefkes all unsere Klischees zu bestätigen scheinen.

06 Mai 2009

Linguatec Voice Pro 12 im FAZ-Test

Linguatec Voice Pro 12: Elektronischer Horchposten mit Microsoft-Genen - so kommentiert die FAZ die aktuelle Version von linguatec voice pro 12 auf Basis der Microsoft Windows Vista-Spracherkennung. Der Test ist sehr aufschlussreich, da er sowohl die Vorzüge - schneller Einstieg und gute Bedienung - wie auch die Nachteile für den Profi aufzeigt und somit eine gute Entscheidungshilfe liefert. Hauptkritikpunkt bleibt aber das, was bereits aus Windows Vista bekannt ist und was linguatec auch nicht hat lösen können: eine schnelle Korrektur über die Tastatur wie aus Dragon NaturallySpeaking bekannt ist nicht möglich; stattdessen müssen Begriffe per Spracheingabe buchstabiert werden.

Also ich mache das ständig so :-) aber wirklich professionell ist es nicht, da hat Herr Dr. Spehr schon ganz recht. Das Fehlen von zahlreichen Einstellungsmöglichkeiten, die Dragon NaturallySpeaking mitbringt, wird den Einsteiger wohl kaum stören. Wer sich allerdings eingehend der Software beschäftigt, beziehungsweise einschlägige Erfahrungen mitbringt, was alles möglich ist, dem fallen diese Mängel deutlich auf.

03 Mai 2009

Download Dragon NaturallySpeaking 10.1 Standard und Preferred

Für Benutzer von Dragon NaturallySpeaking 10 Standard und Preferred hier der Link zum Download der 10.1 (Seriennummer bereithalten):

http://www.nuance.com/vista/naturallyspeaking/Dragon10.1/Dragon10.1_DE/form.asp?L=German

Von Verbesserungen, die über Service Pack 1 und 64bit Vista-Unterstützung hinausgehen, ist dort leider nicht die Rede, obwohl zumindest die englische Version noch mehr mitbringt; z.B. die Unterstützung von Internet Explorer 8 und Firefox 3. Ich warte auf erste Ergebnisberichte, da ich sebst keine gültige Seriennummer der Dragon Preferred habe, kann ich die neue Version weder downloaden noch testen.

28 April 2009

Dragon 10.1 deutsch

Dragon NaturallySpeaking Standard und Preferred werden in allernächster Zukunft auch in Version 10.1 auf Deutsch erhältlich sein. Dies wurde von Nuance bekannt gegeben und gleichzeitig ein Kaufpreis angeboten, der jedem aufrechten Dragon NaturallySpeaking-Händler die Schamröte ins Gesicht treibt - immerhin müssen wir dann hinterher wieder den Support leisten und zwar nach Möglichkeit kostenlos.

Auch die professionellen Versionen werden demnächst in aktualisierter Form erscheinen. Einen Termin hierfür gibt es aber derzeit noch nicht; sobald sich daran etwas ändert, werde ich ihn selbstverständlich mitteilen.

In Dragon NaturallySpeaking 10.1 ist neben der Unterstützung für 64 Bit Windows Vista auch das komplette Servicepack eins enthalten, außerdem einige weitere Veränderungen und Verbesserungen am Vokabular und am Verhalten, zum Beispiel in Microsoft Word.

Wie es immer ist bei Upgrade: erst vorsichtig testen, dann entscheiden, ob es sich lohnt. Die Kompatibilität mit 64 Bit-Vista sollte ja für die meisten von uns nicht ausschlaggebend sein …

17 April 2009

Nuance Anleitung: Vokabular optimieren

Nuance hat auf der amerikanischen Website unter http://support.nuance.com/usersguides einige Dokumentationen zum Download bereitgestellt, von denen zumindest diese Anleitung zur Bearbeitung des Vokabulars für alle Anwender von Dragon NaturallySpeaking sehr interessant sein dürfte.

Hierin sind so ungefähr alle Werkzeuge beschrieben, mit denen sich ein Wortschatz optimieren lässt - geschriebene und gesprochene Formen; Wörter aus Dokumenten hinzufügen; Sprachmodell verbessern; E-Mails verarbeiten und dergleichen mehr.

Dazu ein kleiner Hinweis: beim Anlegen eines neuen Sprechers fordert Dragon NaturallySpeaking bereits dazu auf, das Sprachmodell anhand von Dokumenten und E-Mails zu verbessern. Dies wird nicht empfohlen. Es ist wesentlich effizienter, wenn man dies später aus dem Erkennungscenter heraus tut - einfach deswegen, weil der Assistent viel mehr Möglichkeiten der Anpassung bietet, und weil man außerdem auch selbst die Möglichkeit hat, auszuwählen, welche Dokumente Dragon NaturallySpeaking überhaupt durchsuchen soll (standardmäßig wäre das nämlich nur der Ordner Eigene Dateien).

Allerdings würde ich Vorsicht dabei walten lassen, E-Mails automatisch durchsuchen zu lassen - es wird der Postausgangsordner durchsucht, und er enthält eben nicht nur die eigenen E-Mails, sondern auch eine Menge dessen, worauf man selbst geantwortet hat. Ich habe es jetzt spaßeshalber einmal ausprobiert (nicht ohne vorher meine Benutzerdateien zu speichern), kann aber noch nicht sagen, ob es was bringt. Solange würde ich vermutlich auf diese Funktion verzichten wollen.

16 April 2009

Dragon Flash -- Customer Newsletter

Für amerikanische Kunden (für deutsche auch? Außer Werbung habe ich nie was erhalten) veröffentlicht Nuance einenn monatlichen Newsletter, dessen aktuelle Ausgabe Sie unter Dragon Flash -- Customer Newsletter - Speaking About Dragon - from Nuance finden. Leider keine Angaben, wie er sich abonnieren lässt.

Der Newsletter enthält Hinweise zu DNS 10.1, das in englischer Sprache nun als Standard, Preferred und Professional für Anwender der V. 10 zum Download bereitsteht, außerdem Hinweise zum Anlegen gesprochener Formen im Vokabular, etwas, das integraler Bestandteil meiner Schulungen ist. Unter "Wörter - Anzeigen/Bearbeiten" lässt sich zu einem Wort, dessen Schriftbild von der Aussprache abweicht (Abküruzunegn, Fremdwörter usw.) eine "gesprochene Form", d.h. eine Lautschrift der Aussprache anlegen. Hört Dragon dies, schreibt er/sie/es (m.E. ist der Drache ein Weibchen, aber suchen Sie sich das korrekte Pronomen selbst heraus) die entsprechende geschriebene Form.

So lässt sich z.B. "4voice AG" als "vor weuß ah geh" wiedergeben, "form- und fristgerecht" als "Form und fristgerecht" und dergleichen mehr. Wer Schwierigkeiten mit der Erkennung bestimmter Wörter hat, sollte sich diese Funktion einmal näher ansehen. Mehr Hinweise dazu im Newsletter selbst.

26 März 2009

Dragon NaturallySpeaking 10.1 erscheint - Stück für Stück

Nuance hat die Download-Seite für Dragon NaturallySpeaking 10.1 eingerichtet. Zunächst kann das Upgrade nur für die englischen Versionen von Dragon NaturallySpeaking Preferred und Dragon NaturallySpeaking Standard runtergeladen werden. Weitere Sprachen und Ausgaben werden folgen, bis Juli 2009 sollen alle Sprachen und alle Versionen bedient sein.

Das Upgrade ist kostenlos für alle Anwender von Dragon NaturallySpeaking 10. Inwieweit man zum Upgrade berechtigt ist, wird durch die Abfrage der Seriennummer festgestellt. Halten Sie die Seriennummer daher bereit, wenn Sie das Update durchführen wollen - denken Sie aber auch daran, dass es für Deutsch im Moment noch gar nicht verfügbar ist. Das Erscheinen wird beizeiten an dieser Stelle mitgeteilt.

17 März 2009

Sprachsteuerung und Spracherkennung am Computer für Behinderte mit Dragon NaturallySpeaking - ein Erfahrungsbericht

Sprachsteuerung und Spracherkennung am Computer für Behinderte mit Dragon NaturallySpeaking - ein Erfahrungsbericht von "Sitting Fool", durch eine Multiple Sklerose-Erkrankung komplett gelähmt.

Ich habe es beruflich und privat eigentlich nur mit Leuten zu tun, die Spracherkennung einsetzen, um sich die Arbeit zu erleichtern oder zu beschleunigen. Es gibt aber auch genügend Leute, die ohne Spracherkennung überhaupt keine Möglichkeit haben, mit dem Computer und der Welt zu kommunizieren. Dieser Erfahrungsbericht wirft ein Licht auf diese - inzwischen kommerziell vollständig unterrepräsentierte - Gruppe von Benutzern.

Wenn man davon ausgeht, das Dragon NaturallySpeaking irgendwann einmal genau zu diesem Zweck konstruiert wurde, man dann aber feststellte, das sich wesentlich mehr Geld mit Ärzten und Juristen verdienen lässt, wirft das ein bezeichnendes Licht auf uns alle. Ich gebe selbst zu, das ich mir nicht zutrauen würde, den Computer komplett ohne Hände zu bedienen und dass ich deswegen Kunden auch gerne an Spezialanbieter wie die Firma Humansystem verweise.

Die in Windows Vista eingebaute Spracherkennung ist übrigens, was die Bedienung des Computers angeht, vorbildlich und machte mir intuitiv mehr Spaß als Dragon NaturallySpeaking. Die Leistung beim Diktat ist allerdings nicht ganz so gut. Interessanterweise kann man beide Spracherkennungen parallel verwenden - also für die Steuerung des Computers die eingebaute Spracherkennung von Windows Vista, zum Diktat Dragon NaturallySpeaking. Wenn man dann aus Versehen beide Maschinen eingeschaltet hat, wird jeder Satz zweimal hingeschrieben - sehr schön, um einen direkten Vergleich zu erhalten :-)

15 März 2009

Dragon blog! - Speaking About Dragon - from Nuance

Wie ich gerade erfahre, habe ich Gesellschaft: es gibt jetzt ein Dragon blog direkt von Nuance! Erster Blogger ist kein Geringererer als Peter Mahoney, Senior Vice President and General Manager, Dragon, also quasi der oberste Drachenkämpfer.

Eine der neuesten Ankündigungen bezieht sich darauf, dass Dragon 10 bald auch in einer Version für 64-bit Windows Vista erhältlich sein wird. Mal schauen, ob bei der Gelegenheit auch weitere Wünsche umgesetzt werden, die das Service Pack 1 noch offen lässt.

Die Ankündigung hat überraschend viele Antworten hervorgerufen - ich wusste nicht, dass 64-bit Vista schon so verbreitet ist. Oder gilt das nur für Amerika?

07 März 2009

CeBIT News 2: Linguatec Voice Pro

Linguatec stellt mit der bereits erwähnten VoicePro 12-Software eine Lösung vor, die die Spracherkennung von Windows Vista benutzt, dem verbesserungsfähigen Diktat unter Vista aber durch erweiterte Sprachmodelle und Korrekturmöglichkeiten aufhilft. Nach Auskunft von Linguatec wurden heirzu ca. 15.000 Sprecher aufgenommen, um das deutsche Sprachmodell der Vista-Spracherkennung zu verbessern, und auf den Servern in Redmond adäquat verarbeitet. Die Live-Demonstration sah sehr gut aus.

Da die wirklich vorbildliche Vista-Sprachsteuerung verwendet wird, ließ sich einiges Erstaunliche zaubern, z.B. Die Toten Hosen aufs Wort loslärmen lassen und per Sprachbefehl lauter stellen. Die Sprachsteuerung ist m.E. ein echter Komfortgewinn - in der Vorbereitung auf den Messetermin hatte ich mich mal wieder an meinen Vista-Rechner gesetzt und gemerkt, wie gut er sich per Sprache bedienen lässt, solange die Programme von Microsoft sind. Auch dies soll Voice Pro besser machen und auch Nicht-Microsoft-Anwendungen bedienen.

Allen Versionen bis auf die Standard liegen zusätzliche Fachwortschätze bei, die, wie aus früheren Versionen von VoicePro bekannt,zum Grundwortschatz zugeschaltet werden können. So lässt sich auch eine Kombination aus z.B. Sport und Wirtschaft erealisieren; wie sinnvoll das ist und ob sich der Sprachgebrauch eines Sportreporters nicht doch in mehr als nur der Wortwahl von dem eines Managers unterscheidet, sei dahingestellt.

Dateien vom Diktiergerät kann VoicePro 12 ebenfalls umsetzen, allerdings nicht das DSS-Format. Hier wollte man wohl Lizenzgebühren sparen und verweist auf die DSS-Konverter, die jedem Profi-Diktiergerät beiliegen. Diktate können mitsamt Originalaufnahme abgespeichert werden, so dass ein Workflow in der Theorie möglich wäre (aber noch nicht ersthaft verfolgt wird).

Korrektur und Wortschatzbearbeitung wurden gegenüber Vista verbessert, jedoch konnte ich mir diese Bestandteile nicht live ansehen. Hier bleibt noch was zu testen, wenn die endgültige Version erscheint. Ich bin gespannt, ob die Benutzerfreundlichkeit hier so gut ist wie bei der Rechnersteuerung.

Übrigens wird es auch eine Wireless-Version geben, der das Wideband-Bluetooth-Headset Jabra MN5390 beiliegen soll.

Hier noch ein Bericht auf ZEIT Online.

CeBIT-News

Das GMX-Magazin erinnert an Exkanzler Gerhard Schröder, der sich zur CeBIT 1999 wünschte: "Ich mchte gerne einen Computer haben, in den ich reinsprechen kann." Zehn Jahre spter wartet GMX noch immer auf den Computer, der aufs Wort hört, - ich aber habe mir schon mal das eine oder andere in die Richtung angesehen.

Datatronic zeigte am Datev-Stand ihr Diktiersystem inkl. SpeechMagic-Spracherkennung, das sich v.a. durch seine Anbindung an Datev Phantasy auszeichnet.Auf derselben Basis, jedoch nach eingenen Angaben durch mehr Schnittstellen vielseitiger einsetzbar, ist DictaPlus, die nach der Übernahme von Philips Speech Recognition durch Nuance jetzt auch wieder in den medizinischen Sektor wollen und dazu in der kommenden Version 6.2 einige Schnittstellen versprechen.

Auf Dragon als Spracherkennung bauen die Diktiersysteme von Dictanet, WinScribe und Thax. Bei allen drei Herstellern war das mobile Diktat in das iPhone (nur Dictanet) und den Blackberry ein Thema. Der iPhone-Client von Dictanet und das Blackberry-Diktat von WinScribe sollen grundsätzlich auch in der Lage sein, an eine Spracherkennungngesendet zu werden, was mein heimlicher Traum ist: unterwegs diktieren und das geschriebene Diktat zuhause (oder gar per Mail auf dem mobilen Gerät) erhalten. Thax, die für Dictanet den Blackberry-Client liefern, arbeiten nach eigener Aussage auch daran, holten mich aber auf den Boden der Tatsachen zurück mit der Anmerkung, dass die Tonqualität wohl kaum für wirklich gute Spracherkennung ausreichen dürfte.

Während diese Hersteller sich auf juristische und medizinische Workflowlösungen spezialisiert haben, stellt Linguatec mit der neuen VoicePro 12-Software eine Lösung vor, die auch für den weniger spezialisierten Anwender - und Gerhard Schröder -interessant ist. VoicePro basiert auf der für sich genommen schon vorbildlichen Sprachsteuerung von Windows Vista und hilft dem noch deutlich verbesserungsfähigen Diktat unter Vista durch verbesserte Sprachmodelle und Korrekturmöglichkeiten auf. Mehr darüber im nächsten Post.

Über Spinvox habe ich hier bereits berichtet; was mir neu war, ist, dass die Technologie dahinter zumindest teilweise von dem ägyptischen Hersteller InfoDynamix. Dort ruft man tatsächlich einen Server an, der Sprache in Text verweandelt; die deutsche Dependance in Düsseldorf ist aber leider meist überlastet, so dass es nur selten gelingt, sich selbst eine Sprachnachricht zu diktieren,. Dies soll sich aber demnächst ändern, wie mir ein freundlicher Vertreter der Firma versprach - wollen wir es hoffen.

Schließlich benötigt man für gutes Diktat ein gutes Mikrofon. Plantronics stellt zwei neue schurlose Headsets von, die wahlweise an PC und Handy bzw. Festnetztelefon angeschlossen werden können, so dass man nur ein Gerät für beides braucht. Sie sollen im Laufe des Jahres unter der Bezeichnung Savi Office bzw. Savi Go erscheinen. Savi Office funkt per DECT, Savi Go mit Wideband Bluetooth, womit es dann auch für Spracherkennung tauglich sein sollte, wenn die Konnektivität stimmt.

02 März 2009

Dragon Service Pack 1: Mehr Erfahrungen

Ich habe mal einige der wichtigsten Verbesserungen zusammengestellt, die das Service Pack 1 für Dragon NaturallySpeaking 10 bringt:

- Zahlenformatierung (z.B. nach Komma) verbessert
- Daten werden etwas besser erkannt
- Einstellungen im Menü "Formatierung" werden i.d.R. beibehalten sowie benutzerspezifisch gemacht und ergänzt; insbesondere die Einstellungen für Zahlenformate und Komposita werden nicht mehr vergessen
- Fehler in der Zusammenarbeit mit Textcontrol-Fenster behoben
- Buchstabiermodus verbessert: keine überflüssigen Leerzeichen mehr
- Befehl "verbinde das" verbessert
- Beim Diktieren eines hinzugefügten Begriffs zu Beginn eines Absatzes wird dieser Begriff nicht mehr zwangsläufig groß geschrieben
- Seriennummer kann angezeigt werden
- Wörter werden nicht mehr hinterrücks ins Vokabular aufgenommen, sondern nur bei Korrektur über das Menü oder nach Befehl "verbinde..."

Letzteres ist vermutlich die beste Neuerung, weil das automatische Hinzufügen von Wörtern zum Wortschatz immer ein Ärgernis war, das Fehler ins Vokabular brachte. Obwohl ich mich fast daran gewöhnt hatte, einfach durch Übertippen von Erkennungsfehlern neue Wörter zum Wortschatz hinzuzufügen - aber der eine Tastendruck vorher und nachher ist ja wirklich kein Hindernis, verglichen mit der Kontrolle, die ich jetzt (endlich) habe.

Schließlich fiel mir (und anderen) auf, dass nach Installation die Erkennungsgenauigkeit zunächst nachlässt, dann aber nach ca. 1 h Diktat wieder das gewohnte Niveau erreicht oder soggar übertrifft - ich diktiere derzeit mit praktisch 100% Genauigkeit.

Also ein empfohlener Download!

24 Februar 2009

Linguatec Voice Pro 12 kommt!

Am 27.3.2009 ist der Erscheinungstermin für Linguatec Voice Pro 12. Bereits im letzten Sommer angekündingt, wird zur CeBIT eine Vorabversion vorgestellt; das Programm kommt dann Ende März in den Handel.

Voice Pro war bisher immer auf IBM ViaVoice-Basis. ViaVoice wird aber seit Jahren nicht mehr weiterentwickelt. So hat man sich entschieden, eine neue Technologie zugrundezulegen: die Spracherkennung, die Microsoft in Windows Vista einsetzt.

Damit ist linguatec der (meines Wissens) erste Hersteller, der aus dieser Technologie ein ganzes Produkt macht - mit (hoffentlich) verbesserter Korrekturfunktion, der Möglichkeit, Wörter, die gleich ausgesprochen werden, intelligent korrigieren zu können, verschiedenen Fachwortschätzen unter anderem für EDV, Medizin und Recht, Transkription von Diktaten von Diktiergerät, Export von Benutzerprofilen - die ganze Palette, die man heutzutage eigentlich von einer einigermaßen fortgeschrittenen Spracherkennung erwarten dürfte.

Es fehlt bisher noch die Möglichkeit, Befehle zu definieren, diese ist von Microsoft selbst aber für Deutsch auch noch gar nicht implementiert. In einem US-amerikanischen Windows ist es bereits möglich, eigene Befehle anzulegen, der Chefentwickler selbst teilte mir aber nicht, dass dies für andere Ausgaben noch nicht verwirklicht ist.

Preislich dürfte linguatec voice pro eine echte Alternative zu Dragon NaturallySpeaking sein, wenn dann die Erkennungsgenauigkeit ungefähr das hält, was die Ankündigungen versprechen. Insbesondere die Anwendungen für Ärzte und Rechtsanwälte sind mit circa 400 € um die Hälfte günstiger als vergleichbare Anwendungen mit Dragon NaturallySpeaking. Für den nicht spezialisierten Anwender gibt es eine Standard- und eine Premium-Version, die mit 69 € beziehungsweise 169 € preislich im selben Rahmen wie Dragon NaturallySpeaking liegen.

Es zeigt sich aber auch ein großes technisches Problem: dadurch, dass die Spracherkennung von Windows Vista eingesetzt wird, benötigt linguatec voice pro als Systemvoraussetzung Windows Vista oder das (für den Sommer angekündigt) Windows 7. Seit Erscheinen von Windows Vista habe ich noch bei keinem professionellen Kunden eine Installation unter diesem Betriebssystem gemacht. Windows 2000 ist im professionellen Umfeld bisher noch häufiger anzutreffen. Nach meinem Dafürhalten wird sich das mit Windows Vista auch nicht mehr ändern. Wer überlegt, auf ein neues Betriebssystem umzusteigen, wird stattdessen wahrscheinlich lieber auf das mit viel Vorschusslorbeeren bedachte Windows 7 warten, ein Umstand, der den Einsatz von linguatec voice pro im professionellen Umfeld in der nächsten Zeit deutlich behindern wird. Die restlichen Systemanforderungen sind so, dass ein Rechner mit Vista sie problemlos erfüllen dürfte.

Jedenfalls würde ich mich sehr darüber freuen, wenn ich die Spracherkennung mal testen könnte. Interessant dürfte auch werden, wie sie im Vergleich zur reinen Windows Vista-Spracherkennung abschneidet, was die Erkennungsgenauigkeit angeht. Hier hätte man dann jedenfalls eine Referenz, von der aus man zu dem Produkt raten könnte (Sie wissen nicht, ob es was für Sie ist? Probieren Sie es erstmal aus und setzen sie dann das Produkt obendrauf.) Der Mehrwert ergibt sich dann von ganz allein aus den verbesserten Anwendungsmöglichkeiten und Wortschätzen.

20 Februar 2009

Servicepack 1 für Dragon NaturallySpeaking

Seit vorgestern ist das Servicepack 1 für Dragon NaturallySpeaking 10 erhältlich. Registrierte Anwender können das herunter laden, indem sie unter "Hilfe - nach Software-Aktualisierungen suchen" klicken. Es wird dann im Internet danach gesucht und das Paket wird heruntergeladen. Bitte beachten Sie die Anweisungen des Herstellers zur Installation - dies hier ist ein Blog und kein Handbuch :-)

Einige ärgerliche Fehler sind behoben worden, andere sind immer noch da. Die Experten liefern sich schon wieder heiße Diskussionen (http://forum.oasa-speech.de/viewtopic.php?t=353), für den normalen Anwender haben sich jedoch zunächst einmal viele Dinge verbessert, von denen ich hier wenigstens die wichtigsten aufführen möchte:

- die Formatierung von Zahlen nach einem Komma ist verbessert worden, außerdem merkt Dragon NaturallySpeaking sich jetzt einigermaßen zuverlässig, ob Zahlen immer als Ziffern geschrieben werden sollen oder nur wenn sie größer als 10 beziehungsweise 100 sind (Menü "Formatierung")
- das gleiche gilt für Komposita: im Menü "Formatierung" kann ich den Haken vor Komposita wegnehmen, Dragon hört dann auf, ungefragt mehrere Wörter zu einem zusammenzuziehen
- hat man im Vokabular einer aus mehreren Wörtern bestehende Wortverbindung abgelegt, wird diese jetzt auch nach einem neuen Absatz korrekt geschrieben
- das Menü "Formatierung" wurde in einigen weiteren Punkten überarbeitet, so lassen sich wesentlich mehr Eigenschaften zuschalten und abschalten.

Gravierende Nachteile sind mir nach einem Tag Arbeit nicht aufgefallen, was - werden die Experten sagen - für mein oberflächliches Arbeiten sprechen mag, ich selber schmeichele mir aber damit, dass ich mich in meinen Gewohnheiten nicht von der großen Menge der Anwender unterscheide und daher guten Gewissens dazu raten kann, das Servicepack herunterzuladen. Auch wenn für spätere Ausgaben noch genug zu tun bleibt, sind doch etliche Fehler beseitigt worden, einige neue Optionen hinzugekommen, so dass sich die Installation wohl lohnen dürfte.

Vorsichtige Leser werden dennoch ein paar Tage abwarten, ob ich in der nächsten Woche eventuell doch noch über etwas stolpere... das Servicepack kann nämlich nicht deinstalliert werden, sondern erfordert eine komplette Deinstallation von Dragon NaturallySpeaking.

30 Januar 2009

Loquendo Spracherkennung für Russisch

Loquendo ASR (Automatic Speech Recognition) jetzt auch für Russisch erhältlich - mit Zielgruppe Auto, Navigationssysteme usw.

Loquendo kannte man bisher eher als Anbieter von text-to-speech-Systemen, doch auch Spracherkennung für einige Sprachen, darunter jetzt auch Russisch, ist im Portfolio. Die Features klingen nicht schlecht, u.a. die Fähigkleit, multiple Befehle nacheinander zu geben, ohne Pause dazwischen; Unabhängigkeit vom Sprecher, hohe resistenz gegenüber Nebengeräuschen (im Auto essentiell). Es soll auch PC-taugliche Anwendungen geben, aber das große Geld ist damit natürlich nicht zu verdienen.

Mein alter Traum einer Diktiersoftware für Russisch ist daher immer noch in weiter Ferne :-(

27 Januar 2009

SVOX kauft Sprachverarbeitungssparte der Siemens AG

Zur Meldung: SVOX kauft Sprachverarbeitungssparte der Siemens AG: Expansion in Spracherkennung und Sprachdialog

Bei dieser Akquisition geht es nicht um Diktat, sondern v.a. um Anwendungssteuerung im Auto und im Handy: beide Firmen haben hier schon längere Zeit kooperiert. SVOX, die sich bisher eher im Bereich Text-to-speech hervorgetan haben, hat damit jetzt eine Spracherkennungsengine und ist in der Entwicklung von Dialogsystemen unabhängiger.

26 Januar 2009

iX-Artikel: Sprach- und Texterkennung heute

In der Computerfachzeitschrift iX findet sich ein umfassender und technisch recht avancierter Artikel zum aktuellen Stand der Texterkennung (OCR) und Spracherkennung im Computer:

"Wer immer noch Texte oder Audiokassetten abtippt, mag dafür gute Gründe haben. Vielleicht kennt er aber auch einfach nur nicht die neuesten Programme zur Text- und Spracherkennung. iX hat sich einige Angebote näher angesehen."


Getestet werden im Bereich Spracherkennung Dragon NaturallySpeaking 10, Linguatec Voice Pro und MacDictate. Interessanterweise bescheinigt der Tester keinem Programm eine deutliche Überlegenheit in der Erkennungsleistung, von den Features her hat Dragon aber die Nase vorn. VoicePro steht immer noch bei V. 11 und ist daher noch nicht Vista-fähig, obwohl schon im Sommer das Upgrade angekündigt wurde. MacDictate ist laut Test inzwischen auf Deutsch erhältlich, die Website des deutschen Vertriebs weiß davon allerdings noch nichts.

Besonders interessant, weil auch für den (technisch einigermaßen gebildeten) Anwender verständlich, ist eine 2 Seiten lange Beschreibung dessen, welche technischen Grundlagen der Spracherkennung zugrundeliegen. Zeitschriften, die sich an den interessierten Laien wenden, sparen dies meist aus (auch weil die zugrundeliegende Mathematik das Abiturniveau deutlich überschreitet). Wer also wissen möchte, wie seine Spracherkennung unter der Haube funktioniert, sollte mal einen Blick in die Zeitschrift werfen.

Hier die Zusammenfassung der Heise-Redaktion.

18 Januar 2009

Spracherkennung mit dem Logitech ClearChat Wireless

Dennis Deutschmann bloggt zum Thema Spracherkennung mit dem Logitech ClearChat Wireless.

Wenn's stimmt, was er schreibt, nämlich dass das schnurlose Headset für 99€ empf. VK mit Spracherkennung auf dem Netbook eine sehr gute Erkennung liefert, werden sich Plantronics und GN Netcom, deren Headsets das dreifache kosten, noch umschauen.

Ich versuche mal, selbst so eins zum Test zu erhalten. Und ein Netbook hätte ich auch gern... seufz... mit Spracherkennung...

17 Januar 2009

Nuance entwickelt jetzt mit IBM zusammen

Der neuesten Pressemitteilung von Nuance zufolge kooperiert man jetzt mit dem (außer Microsoft) letzten verbliebenen Entwickler von Spracherkennung, nämlich mit IBM. Spracherkennungslösungen von IBM und Nuance sollen vor allen Dingen im Bereich Callcenter und Embedded vorangetrieben werden.

Seit IBM die Entwicklung von ViaVoice praktisch eingestellt hat, haben sie dort sich auf diese beiden Bereiche konzentriert. Auch Nuance ist in diesem Bereich recht stark vertreten. Eine Kooperation wird also zwei traditionsreiche Entwicklungslinien zusammenfügen.

ViaVoice befindet sich schon längst im Vertrieb von Nuance und wird dort seit Jahren erfolgreich totgeschwiegen. Das aber hier mit einer neuen Version zu rechnen ist, ist auch nach dieser Kooperationsvereinbarung höchst unwahrscheinlich. Nur das kleine gallische Dorf linguatec scheint hier noch irgendwas in Planung zu haben - aber diese Planungen sind auch schon ein halbes Jahr alt, ohne dass ich bisher ein Produkt gesehen hätte -?

07 Januar 2009

Select-and-say

Select-and-Say ist ein wesentliches Feature von Dragon NaturallySpeaking, das im Wesentlichen bedeutet, dass jedes auf dem Bildschirm sichtbare Wort per Sprache ausgewählt und bearbeitet werden kann, egal ob es vorher diktiert oder getippt wurde. Dies Feature funktioniert nicht in allen Anwendungen, jedoch in allen gängigen Office-Programmen wie Microsoft Word, Microsoft Outlook, Microsoft Excel und zahlreichen anderen. Eine vollständige Liste findet sich in der Dragon NaturallySpeaking-Hilfe, wenn man "Select-and-Say" als Suchwort eingeht.

Für den konkreten Einsatz bedeutet Select-and-Say, dass innerhalb eines Diktates ein Wort oder eine Phrase per Sprachbefehl markiert und/oder korrigiert werden kann. Dabei ist es möglich, sich auch die Aufnahme (falls vorhanden) bis Diktates vorspielen zu lassen und auf diese Weise über die Korrekturfunktion von Dragon NaturallySpeaking das Sprecherprofil zu verbessern.

Ob eine Anwendung Select-and-Say unterstützt, lässt sich leicht daran erkennen, ob in der Dragon-Leiste ein grüner Punkt erscheint, oder ob dieser Punkt grau ist. Grün bedeutet, dass Select-and-Say in vollem Umfang funktioniert.

In Anwendungen, die Select-and-Say nicht unterstützen, steht diese Möglichkeit nur solange zur Verfügung, wie das Diktat im Arbeitsspeicher gespeichert ist, das heißt in der Regel bis zum nächsten Tastendruck oder Mausklick. Außerdem zeigt sich, dass in vielen Anwendungen einer Auswahl oder Korrektur der Sprache nicht passgenau möglich ist, Dragon NaturallySpeaking also nicht das Wort ganz genau markiert, sondern häufig ein Zeichen vorher oder hinterher mit einschließt oder weglässt. Dies äußert sich in verschiedenen Programmen unterschiedlich stark, so kann es sein, das in einigen Programmen ein Diktat überhaupt nicht möglich ist oder nur mit extremer Verzögerung; in anderen Programmen kann man fast wie gewohnt arbeiten, solange man keine Taste drückt und die Maus nicht betätigt. Dies hängt letztlich von den verwendeten Windows-Fensterklassen ab - wenn diese sich ähnlich verhalten wie die von Dragon NaturallySpeaking hundertprozentig unterstützten Fensterklassen, geht das Arbeiten mit Dragon NaturallySpeaking sehr flüssig.

In einigen Anwendungen kann Select-and-Say von Hand aktiviert werden. Dazu gibt es zwei - leider nicht mehr ganz aktuelle - Einträge in der Nuance Knowledge Base, die Nummer 3417 und die Nummer 4247, die über die Suchfunktion zu finden sind.

Anwendungen, die Select-and-Say nicht unterstützen, in Deutschland aber sehr populär sind und deswegen immer wieder zu Anfragen Anlass geben, sind zum Beispiel Open Office, Mozilla Firefox, Mozilla Thunderbird. Die Unterstützung für letztgenannte Programme beschränkt sich in Dragon NaturallySpeaking auf Sprachbefehle. Diktat mit voller Select-and-Say-Funktionalität ist jedoch in den Fenstern nicht möglich, wie immer wieder beklagt wird. Hier muss man gegebenenfalls das Diktierfenster zu Hilfe nehmen. Da alle diese Anwendungen aus der Open Source- und Linux-Welt stammen, und daher mit Standard-Windows-Fensterklassen nicht kompatibel sind, außerdem in Amerika bei weitem nicht so populär sind wie hier, ist in näherer Zukunft auch nicht mit einer vollen Select-and-Say-Unterstützung zu rechnen.

Gelegentlich kommt es vor, dass eine Select-and-Say-fähige Anwendung diese Fähigkeit verliert. In der Regel ist dann entweder nötig, das entsprechende Add-In wieder zu aktivieren, oder - im Falle von Microsoft Word - die Dokumentenvorlage normal.dot zu löschen. In schweren Fällen sind auch andere Eingriffe nötig, zum Beispiel das Löschen der ctfmon.exe. Der geneigte Leser findet eine Anleitung in der Nuance Knowledge Base unter der Nummer 3118.

Bugs in Dragon berichten

Wer Bugs in Dragon NaturallySpeaking findet, kann diese hier melden. Wichtig ist, so viel Information wie möglich zu liefern, damit sich das Problem reproduzieren lässt. Dafür hat man allerdings gerade mal 1.000 Zeichen Platz. Viel mehr Mühe geht drauf für eine Systembeschreibung, Eingabe der Seriennummer usw. Außerdem darf man zwar seine E-Mail angeben, erhält aber nach Absenden des Reports eine Meldung:

Thank you for your report to Nuance. We appreciate your effort in reporting this issue along with the details of how to re-create. We will review all reported bugs for possible resolution in a future release.

ISSUES SUBMITTED ON THIS FORM WILL NOT RECEIVE A RESPONSE.


Böse Zungen würden jetzt behaupten, viele Probleme seien schon so oft reproduziert und in diversen Foren gemeldet (sowie teils behoben) worden, dass Nuance einfach mal dort nachlesen sollte - aber vielleicht hilft es ja trotzdem... die Prozedur ist ansonsten dieselbe wie beim Problemformular unter http://epay.scansoft.com/de/, wo man aber wenigstens gelegentlich eine Antwort erhält.

19 Dezember 2008

Spracherkennung unter Linux als Open Source

Simon listens ist der Titel eines österreichischen Projekts, das unter Windows, aber auch unter Linux eine Open-Source-Spracherkennung zur Verfügung stellen will. Die erste Alpha-Version ist vor kurzem erschienen. Ein Video der Funktionsweise ist auf der Webseite abrufbar.

Bei Simon handelt es sich um eine einfach zu benutzende grafische Schnittstelle für die Spracherkennungs-Software Julius und das HTK-Toolkit. Die benötigten Wörterbücher holt Simon direkt aus dem Wiktionary, einem Wikipedia-Schwesterprojekt. Dateien importiert die Software im HADIFIX- oder HTK-Format. Simon trainiert die Sprache anhand einfacher Beispiele und erkennt so neue Wörter. Da Simon über das TCP/IP-Protokoll auf die Julius-Engine zugreift (die man separat startet), kann die Spracherkennung auf einem zentralen Server erfolgen.

Die Julius-Engine gibt es schon etwas länger, wobei sie als Erkenner zunächst sprachunabhängig entwickelt wurde, um Sprachmodelle beliebiger Sprachen aufzunehmen. Konkret gab es dort Entwicklungen für Japanisch und Englisch, beide noch nicht sehr weit fortgeschritten. Simon-Listens integriert nun ein deutsches Sprachmodell in die Engine, so dass auch Deutsch erkannt wird.

Simon Listens bezieht sich übrigens darauf, dass das Projekt ursprünglich angetreten ist, einem behinderten Jungen namens Simon den Zugang zum Computer zu ermöglichen. Unterstützer werden noch gesucht (mehr dazu hier). Gerade zur Weihnachtszeit doch eine schöne Sache!

(mit Informationen von http://www.linux-community.de/Internal/Nachrichten/Simon-freie-Spracherkennung-fuer-Linux

15 Dezember 2008

Sauber diktieren!

Dieser Beitrag passt sehr gut zu meinem letzten Eintrag: will ich ein ordentliches Ergebnis beim Diktieren, muss ich auch ordentlich diktieren.

"Dragon hält uns da den Spiegel vor und zeigt uns, wie wir denken und Material organisieren. Und anstatt frustriert oder verärgert zu sein über das, was ich auf dem Bildschirm lese, nehme ich es als Gelegenheit wahr, meine Fähigkeiten zu verfeinern, Texte zu verfassen und zu schreiben."


Den zitierten Aphorismus von Lichtenberg "Bücher sind wie Spiegel, und wenn Affen hinein schauen, blicken keine Menschen zurück" würde ich aber lieber etwas kundenfreundlicher formulieren. Wer wird schon gern als Affe bezeichnet? Also lieber so:

Optimieren Sie Ihren Input, dann optimieren Sie auch das Ergebnis.

(Dank an Rüdiger Wilke!)

13 Dezember 2008

Äh! (Nothing but speech)

Beim Kunden gestern machte ich einige interessante Erfahrungen. Zwei Ärzte sollten geschult werden,. Der eine gehörte zu der Fraktion der Diktanten, die an viele Wörter ein äh-Geräusch hängen bzw. zunächst unartikulerte Laute ausstoßen, bevor sie ein Wort sagen.

(Vielen ist das gar nicht bewußt. Für Spracherkennung ist es aber Gift, statt "der" etwas wie "nnder" und statt "Punkt" z.B. "Punktäh" zu sagen, was vom Drachen dann getreulich als "Inder" und "Punkte" geschrieben wird. Nicht immer liegt der Fehler hinter dem Bildschirm!)

Der andere sprach flüssig, zwischendurch entschlüpfte ihm aber auch das ein oder andere "äh" auf der Suche nach dem richtigen Wort.

Dragon schreib nun bei Arzt 1 ständig kleine Wörter wie "in", "der", "um" ins Diktat. Bei Arzt 2 wurden die gelegentlichen "äh" ignoriert. Warum? Nun, wohl weil letzterer das "äh" nicht mit einem Wort verschmolz, sondern als einzelnes "Wort" sprach. Hier greift die "Nothing-but-speech"-Option von Dragon, die Nebengeräusche ausfiltert.

Wenn die Nebengeräusche jedoch so dicht an ein Wort artikuliert werden, dass sie als Teil des Wortes (fehl-) erkannt werden, hat Dragon keine Chance. Hier hilft der Logopäde.

Mehr dazu auch hier.

03 Dezember 2008

Neues von der Medica

Wegen ausreichender Arbeitsbelastung sowie einer Operation am Weisheitszahn komme ich leider erst heute dazu, ein paar Neuigkeiten von der Medica 2008 in Düsseldorf zu berichten, wie inzwischen auch schon zwei Wochen her ist.

Das größte Ereignis sicherlich die Ankündigung von Nuance, man werde fortan im medizinischen Bereich die vor einigen Wochen von Philips aufgekaufte SpeechMagic (Dragon NaturallySpeaking erkannte an dieser Stelle "zwiespältig :-)-Lösung einsetzen.

(Die Pressemitteilung: http://www.nuance.de/news/20081119_medica.asp)

Aus Sicht des Herstellers ist dies nur logisch: man hat einen zweistelligen Millionenbetrag für die Philips-Spracherkennung ausgegeben und will diese dort nutzen, wo sie ihre Stärken hat, nämlich im medizinischen Geschäft, bei Workflow-Lösungen in einem Krankenhaus, wo ein Arzt zwar mit Spracherkennung digital diktieren soll, sich aber nicht weiter um die Korrektur und Bearbeitung der Diktate kümmern soll, sondern dies dem Schreibbüro überlässt. Hier bietet die jetzt neu benannte SpeechMagic Solution Builder-Lösung einen bekannten und eingeführten Workflow.

Angesichts der Tatsache, dass Dragon NaturallySpeaking auch im medizinischen Bereich ein gut eingeführtes Produkt ist, wird dies natürlich die Frage auf, was mit Dragon
passieren wird. Gerade auch meine eigene Firma, die 4voice AG, hat ja einen eigenen Workflow - bis vor nicht allzu langer Zeit in direkter Konkurrenz zur Philips-Lösung -, der genau dasselbe zu leisten verspricht, aber mit Dragon NaturallySpeaking-Spracherkennung (und natürlich einigen Extras, die Philips so nicht bietet - aber das ist ein anderes Thema).

Letztlich wird die 4voice AG aber von dieser Entwicklung sogar profitieren: als langjähriger Partner von Nuance können wir jetzt auch die Philips-Lösung anbieten, behalten aber unsere Kompetenz mit Dragon NaturallySpeaking weiter. Das bedeutet auch: wenn ein großer Workflow mit Philips-Lösung gefragt ist, können wir dies bedienen; in anderen Fällen können wir weiter unsere Lösungen mit Dragon NaturallySpeaking anbieten.

Zu erwarten steht außerdem die Dragon NaturallySpeaking Medical Edition 10, die allerdings auf der Messe noch nicht gezeigt wurde und für die auch noch kein Erscheinungstermin feststeht. Wenn diese erst mal da ist, hat Nuance zwei schlagkräftige Produkte - einen Workflow und ein Produkt für Ärzte, die lieber alleine arbeiten wollen, das sich aber auch in einem Workflow integrieren lässt.

Wie der Markt auf diese Entwicklung reagiert, wird sich zeigen: es gab genauso Rückmeldungen, die diesen Entwicklungen positiv entgegensehen, wie auch andere, die eine allzu große Marktkonzentration eines Herstellers eher negativ finden. Dies sind aber nur die ersten Eindrücke - in den nächsten Wochen und Monaten wird sich zeigen, wie es tatsächlich weitergeht.

Zum Schluss sei noch die erfreuliche Tatsache vermeldet, dass der Kontakt zum neuen Nuance- (und ehemaligen Kuhlmann-) Vertriebsteam sehr freundlich verlaufen ist, wo jetzt nicht mehr gegeneinander antreten! Für mich der schönste Aspekt der Messe.

15 November 2008

Google stellt Suche mit Spracherkennung für iPhone vor

Google stellt Suche mit Spracherkennung für iPhone vor

Gestern kündigete Google eine Applikation für das iPhone an, mit der eine Suche über eine Spracheingabe ermöglicht werden soll: Ich spreche in mein (ach wäre es doch mein!) iPhone "suche China-Restaurant in Berlin-Neukölln", das iPhone schickt die Anfrage an den Goolge-Server, und Google weist mich zu meinem Liebligs-Chinesen Herrn Tang in der Karl-Marx-Straße... um das Prinzip zu verdeutlichen.

Leider geht diese Applikation noch nicht in Berlin, sondern erst in Amerika. Cool ist es trotzdem, gerade weil auch lokale Suche integriert ist. Der GPS-Empfänger sagt der Applikation, wo man sich gerade befindet, und Google spuckt die China-Restaurants in der Nähe aus, so dass ich nicht mal wissen muss, in welchem Teil der Welt ich mich gerade befinde.

Ein Vorab-Video gibt es z.B. hier zu sehen. Die Applikation soll über den AppStore für das iPhone erhältlich sein.

23 Oktober 2008

Test: Dragon NaturallySpeaking Legal 10

Seit kurzem ist Dragon NaturallySpeaking Legal 10 erhältlich, und ich habe mir diese speziell für Juristen zugeschnittene Version über meine Dragon NaturallySpeaking Professional installiert. Bestehende Nutzer bleiben dabei erhalten. Daher habe ich jetzt die Möglichkeit, einige Unterschiede in diesen beiden Editionen mehr hervorzuheben:

Dragon NaturallySpeaking Legal ergänzt Dragon NaturallySpeaking Professional um ein juristisches Fachvokabular. Worin allerdings die Unterschiede zwischen den juristischen und dem allgemeinen Vokabular (das im Dragon NaturallySpeaking Legal ebenfalls enthalten ist) bestehen, darüber kursieren verschiedene Auskünfte. Der Hersteller gab vor Jahren einmal an, dass das juristische Vokabular im Verhältnis zum allgemeinen Vokabular um 80.000 Einträge erweitert worden sei. Dies kommt uns schon deswegen merkwürdig vor, weil der aktive Wortschatz eines Dragon NaturallySpeaking-Vokabulars in der Regel immer rund 150.000 Wörter beträgt - diese 80.000 Wörter können also allenfalls teilweise in den aktiven Wortschatz übergegangen sein. Dazu kam, dass der Hersteller bei der Markteinführung der analog positionierten Dragon NaturallySpeaking Medical Edition explizit keine Zahl nennen wollen, sondern darauf hingewiesen wurde, dass das Vokabular aus ganz anderem Material gewonnen wurde.

Dies ist auch bei Dragon NaturallySpeaking Legal der Fall. Daher möchte ich hier auf ein ganz wichtiges Konzept hinweisen, was vielen Anwendern gar nicht bewusst ist:

Das Sprachmodell.

Ein Sprachmodell enthält statistische Informationen über den Gebrauch bestimmter Wörter und Ausdrücke in einem bestimmten Kontext, ihre Häufigkeit und Wahrscheinlichkeit. Da Spracherkennung letztlich ein statistisches Verfahren ist, bei dem die Software jedes Mal rät, welches Wort wohl am wahrscheinlichsten dem Geräusch entspricht, welches durch das Mikrofon aufgenommen wurde, hat das Sprachmodell eine immense Bedeutung für die Genauigkeit der Spracherkennung.

Bei meinen ersten Diktaten mit Dragon NaturallySpeaking Legal zeigte sich genau dies: alltägliche Wörter und Wortverbindungen wurden häufig nicht erkannt zu Gunsten von juristischen Fachausdrücken, die ganz ähnlich klangen. Dies ist kein Mangel der Software, sondern ein Vorteil: das juristische Vokabular erwartet juristisches Diktat, kein allgemeines.

Und hier zeigt sich auch der Vorteil der Legal-Version für Rechtsanwälte, die oftmals meinen, die paar Fachausdrücke auch selbst zum Wortschatz hinzufügen zu können:

Das Legal-Sprachmodell gibt den professionellen Sprachgebrauch eines Juristen wesentlich genauer wieder als das allgemeine Sprachmodell. Es geht nicht nur um das Lernen einiger Ausdrücke, sondern um eine ganze Fachsprache mit ihren spezifischen Wendungen, die Dragon NaturallySpeaking Legal neben dem allgemeinen deutschen Sprachgebrauch beherrscht, andere Editionen aber nicht.

Einige andere Dinge kommen hinzu: so formatiert Dragon NaturallySpeaking Legal Ausdrücke wie "§ 32 Abs. 4 S. 2" (zumindest in der Theorie) korrekt; Aufzählungen mit "1., 2., 3." werden direkt mit Zahlen geschrieben, Gesetzesfundstellen werden im entsprechenden Kontext korrekt abgekürzt, und was dergleichen mehr Eigenheiten sind, die ein juristischer Schriftsatz wesentlich häufiger braucht als, sagen wir, eine durchschnittliche geschäftliche E-Mail.

Fazit: Juristen profitieren von Dragon NaturallySpeaking Legal, weil das Sprachmodell wesentlich genauer auf ihre spezifischen Bedürfnisse zugeschnitten ist und daher sehr viel schneller und ohne Modifikationen eine gute Erkennungsgenauigkeit erreicht werden kann. Bei den durchschnittlichen Stundensätzen eines Juristen dürfte sich damit die Investition recht schnell bezahlt machen.

Hier noch die Adresse eines Berliner Spezialisten für juristische Wortschätze:
www.cs-spracherkennung.de

22 Oktober 2008

Testbericht: Grundig Digta Cordex

Seit einer Woche ziert das Grundig Digta Cordex meinen Schreibtisch, ein - Grundig sagt: das 1. - schnurloses Mikrofon zum digitalen Diktat und für Spracherkennung. Mikrofon und Ladestation machen optisch einen sehr ansprechenden Eindruck, das Mikrofon liegt auch gut in der Hand, der Schiebeschalter wurde noch einmal gegenüber dem anderen Grundig-Mikrofone verbreitert und lässt sich sehr gut bedienen. 3 Funktionstasten oberhalb des Schalters sind sehr gut zu erreichen, die anderen 3 Funktionstasten liegen zu weit unten, als dass man sie ohne Umgrifen erreichen könnte. Das Gewicht des Geräts und die Größe sind sehr angenehm, so dass ein Diktat auch über einen längeren Zeitraum hinweg den Sprecher nicht belastet.

Die Bedienung der mitgelieferten digitalen Diktatsoftware ist sehr logisch gestaltet und kann komplett über das Mikrofon erfolgen. Interessant ist die Lösung, den Schiebeschalter zur Auswahl in den Software-Menüs zu verwenden.

Auch für Spracherkennung ist das CordEx sehr gut geeignet. Es gilt hier wie bei jedem Handmikrophon die Einschränkung, dass man genau in das Mikrofon sprechen muss, um eine optimale Erkennungsgenauigkeit zu erzielen, diese ist dann aber wirklich sehr gut.

Das Gerät wird mit einem Akku geliefert, der in der Ladestation geladen wird. Leider muss sie dazu mit dem Netz verbunden werden; ein Laden allein über den USB-Anschluss des Computers ist nicht möglich.

Das Digta Cordex lässt sich auch mit mehreren Ladestationen verbinden, so dass ein Wechsel zum Beispiel von einem Behandlungszimmer z.B. in einer Arztpraxis möglich ist. Ganz ohne Umstände gilt dies allerdings nicht ab.

Vorbildlich ist dafür die Behandlung, wenn man sich mit dem Gerät einmal zu weit vom Computer entfernt: Das Gerät ist mit einem internen Speicher für bis zu 1 Minute Diktat ausgestattet, so dass man auch bei vorübergehender Verbindungsunterbrechung zum Rechner Diktate aufnehmen kann. Wenn also die Verbindung einmal abbricht, kann man ohne Angst vor Verlusten weiter diktieren; sobald das Mikrofon sich wieder mit dem Computer verbindet, wird das Diktat übertragen. Dies funktioniert auch wunderbar mit Spracherkennung. Man kann dann zu sehen, wie sie vor 1 min gesprochenen Wörter Schritt für Schritt am Bildschirm transferiert werden.

Eine Einschränkung im Betrieb mit Spracherkennung ist eigentlich keine: Dragon NaturallySpeaking macht es nicht ohne weiteres möglich, die Spracherkennung über das Mikrofon ein- und auszuschalten (mit einer Zusatzsoftware wie der 4voice Local geht das aber). Jedoch kann man die Spracherkennung einmal ausschalten und dann den Schiebeschalter dazu verwenden, das Mikrofon stumm zu schalten - Dragon hört dann zwar noch weiter zu, es kommt aber kein Signal an, was außerdem zur Folge hat, dass nach einer längeren Diktierpause die Spracherkennung wesentlich schneller reagiert als wenn sie abgeschaltet ist.

Es bleibt abzuwarten, wie die Akzeptanz des Grundig Digta Cordex sein wird: mit einem empfohlenen Verkaufspreis von 499 € empfiehlt es sich eher für den gehobenen Geschmack. Die ersten Exemplare sollen demnächst an Händler ausgeliefert werden.

17 Oktober 2008

Test: Plantronics Callisto Bluetooth-Headset

Gerne würde ich an dieser Stelle Erfreuliches über das Plantronics Calisto-Headset berichten, welches in Dragon NaturallySpeaking 10 Wireless Edition mitgeliefert wird. Ein solches Gerät habe ich seit zwei Wochen zum Test; vorher hatte mein Kollege es bereits - und uns fiel beiden dasselbe auf:

Wenn es uns gelingt, das Gerät anzuschließen, erkennt es recht ordentlich. Die Schwierigkeit besteht aber im Anschließen des Geräts.

Hier bestätigt sich meine alte Bluetooth-Phobie: es ist mir niemals gelungen, ein Bluetoothgerät dauerhaft und problemlos mit einem PC zu verbinden. Diese Geschichte zieht sich seit Jahren durch meine Erfahrungen - schon das erste spracherkennungstaugliche Bluetooth-Headset, dass Sony HBH-300, ließ sich zwar verwenden, gab auch eine sehr gute Erkennungsqualität, musste aber jeden Morgen aufs neue mit dem Rechner gepaart werden. Mit anderen Headsets wie dem Parrott Bluetooth-Headset habe ich ebenfalls qualitativ gute Erfahrungen gemacht, es aber niemals dauerhaft mit dem Rechner verbinden können. Mit einer Bluetooth-Maus was übrigens auch nicht anders - entweder es liegt an mir oder einem Bluetooth-Standard, aber wir beiden passen einfach nicht zusammen :-)

Auch bei den Calisto-Headset habe ich nach dem dritten oder vierten Versuch aufgegeben. Zwischenzeitlich war es mir gelungen, eine Verbindung herzustellen und zu diktieren, und es zeigte sich, dass das Diktat gut erkannt wurde, sofern ich das Headset als neu Diktierquelle eingerichtet hatte, das heißt also ein Kurztraining von 7 min Dauer durchgeführt hatte (wird in ein anderes Profil diktiert, dass nicht speziell auf dieses Headset zugeschnitten ist ist die Erkennungsgenauigkeit unter aller Kritik).

Ob es an mir oder am Gerät liegt - wer es zum Laufen bekommt, wird sicherlich damit glücklich werden, ich fühle mich in meinem Urteil bestätigt und werde weiterhin andere schnurlose Alternativen bevorzugen, wie zum Beispiel das Plantronics CS 60, das Jabra GN 9350 oder das neue Grundig Digta Cordex-Handmikrophon (Test folgt in Bälde).

Ein Hoch dem Nuance-Support!

Gestern hatte ich zum ersten Mal das Vergnügen, mit dem Nuance-Kundensupport zu sprechen. (Für Uneingeweihte: als Händler hat man einen eigenen Support, der als erstes die Dragon.log-Datei anfordert, um diese dann umgehend ad acta zu legen - daher der Wert der Foren, Distributoren und inoffizieller Quellen).

Problem: Bei einem Upgrade auf Dragon NaturallySpeaking 10 von 9 wollte die Installationsroutine einen "Security Key" zur Aktivierung haben. Gab es diesen nicht, so wurde die gesamte Installation rückgängig gemacht. Die Aktivierung wird normalerweise nach dem 1. Programmstart vorgenommen, so dass ich zuerst die Anforderung ignorierte - und dies mit drei Stunden fruchtloser Installationsversuche bezahlen musste.

Ein Anruf beim Kundensupport brachte unerwarteterweise des Rätsels Lösung: Während der Installation generiert Dragon einen Hardware-Key, aus dem dann mit der Seriennummer zusammen der Security Key generiert wird, welcher wiederum, bei der Aktivierung an Nuance übertragen wird. Dieser Hardware-Key war fehlerhaft. Dies war der freundlichen Dame in dem Moment klar, wo ich ihr den Key angab, und sie generierte auf der Stelle einen Security Key, mit dem ich problemlos die Installation abschließen konnte.

Fazit: Sollte während der Installation ein Security Key angefordert werden, 069 51 70 93 63 anrufen - hier werden Sie geholfen.

Übrigens auch zu loben: die Qualität der Computerstimme in der Warteschleife. Da hat Nuance Beachtliches geleistet - nur Dragon hat immer noch die viele Jahre alte "Vera", die einem Text vorquäkt.

02 Oktober 2008

Nuance übernimmt die Spracherkennungssparte von Philips

Nuance übernimmt die Spracherkennungssparte von Philips und will damit das Geschäft im Medizinmarkt vergrößern.

In Deutschland ist Philips mit SpeechMagic, vertreten u.a. durch die Firma Kuhlmann, der stärkste Mitbewerber von Nuance. In anderen Ländern tritt Nuance gar nicht an, weil Dragon in der Landessprache nicht verfügbar ist. Wenn Nuance Philips Speech Recognition jetzt übernimmt, sind sie auch in diesem Gebiet der Platzhirsch.

Ob beide Produktlinien weitergeführt werden, eine mit der Zeit verschwinden wird oder sich in die andere integriert, wird sich zeigen. Dragon ist eher auf den Consumer-Markt ausgerichtet und im Vergleich zu SpeechMagic wenig spezialisiert. Von daher ist für beide Produkte Platz.

Ich erinnere an zwei andere Übernahmen in den letzten Jahren. IBM Via Voice wurde nach der Übernahme in den Nuance-Vertrieb ausgehungert. Der Erwerb von Dictaphone und die anschließende Einführung des Powerscribe-Workflow in Deutschland waren nicht wirklich erfolgreich; Dragon und seine Fachhändler haben dies ganz gut überstanden. Hier hat es also der Markt, d.h. die fehlende Akzeptanz geregelt.

Welche Strategie Nuance mit dieser doch sehr spektakulären Übernahme weiter fahren wird, ist noch nicht bekannt. Bis auf weiteres soll sich für die Dragon-Händler nichts ändern - warten wir's ab. Im Moment ist es noch zu früh, etwas zu sagen.

27 September 2008

FAQ: Audio-Assistent von Dragon NaturallySpeaking

Frage: Kennen Sie eine Lösung für die wiederholte Aufforderung, beim Wechsel der Headsets (USB, Kabel etc.) die Lautstärke- und Qualitätsprüfung von Dragon NaturallySpeaking immer wieder neu vornehmen zu müssen?


Antwort: Der Audio-Assistent prüft die Lautstärke des Sprachsignals und die Nebengeräusche beim Diktieren, legt also die akustischen Rahmenbedingungen für die Spracherkennung fest. Deshalb lässt er sich auch nicht abschalten oder umgehen.

Es ist aus diesen Gründen sinnvoll, den Audio-Assistenten beim Wechsel des Eingabegerätes immer wieder laufen zu lassen: zum einen haben verschiedene Geräte verschiedene Audio-Eoigenschaften, die für die Qualität der Spracherkennung nötig sind. Zum anderen verändert sich während des Diktierens auch die Stimme, so dass der Audio-Assistent Dragon dabei hilft, wieder optimal zu erkennen. Daher sollten Sie den Audio-Assistent regelmäßig, zumindest aber beim Wechsel des Eingabegerätes ausführen - besser eine Minute lesen als viele Fehler zu korrigieren.

23 September 2008

FAZ-Testbericht über Dragon NaturallySpeaking 10

In der FAZ vom heutigen Dienstag, 23. September 2008, wird endlich der Testbericht von Michael Spehr über das neue Dragon NaturallySpeaking 10 abgedruckt. Mit gewohnter Sorgfalt wird die Erkennungsgenauigkeit gegenüber der Vorversion getestet und tatsächlich als besser erkannt, werden die Neuerungen aufgelistet und auch die immer noch vorhandenen Lücken und Fehler genannt.

Einige kleine Ergänzungen möchte ich vornehmen: es wird das längst überfällige neue Merkmale erwähnt, dass man Datumsangaben und Zahlen Formatierungen jetzt einstellen kann. Leider ist dabei ein kleiner Fehler unterlaufen - ich habe nicht die Möglichkeit, frei zu definieren, ab welcher Zahl Zahlen nur noch als Ziffern geschrieben werden sollen. Auch die Vorgehensweise, einen bereits trainierten Sprecher einfach in die neue Version zu übernehmen und ein Upgrade zu machen, ist ein wenig fragwürdig, auch wenn es im vorliegenden Fall zu einem guten Ergebnis geführt hat - nach meinen Erfahrungen kommen beim Upgrade gerne einmal Fehler in das Vokabular, davon abgesehen, dass ein alter Sprecher die neuen Möglichkeiten der Software nie ganz ausnutzen kann.

Abgesehen von diesen kleinen Anmerkungen allerdings wirklich ein sehr guter und kompetenter Artikel, der den aktuellen Stand in der Spracherkennung objektiv wiedergibt. Wer ihn bei mir bestellen will, sende bitte eine E-Mail an meine Adresse: Stephan [@] soldatkuepper.de.

17 September 2008

Spracherkennung für Interviews

In der FAZ vom 16. September 2008 stellt Michael Spehr die Möglichkeiten vor, Spracherkennung für die Transkription von Interviews zu nutzen. Sein Fazit: derzeit ist Spracherkennung noch nicht reif dafür.

Gründe sind dafür vor allen Dingen die meist schlechte Qualität der Sprache, dann aber auch die Tatsache, dass ein Sprecherprofil für jeden Sprecher angelegt werden muss, damit die Sprache adäquat verschriftlicht werden kann.

Als Alternativen schlägt er ein "Echo-Diktat" vor, das heißt also das gleichzeitige Abhören und Nachsprechen des Interviews durch einen geschulten Diktanten. Dies erfordert allerdings sehr große Übung unter hoher Konzentration. Hier wendet man sich am besten an Profis. So gibt es inzwischen das Berufsbild des Schriftdolmetschers, der mithilfe von Spracherkennung das gesprochene Wort nahezu in echt zeit in geschriebenen Text umsetzen kann - wobei allerdings entsprechendes Training vorausgesetzt wird. Weitere Informationen dazu unter www.kombia.de.

Wer den Artikel verpasst hat und per E-Mail von mir erhalten möchte, melde sich bitte unter stephan [at] soldatkuepper.de!

Zum Thema Sprecherprofil übrigens noch die Anmerkung, dass inzwischen Dragon NaturallySpeaking mit einem komplett untrainierten Sprecher, für den bloß das anfängliche Ritual zum Einstellen des Mikrofons absolviert wurde, hervorragende Ergebnisse erzielt - und das unabhängig davon, ob ein Mann oder eine Frau das Mikrofon eingepegelt hat. Vielleicht wäre dies noch einmal einen Versuch wert?

12 September 2008

Dragon NaturallySpeaking 10 - erste Erfahrungen

Inzwischen habe ich Dragon NaturallySpeaking 10 Professional auf zwei Rechnern installiert und kann erste Erfahrungen mitteilen.

1. Installation:
Die Installation ging auf einem sauberen Rechner und als Upgrade gleichermaßen glatt, sofern man die setup.exe startet - DNS 10 erwartet eine Visual C++-Runtime, die der MSI-Installer nicht it installiert, die Setup.exe aber schon.
Das Upgrade der Sprecher schlug fehl, aber wohl deshalb, weil der eine ein 4voice (d.h. geschütztes) Vokabular hatte, das DNS allein nicht lesen kann. Bei den Rechnern handelt es sich zum einen um ein Notebook mit Windows XP Pro, Intel CoreDuo T2500 mit 2 GHz, 1 GB RAM; der andere ein Desktop PC mit Windows Vista, 2 GB RAM, AMD Sempron 3400+, 1,8 GHz,

Bei der benuterdefinierten Installation lassen sich jetzt Format- und allgemeine Optionen getrennt einstellen; die Komposita können schon hier abgewählt werden. Außerdem ist die umstrittene Datensammlung mit dabei, kann aber ebenfalls ausgeschaltet werden.

2. Erkennungsgenauigkeit:
Für einen ersten Vergleich zwischen der alten und neuen Version habe ich einfach zwei Mikrofone benutzt, eines (Olympus DR-1000) am Windows XP-Rechner, auf dem zu diesem Zeitpunkt noch Dragon 9.5 installiert war, das andere (VXI Parrott TalkPro-Headset) am Vista-Rechner mit DNS 10 angeschlossen. Den DNS 9-Benutzer habe ich seit Juni im täglichen Einsatz, der DNS 10-Nutzer war völlig neu angelegt.

Die Ergebnisse unterschieden sich zwar in den konkreten Fehlern, numerisch ist das Ergebnis gleich: jeweils 8 Fehler auf 671 Wörter. Nicht gewertet wurde die Zahlenformatierung (s.u.), in der DNS 10 klar die Nase vorn hat. Interessant ist, dass DNS 10 seinen Namen nicht erkennt: "Dragon NaturallySpeaking" wurde bei jedem Vorkommen anders geschrieben (was strenggenommen die Fehlerquote auf 14 erhöht hätte, doch habe ich das Wort nur einmal gewertet).

Bei diesem Test sprach ich bewusst deutlich. Bei undeutlicher Aussprache - wie sie sich im Laufe des Tages immer mehr einschleicht - kann ich noch keine genauen Aussagen treffen. Nach den Ergebnissen, die ich gestern Abend zwischen 21 und 22:00 Uhr hatte, scheint aber auch hier die Erkennung besser zu verlaufen. Eine gute Nachricht für alle Praktiker, die viel diktieren müssen, auch wenn sie müde sind, und bisher dafür mit schlechterer Erkennungsgenauigkeit bestraft wurden.

3. Systemressourcen:

Unter Windows Vista ließ sich DNS 10 mühelos installieren, meldete aber die Deaktivierung der natürlichen Sprachbefehle für Word und Excel aus Speichergründen. Offensichtlich ist diese Kombination also für Dragon 10 schon schwach. Die Erkennung lief allerdings flüssig und vom Tempo ähnlich wie auf dem XP-Notebook mit DNS 9.5.

Die eigentliche Überraschung: Die Installation auf dem XP-Notebook lief ohne Warnung vor mangelnden Ressourcen, und die Erkennung verläuft tatsächlich flüssiger als mit DNS 9.5! Offensichtlich ist Vista schuld, denn Michael Spehr berichtete mir dasselbe.

Überhaupt scheint die Spracherkennung nach allem, was man hört, wesentlich flüssiger zu verlaufen - auch aus anderen Ecken vermeldet man das gleiche. Schön, dass sich die Befürchtungen hier einmal nicht bewahrheitet haben - bisher hat Dragon NaturallySpeaking in jeder Version das System immer stärker in Anspruch genommen. im Task Manager belegt Dragon NaturallySpeaking jetzt allerdings ungefähr 200.000 KB Speicher, vorher waren es 140.000 KB.

4. Zahlen:
Fast alles, was uns geärgert hat, ist verschwunden: eine 53 jährige Patientin geht in beiden, aber eine drei bis 4 m lange Bremsspur, eine fünf bis 6 cm große Narbe oder gar ein 7 x 8 cm großes Bild wird von DNS 9.5 wie angezeigt geschrieben, von DNS 10 in allen Fällen korrekt. Auch das Datum scheint besser zu sein, mit Ausnahme des 23. EIne Folge von Ziffern wird korrekt geschrieben, also 089244104445 statt null acht neun zwei vier vier eins null vier vier vier fünf. Paragraph drei, Abs. 4, [Ziffer] 5 ist komplett identisch. Ein Fehler macht sich allerdings bei Maßeinheiten bemerkbar - im Kochrezept werden drei Eier, 4 g Mehl, 5 l Wasser (nein, Sie brauchen das nicht essen) als drei Eier ,4 g Mehl ,5 l Wasser geschrieben, das Komma also falsch gesetzt.

5. Neuigkeiten:
Alle Neuheiten habe ich noch gar nicht ausprobiert und kann sie daher auch nicht vermelden. Was wirklich Spaß macht, ist die Möglichkeit, mit einem einzigen Befehl ein Wort oder mehrere Wörter zu formatieren oder zu löschen. Man sagt in Microsoft Word zum Beispiel "fett Dragon NaturallySpeaking", und der Ausdruck wird sofort fett gesetzt. Analog funktioniert auch "lösche Dragon NaturallySpeaking", was eine Funktion ist, die schon von vielen Benutzern angefragt wurde - zumindest haben viele Leute, die ich trainiert habe, intuitiv versucht, mit diesem Befehl ein Wort zu löschen, und waren sehr enttäuscht, als es nicht ging.

Weitere Ergebnisse in Bälde!

Anwenderstimmen DNS 10 Wireless / Plantronics Calisto Headset

Dragon NaturallySpeaking Preferred Wireless Edition wird seit neuestem mit einem Plantronics Calisto-Headset geliefert, das nach Aussagen des Herstellers optimiert für Spracherkennung wurde. Da dieses Gerät bisher nur in den USA lieferbar war, liegen in Deutschland keine Erfahrungen vor, wie gut es tatsächlich ist. Ich erhalte in den nächsten Tagen ein Gerät zum Test, damit ich dazu etwas Fundiertes sagen kann, bisher sind die Anwenderberichte gemischt. In der Firma wurde das Gerät zum Beispiel positiv getestet, allerdings nicht von mir ;-)

Dieser Anwenderbericht steht in der Yahoo-Usergroup für Dragon NaturallySpeaking zu lesen:

Die Erkennungsgenauigkeit unter Calisto ist sehr eingeschränkt. Die Wiedergabe wird begleitet von einem unangenehmen Hintergrundgeräusch inklusive Knattern und Rauschen.
Die Software wurde auf zwei neuen Rechnern (Vista/XP) mit den jeweils gleich schlechten Resultaten, (Erkennungsgenauigkeit 15), getestet.
Bei Plantronics sagte man mir, dass der Support in Deutschland abgelehnt wird, weil es absehbar war, das die Bluetooth Übertragung wesentlich schlechter wäre als der DECT Standard des CS 60.
Nuance in Edinburgh will aber kein CS 60 als Ersatz anbieten. Das defekte Gerät habe ich mittlerweile eingeschickt.
Zu Dragon 10 ist generell zu sagen, dass es flüssiger läuft, als die
Vorgängerversion 9.5.

Hier scheint ein Defekt am Gerät vorzulegen, der für die genannten Probleme sorgt.

Ein Händler bestätigt, dass er zu diesem Headset sehr unterschiedliche Reaktionen gehabt hat. Von der Distribution weiß ich, dass die professionellen Versionen nach wie vor mit einem Plantronics CS 60 gebündelt werden - was aber auch damit zusammenhängt, dass zum Beispiel in einem Krankenhaus ein Bluetooth-Headset in aller Regel gar nicht installiert werden kann.

Der Vollständigkeit halber sei aber auch gesagt, dass die Zahl, die im Audioassistenten von Dragon NaturallySpeaking erreicht wird, nicht unbedingt etwas über die Erkennungsgenauigkeit aussagt. Ein Bluetooth-Headset erreicht hier schon allein deswegen einen niedrigeren Wert, weil hohe Frequenzen erst gar nicht übertragen werden - dafür ist der Bluetooth-Standard nämlich nicht ausgelegt. In der Praxis muss sich das übrigens gar nicht in einer schlechteren Erkennungsgenauigkeit niederschlagen, wie andere Erfahrungen von Anwendern mit Bluetooth-Headsets belegen. Hier wie überall gilt, das der Diktierstil einen wesentlich größeren Einfluss auf das Ergebnis hat als das Mikrofon.

Ich würde gern weitere Stimmen speziell zu diesem Headset hören. Wer hat es getestet? Schreibt!

Ich diktiere Teile dieses Beitrags übrigens mit dem neuen Dragon NaturallySpeaking 10 und einem Olympus-Handmikrophon und kann bestätigen, dass das Diktat tatsächlich sehr viel flüssiger läuft. Außerdem erkennt die Spracherkennung jetzt endlich das Wort "Bluetooth". Ist das ein Grund für ein Upgrade?

10 September 2008

Peinlicher Spracherkennungsfehler

Peinliche Panne für Augsburger Staatsanwalt ging es durch die Schlagzeilen, als ein Augsburger Staatsanwalt einen Angeklagten als "A****loch" titulierte; - der Herr entschuldigt sich damit, er benutze Spracherkennung, habe sogar Korrektur gelesen, aber dann die unkorrigierte Version des Dokuments verschickt.

Was lehrt uns das?

1. Korrektur muss immer sein, übrigens auch bei getippten, handschriftlichen und sonstwie produzierten Dokumenten.
2. Sorgfältiges Arbeiten hat seine Vorteile.
3. Dragon kennt auch die schlimmen Wörter - übrigens auch in V. 10, ich hab nachgeschaut...

Es soll Händler geben, die in ihren Wortschätzen diese Wörter löschen.

03 September 2008

Ich bin Feuerwehrmann geworden (Werbung für die andere Dragon-Informationsquelle)

Das beste Forum zu Dragon NaturallySpeaking im deutschsprachigen Raum wird von Willy Sander angeboten. Eine Besonderheit ist es, dass alle "kleinen Drachen", also alle Forumsteilnehmer, eingedenk einer beliebten Fernsehserie für Kinder zuerst als Grisu angemeldet werden - so auch ich. Seit langem schrieb ich in diesem Forum und rief nach jedem Beitrag wie Grisu: "ich will Feuerwehrmann werden!" Seit heute bin ich es - nach dem 50. Beitrag wird man befördert.

[Edit]: Ich erwähne dies nicht aus reiner Eitelkeit, sondern weil der Foren-Thread zum Thema "wie diktiere ich CO2 so, dass die Zahl tiefergestellt wird" läuft und daher vielleicht für manche Leser interessant ist. Wir haben inzwischen einen guten Ansatz gefunden, mit dem sich zumindest in Word das Problem umgehen lässt, dass Dragon keine Indizes und tiefergestellten Ziffern schreiben will. Zu den Ergebnissen verweise ich an das Forum; die Befehle versende ich gern auf Anfrage direkt.

Und jetzt habe ich hoffentlich noch ganz viel Zeit, um mich endlich Dragon NaturallySpeaking 10 widmen zu können. Erste Erfahrungen demnächst hier!

26 August 2008

Dragon 10-Kaffeesatzleserei

Ein paar Neuerungen von Dragon 10 habe ich letztens schon genannt; eine Menge steht in den Werbemails, die Nuance im Moment verschickt - aber was brigts tatsächlich auf dem Feld der Erkennung?

Die angekündigte, um 20% verbesserte Erkennungsgenauigkeit geht wirklich an die Grenze des Wahrnehmbaren: wo DNS 9 10 Fehler macht, macht DNS 10 nur noch 8. Ob das so viel ausmacht? "Da aber schon Dragon 9 im IDealfall nur eines von hundert Wörtern missverstand, ist dies nicht sehr brisant" - schreibt Dorothee Wiegand in der aktuellen c´t, weiß darüber hinaus aber auch noch nichts Neues.

Für mich wäre viel spannender zu erfahrten, wie die neue Version mit undeutlicher Aussprache und Dialekten umgeht. Da gab es schon mal einen Sprung, als - man höre und staune - die Erkennungsgenauigkeit weiblicher Stimmen an die der Männer angeglichen wurde (war das in DNS 8?) Bei mir hat sich ein Kunde allen Ernstes darüber beschwert, dass Dragon am Abend schlechter erkenne als am Morgen - ob denn die Software müde würde? An ihm konnte es ja nicht liegen. Für mich werden aber genau hier die Schlachten der Zukunft geschlagen, und zumindest bei Nuance Deutschland ist man sich dessen bewusst. Auch das heißt aber nichts, bis das mal nach USA dringt...

Zum Thema Hardware, um Missverständnisse zu vermeiden: Die Mindestanforderungen sind nicht gestiegen, die empfohlenen Ressourcen haben sich mal eben verdoppelt. Wer daraus ableitet, DNS 10 habe keine höheren Systemansprüche als die Vorversion, beschönigt da wohl etwas. Wie es im Vergleich zu DNS 9 auf demselben Rechner aussieht, muss ich aber auch erst noch testen - mein Urlaub ist noch nicht vorbei, außerdem ist DNS 10 noch gar nicht erhältlich...

Stay tuned!

24 August 2008

Nuance und 4voice statten die nordrhein-westfälische Justiz aus

Nuance Pressemitteilungen Sind mir normalerweise keine Hinweise wert, in diesem Falle aber schon, weil hier eine Geschichte zum vorläufigen Abschluss kommt, die bereits seit meinem Eintritt bei der 4voice AG vor sich hin geköchelt hat: die Ausschreibung für die Justiz in Nordrhein-Westfalen. Eine Ausschreibung, die angefochten wurde, ein neues Ergebnis, die Auslieferung, Produkte, die nicht abgenommen worden und wieder zurückgegeben wurden - die Geschichte nahm kein Ende, und so ist es schon mit einer gewissen persönlichen Genugtuung verbunden, wenn Nordrhein-Westfalen sich jetzt doch wieder für den Anbieter entscheidet, der schon am Anfang eigentlich den Zuschlag erhalten sollte.

Soviel Stolz muss sein :-)

"Wie können sie jetzt Urlaub machen?" - weil doch DNS 10 da ist

"Wie können sie jetzt Urlaub machen?" - fragt mich einer meiner treuesten Leser und verweist auf die durch alle Newsticker gehende Agenturmeldung, dass Dragon NaturallySpeaking 10 jetzt erscheint.

Dabei ist noch gar nicht klar, wann es tatsächlich in die Läden kommt - nach meiner Information beginnt die Auslieferung Ende August. Nuance hat gar selbst noch die Version 9 auf der Website angekündigt.

Alles Neue habe ich aber schon vor meinem Urlaub onlinebestellkompatibel angekündigt. Wer also meine detaillierten Beschreibungen von Dragon NaturallySpeaking 10 lesen will, folge dem Link.

Der Fairness halber sei nicht unerwähnt, dass ich auch noch keine Vollversion 10 habe und mich daher auf Betas und Vorführungen verlassen muss, außerdem auf die Produktankündigungen des Herstellers.

Was auf jeden Fall cool wird, ist die Möglichkeit, in Befehle Variablen einzubauen, die nicht aus einer Liste stammen, sondern quasi frei sagbar sind. Dem Endanwender wird das v.a. an den Funktionen auffallen, die mit großem Aufwand angekündigt werden - der Möglichkeit, mit einem einzigen Sprachbefehl im Web zu suchen ("suche nach China-Restaurant in Berlin-Mitte"), und der Möglichkeit, ein Wort ohne vorheriges Markieren sofort zu formatieren ("schreib Dragon fett"). Dahinter steckt eine neue Technologie, die Variablen in Befehlen zulässt, welche nach Bedarf "gefüllt" werden können. Solche Variablen sollen demnächst auch in anderen Sprachbefehlen möglich sein, sicher weiß ich es von Textbausteinen, in denen man also beispielsweise einen kompletten Brief ablegen kann, bei der man bloß die Anrede als Variable markiert und dann per Sprache anspringt. Ob auch Skript-Befehle auf diese Weise möglich sein werden, wird sich zeigen - hier tun sich ungeahnte Möglichkeiten auf.

Gespannt bin ich darauf, welche Fehler und Ärgernisse der Version neun in Dragon NaturallySpeaking 10 ausgebügelt werden. Z.B. wird es möglich sein, einzustellen, welche Zahlen als Ziffer geschrieben werden sollen und welche nicht, so dass das lästige Formatieren im Vokabular oder aber korrigieren von Hand im Text oder der Befehl "schreib das als Zahl" weitestgehend der Vergangenheit angehören dürften. Wer, wie ein Arzt, eigentlich alle Zahlen als Ziffern braucht, stellt das einfach über ein Menü ein und fertig. Wie gut dann aber die Erkennungsgenauigkeit ist, muss auch die Praxis zeigen. Von der Beta-Version weiß ich, dass es hier noch Potenzial nach oben gab.

Andere Kleinigkeiten fallen mir kaum mehr auf, z.B. dass der Befehl "zum Absatzende" stillschweigend verschwunden ist. Vielleicht taucht er ja in der neuen Version wieder auf?

Stutzig machen mich die Systemvoraussetzungen, die mal wieder das Potential aktueller Hardware voll ausschöpfen (will sagen: auf älteren Rechnern die Grenze der Leistungsfähigkeit erreichen). Auch vor dem Hintergrund, dass Nuance die Spracherkennungstechnologie von Dragon NaturallySpeaking demnächst für Handys zur Verfügung stellen möchte, erscheint mir das nicht unbedingt zielführend. Ich bin sowieso gespannt, wohin diese Entwicklung noch geht - die Endgeräte werden immer leichter, Anwendungen werden im Netz zur Verfügung gestellt, aber meine Spracherkennung braucht (teilweise als letzte Anwendung) einen richtig leistungsstarken Prozessor und jede Menge Arbeitsspeicher. Hier bin ich sehr auf die nächsten Entwicklungen gespannt.

Das Kernstück, die Erkennungsgenauigkeit, kann ich natürlich ohne eine endgültige Version nicht beurteilen. Hier bin ich sehr gespannt, wenn mich das Paket erreicht, wie Dragon NaturallySpeaking 10 wohl im Vergleich zur Vorgängerversion abschneiden wird. Sie erfahren als erste davon - sobald ich aus dem Urlaub zurück bin!

08 August 2008

Ich bin dann mal weg.

When Your Computer Listens to You | New York Times Video

Mit diesem Beitrag verabschiede ich mich zunächst mal in den Urlaub - genau wie der freundliche Herr, der in dem Video zu sehen ist. Nur dass ich nicht nach Hawaii fliege, sondern nach Kreta. Das Video hat aber trotzdem alles mit dem Thema diese Blogs zu tun - aber das darf ich nicht sagen...

Ich melde mich dann bei Gelegenheit wieder mit meinen Netznotizen zu selbigem Thema!

05 August 2008

Linguatec kündigt neue Version seines Spracherkennungsprogramms Voice Pro an

Erster! Ich zitiere:

Der Münchner Sprachtechnologie-Experte Linguatec plant für Herbst 2008 die vollständig überarbeitete Neuauflage seines Spracherkennungsprogramms Voice Pro. Die Vorversion war 2004 Testsieger der Stiftung Warentest im Vergleich der Spracherkennungsprogramme.

Das Interesse an Spracherkennung ist immens. Kein Wunder – das Verfassen von Texten vielfältigster Art ist aus unserem beruflichen und privaten Alltag nicht wegzudenken, und wer würde nicht gerne „wie von Zauberhand“ schreiben können. Diktieren statt Tippen bedeutet eine spürbare Arbeitserleichterung und Entlastung für den Anwender. Auch Surfen und die Steuerung des Computers sind per Spracheingabe mühelos möglich.

Das Verblüffende an Spracherkennung ist die Geschwindigkeit, in der das Diktierte festgehalten wird. Nicht jeder kann von sich behaupten, so schnell zu tippen, wie er sprechen kann. Noch dazu sind beim Diktieren Rechtschreibfehler ausgeschlossen. In Kombination mit einer Erkennungsgenauigkeit von bis zu 99% bedeutet dies eine enorme Effizienzsteigerung für jede Schreibaufgabe.

Nach zwei Jahren intensiver Entwicklungsarbeit steht nun fest: Die neue Version der Spracherkennungssoftware Voice Pro kommt im Herbst auf den Markt. In einer engen Zusammenarbeit mit führenden Hochschulen in Deutschland, Österreich und der Schweiz wurde der Grundstock für eine neue Generation von Spracherkennung geschaffen. Besonderes Augenmerk legt die neue Version Voice Pro auf den Einsatz unter Windows Vista, eine deutlich verbesserte Erkennungsgenauigkeit und eine intuitive Bedienung.


Vista-Unterstützung war ja auch mal fällig, nicht wahr, Rike :-)

Ich bin gespannt, ob auch die Erkennungsmaschine mal überarbeitet wurde oder ob immer noch das alte ViaVoice vor sich hin werkelt. Ein Vorteil sind sicherlich die geringen Ansprüche, die die Software dann an den Rechner stellt. Wie es sich in der Praxis schlägt, werden wir nach Erscheinen feststellen.

Heute abend präsentiert Nuance in München übrigens auch neue Technologien. Obwohl in der Einladung von einem zehnfingrigen Drachen die Rede war, werde ich frühestens morgen erfahren, was es denn zu sehen gab und welche Wundertiere uns demnächst von dieser Seite ins Haus stehen, die dann bestimmt mächtig hungrig sind (nach GHz, RAM und so). Sicher weiß ich nur, dass ein sprachgesteuertes Auto zu sehen sein wird, weswegen das Event nicht im BMW-Tower stattfinden wird.

Test: Philips LFH 331 Ohrhörer-Mikrofon-Kombination

Ich habe mir testweise die Philips-Ohrhörer-Mikrophon-Kombination LFH 331 8zu sehen unter http://www.dictation.philips.com/index.php?id=53&CC=DE) für das digitale Diktiergerät DPM 9600 kommen lassen und gestern unter verschärften Bedingungen getestet - im doch recht starken Wind, an der Kreuzung Skalitzer Straße/Schlesische Straße in Berlin-Kreuzberg.

Vorgabe war festzustellen, ob das Gerät eine vernünftige Geräuschunterdrückung bietet.

Leider scheint es so zu sein, dass das Mikrophon keine spürbare Verbesserung bei der Aufnahme bringt. Dies mag am Wind liegen, der alles andere übertönt; aber auch was die Nebengeräusche durch Autos angeht, kann ich nicht wirklich eine qualitative Veränderung feststellen. Dies bezieht sich explizit auf die Spracherkennung eines aufgenommen Diktats, die Qualität des Diktats scheint mir subjektiv besser zu sein. Die Sprache selbst klingt klarer als durch das eingebaute Mikrophon des Diktiergerätes.

Das erste Fazit ist also, dass das Gerät durchaus dafür geeignet ist, in vertraulichen Situationen zu diktieren, in denen man nach Möglichkeit niemand mithören lassen will. Vor allem das abhören des Diktats geschieht für die Außenwelt geräuschlos; das Diktat selbst produziert natürlich immer noch gesprochene Sprache :-) Auch ein Diktat im Auto, bei dem ich die Hände weitgehend frei haben will, ist gut möglich; der Vorteil besteht halt darin, die Hände frei zu haben.

Um aber in einer lauten Umgebung Nebengeräusche herauszufiltern, würde ich ein anderes Gerät nehmen, also eines der Aufsteckmikrofone, die alle drei Anbieter im Programm haben.

So ist das eben - für jede Situation die passende Lösung. Leider nicht eine Lösung für alle Situationen...