24 Februar 2009

Linguatec Voice Pro 12 kommt!

Am 27.3.2009 ist der Erscheinungstermin für Linguatec Voice Pro 12. Bereits im letzten Sommer angekündingt, wird zur CeBIT eine Vorabversion vorgestellt; das Programm kommt dann Ende März in den Handel.

Voice Pro war bisher immer auf IBM ViaVoice-Basis. ViaVoice wird aber seit Jahren nicht mehr weiterentwickelt. So hat man sich entschieden, eine neue Technologie zugrundezulegen: die Spracherkennung, die Microsoft in Windows Vista einsetzt.

Damit ist linguatec der (meines Wissens) erste Hersteller, der aus dieser Technologie ein ganzes Produkt macht - mit (hoffentlich) verbesserter Korrekturfunktion, der Möglichkeit, Wörter, die gleich ausgesprochen werden, intelligent korrigieren zu können, verschiedenen Fachwortschätzen unter anderem für EDV, Medizin und Recht, Transkription von Diktaten von Diktiergerät, Export von Benutzerprofilen - die ganze Palette, die man heutzutage eigentlich von einer einigermaßen fortgeschrittenen Spracherkennung erwarten dürfte.

Es fehlt bisher noch die Möglichkeit, Befehle zu definieren, diese ist von Microsoft selbst aber für Deutsch auch noch gar nicht implementiert. In einem US-amerikanischen Windows ist es bereits möglich, eigene Befehle anzulegen, der Chefentwickler selbst teilte mir aber nicht, dass dies für andere Ausgaben noch nicht verwirklicht ist.

Preislich dürfte linguatec voice pro eine echte Alternative zu Dragon NaturallySpeaking sein, wenn dann die Erkennungsgenauigkeit ungefähr das hält, was die Ankündigungen versprechen. Insbesondere die Anwendungen für Ärzte und Rechtsanwälte sind mit circa 400 € um die Hälfte günstiger als vergleichbare Anwendungen mit Dragon NaturallySpeaking. Für den nicht spezialisierten Anwender gibt es eine Standard- und eine Premium-Version, die mit 69 € beziehungsweise 169 € preislich im selben Rahmen wie Dragon NaturallySpeaking liegen.

Es zeigt sich aber auch ein großes technisches Problem: dadurch, dass die Spracherkennung von Windows Vista eingesetzt wird, benötigt linguatec voice pro als Systemvoraussetzung Windows Vista oder das (für den Sommer angekündigt) Windows 7. Seit Erscheinen von Windows Vista habe ich noch bei keinem professionellen Kunden eine Installation unter diesem Betriebssystem gemacht. Windows 2000 ist im professionellen Umfeld bisher noch häufiger anzutreffen. Nach meinem Dafürhalten wird sich das mit Windows Vista auch nicht mehr ändern. Wer überlegt, auf ein neues Betriebssystem umzusteigen, wird stattdessen wahrscheinlich lieber auf das mit viel Vorschusslorbeeren bedachte Windows 7 warten, ein Umstand, der den Einsatz von linguatec voice pro im professionellen Umfeld in der nächsten Zeit deutlich behindern wird. Die restlichen Systemanforderungen sind so, dass ein Rechner mit Vista sie problemlos erfüllen dürfte.

Jedenfalls würde ich mich sehr darüber freuen, wenn ich die Spracherkennung mal testen könnte. Interessant dürfte auch werden, wie sie im Vergleich zur reinen Windows Vista-Spracherkennung abschneidet, was die Erkennungsgenauigkeit angeht. Hier hätte man dann jedenfalls eine Referenz, von der aus man zu dem Produkt raten könnte (Sie wissen nicht, ob es was für Sie ist? Probieren Sie es erstmal aus und setzen sie dann das Produkt obendrauf.) Der Mehrwert ergibt sich dann von ganz allein aus den verbesserten Anwendungsmöglichkeiten und Wortschätzen.

20 Februar 2009

Servicepack 1 für Dragon NaturallySpeaking

Seit vorgestern ist das Servicepack 1 für Dragon NaturallySpeaking 10 erhältlich. Registrierte Anwender können das herunter laden, indem sie unter "Hilfe - nach Software-Aktualisierungen suchen" klicken. Es wird dann im Internet danach gesucht und das Paket wird heruntergeladen. Bitte beachten Sie die Anweisungen des Herstellers zur Installation - dies hier ist ein Blog und kein Handbuch :-)

Einige ärgerliche Fehler sind behoben worden, andere sind immer noch da. Die Experten liefern sich schon wieder heiße Diskussionen (http://forum.oasa-speech.de/viewtopic.php?t=353), für den normalen Anwender haben sich jedoch zunächst einmal viele Dinge verbessert, von denen ich hier wenigstens die wichtigsten aufführen möchte:

- die Formatierung von Zahlen nach einem Komma ist verbessert worden, außerdem merkt Dragon NaturallySpeaking sich jetzt einigermaßen zuverlässig, ob Zahlen immer als Ziffern geschrieben werden sollen oder nur wenn sie größer als 10 beziehungsweise 100 sind (Menü "Formatierung")
- das gleiche gilt für Komposita: im Menü "Formatierung" kann ich den Haken vor Komposita wegnehmen, Dragon hört dann auf, ungefragt mehrere Wörter zu einem zusammenzuziehen
- hat man im Vokabular einer aus mehreren Wörtern bestehende Wortverbindung abgelegt, wird diese jetzt auch nach einem neuen Absatz korrekt geschrieben
- das Menü "Formatierung" wurde in einigen weiteren Punkten überarbeitet, so lassen sich wesentlich mehr Eigenschaften zuschalten und abschalten.

Gravierende Nachteile sind mir nach einem Tag Arbeit nicht aufgefallen, was - werden die Experten sagen - für mein oberflächliches Arbeiten sprechen mag, ich selber schmeichele mir aber damit, dass ich mich in meinen Gewohnheiten nicht von der großen Menge der Anwender unterscheide und daher guten Gewissens dazu raten kann, das Servicepack herunterzuladen. Auch wenn für spätere Ausgaben noch genug zu tun bleibt, sind doch etliche Fehler beseitigt worden, einige neue Optionen hinzugekommen, so dass sich die Installation wohl lohnen dürfte.

Vorsichtige Leser werden dennoch ein paar Tage abwarten, ob ich in der nächsten Woche eventuell doch noch über etwas stolpere... das Servicepack kann nämlich nicht deinstalliert werden, sondern erfordert eine komplette Deinstallation von Dragon NaturallySpeaking.

30 Januar 2009

Loquendo Spracherkennung für Russisch

Loquendo ASR (Automatic Speech Recognition) jetzt auch für Russisch erhältlich - mit Zielgruppe Auto, Navigationssysteme usw.

Loquendo kannte man bisher eher als Anbieter von text-to-speech-Systemen, doch auch Spracherkennung für einige Sprachen, darunter jetzt auch Russisch, ist im Portfolio. Die Features klingen nicht schlecht, u.a. die Fähigkleit, multiple Befehle nacheinander zu geben, ohne Pause dazwischen; Unabhängigkeit vom Sprecher, hohe resistenz gegenüber Nebengeräuschen (im Auto essentiell). Es soll auch PC-taugliche Anwendungen geben, aber das große Geld ist damit natürlich nicht zu verdienen.

Mein alter Traum einer Diktiersoftware für Russisch ist daher immer noch in weiter Ferne :-(

27 Januar 2009

SVOX kauft Sprachverarbeitungssparte der Siemens AG

Zur Meldung: SVOX kauft Sprachverarbeitungssparte der Siemens AG: Expansion in Spracherkennung und Sprachdialog

Bei dieser Akquisition geht es nicht um Diktat, sondern v.a. um Anwendungssteuerung im Auto und im Handy: beide Firmen haben hier schon längere Zeit kooperiert. SVOX, die sich bisher eher im Bereich Text-to-speech hervorgetan haben, hat damit jetzt eine Spracherkennungsengine und ist in der Entwicklung von Dialogsystemen unabhängiger.

26 Januar 2009

iX-Artikel: Sprach- und Texterkennung heute

In der Computerfachzeitschrift iX findet sich ein umfassender und technisch recht avancierter Artikel zum aktuellen Stand der Texterkennung (OCR) und Spracherkennung im Computer:

"Wer immer noch Texte oder Audiokassetten abtippt, mag dafür gute Gründe haben. Vielleicht kennt er aber auch einfach nur nicht die neuesten Programme zur Text- und Spracherkennung. iX hat sich einige Angebote näher angesehen."


Getestet werden im Bereich Spracherkennung Dragon NaturallySpeaking 10, Linguatec Voice Pro und MacDictate. Interessanterweise bescheinigt der Tester keinem Programm eine deutliche Überlegenheit in der Erkennungsleistung, von den Features her hat Dragon aber die Nase vorn. VoicePro steht immer noch bei V. 11 und ist daher noch nicht Vista-fähig, obwohl schon im Sommer das Upgrade angekündigt wurde. MacDictate ist laut Test inzwischen auf Deutsch erhältlich, die Website des deutschen Vertriebs weiß davon allerdings noch nichts.

Besonders interessant, weil auch für den (technisch einigermaßen gebildeten) Anwender verständlich, ist eine 2 Seiten lange Beschreibung dessen, welche technischen Grundlagen der Spracherkennung zugrundeliegen. Zeitschriften, die sich an den interessierten Laien wenden, sparen dies meist aus (auch weil die zugrundeliegende Mathematik das Abiturniveau deutlich überschreitet). Wer also wissen möchte, wie seine Spracherkennung unter der Haube funktioniert, sollte mal einen Blick in die Zeitschrift werfen.

Hier die Zusammenfassung der Heise-Redaktion.

18 Januar 2009

Spracherkennung mit dem Logitech ClearChat Wireless

Dennis Deutschmann bloggt zum Thema Spracherkennung mit dem Logitech ClearChat Wireless.

Wenn's stimmt, was er schreibt, nämlich dass das schnurlose Headset für 99€ empf. VK mit Spracherkennung auf dem Netbook eine sehr gute Erkennung liefert, werden sich Plantronics und GN Netcom, deren Headsets das dreifache kosten, noch umschauen.

Ich versuche mal, selbst so eins zum Test zu erhalten. Und ein Netbook hätte ich auch gern... seufz... mit Spracherkennung...

17 Januar 2009

Nuance entwickelt jetzt mit IBM zusammen

Der neuesten Pressemitteilung von Nuance zufolge kooperiert man jetzt mit dem (außer Microsoft) letzten verbliebenen Entwickler von Spracherkennung, nämlich mit IBM. Spracherkennungslösungen von IBM und Nuance sollen vor allen Dingen im Bereich Callcenter und Embedded vorangetrieben werden.

Seit IBM die Entwicklung von ViaVoice praktisch eingestellt hat, haben sie dort sich auf diese beiden Bereiche konzentriert. Auch Nuance ist in diesem Bereich recht stark vertreten. Eine Kooperation wird also zwei traditionsreiche Entwicklungslinien zusammenfügen.

ViaVoice befindet sich schon längst im Vertrieb von Nuance und wird dort seit Jahren erfolgreich totgeschwiegen. Das aber hier mit einer neuen Version zu rechnen ist, ist auch nach dieser Kooperationsvereinbarung höchst unwahrscheinlich. Nur das kleine gallische Dorf linguatec scheint hier noch irgendwas in Planung zu haben - aber diese Planungen sind auch schon ein halbes Jahr alt, ohne dass ich bisher ein Produkt gesehen hätte -?

07 Januar 2009

Select-and-say

Select-and-Say ist ein wesentliches Feature von Dragon NaturallySpeaking, das im Wesentlichen bedeutet, dass jedes auf dem Bildschirm sichtbare Wort per Sprache ausgewählt und bearbeitet werden kann, egal ob es vorher diktiert oder getippt wurde. Dies Feature funktioniert nicht in allen Anwendungen, jedoch in allen gängigen Office-Programmen wie Microsoft Word, Microsoft Outlook, Microsoft Excel und zahlreichen anderen. Eine vollständige Liste findet sich in der Dragon NaturallySpeaking-Hilfe, wenn man "Select-and-Say" als Suchwort eingeht.

Für den konkreten Einsatz bedeutet Select-and-Say, dass innerhalb eines Diktates ein Wort oder eine Phrase per Sprachbefehl markiert und/oder korrigiert werden kann. Dabei ist es möglich, sich auch die Aufnahme (falls vorhanden) bis Diktates vorspielen zu lassen und auf diese Weise über die Korrekturfunktion von Dragon NaturallySpeaking das Sprecherprofil zu verbessern.

Ob eine Anwendung Select-and-Say unterstützt, lässt sich leicht daran erkennen, ob in der Dragon-Leiste ein grüner Punkt erscheint, oder ob dieser Punkt grau ist. Grün bedeutet, dass Select-and-Say in vollem Umfang funktioniert.

In Anwendungen, die Select-and-Say nicht unterstützen, steht diese Möglichkeit nur solange zur Verfügung, wie das Diktat im Arbeitsspeicher gespeichert ist, das heißt in der Regel bis zum nächsten Tastendruck oder Mausklick. Außerdem zeigt sich, dass in vielen Anwendungen einer Auswahl oder Korrektur der Sprache nicht passgenau möglich ist, Dragon NaturallySpeaking also nicht das Wort ganz genau markiert, sondern häufig ein Zeichen vorher oder hinterher mit einschließt oder weglässt. Dies äußert sich in verschiedenen Programmen unterschiedlich stark, so kann es sein, das in einigen Programmen ein Diktat überhaupt nicht möglich ist oder nur mit extremer Verzögerung; in anderen Programmen kann man fast wie gewohnt arbeiten, solange man keine Taste drückt und die Maus nicht betätigt. Dies hängt letztlich von den verwendeten Windows-Fensterklassen ab - wenn diese sich ähnlich verhalten wie die von Dragon NaturallySpeaking hundertprozentig unterstützten Fensterklassen, geht das Arbeiten mit Dragon NaturallySpeaking sehr flüssig.

In einigen Anwendungen kann Select-and-Say von Hand aktiviert werden. Dazu gibt es zwei - leider nicht mehr ganz aktuelle - Einträge in der Nuance Knowledge Base, die Nummer 3417 und die Nummer 4247, die über die Suchfunktion zu finden sind.

Anwendungen, die Select-and-Say nicht unterstützen, in Deutschland aber sehr populär sind und deswegen immer wieder zu Anfragen Anlass geben, sind zum Beispiel Open Office, Mozilla Firefox, Mozilla Thunderbird. Die Unterstützung für letztgenannte Programme beschränkt sich in Dragon NaturallySpeaking auf Sprachbefehle. Diktat mit voller Select-and-Say-Funktionalität ist jedoch in den Fenstern nicht möglich, wie immer wieder beklagt wird. Hier muss man gegebenenfalls das Diktierfenster zu Hilfe nehmen. Da alle diese Anwendungen aus der Open Source- und Linux-Welt stammen, und daher mit Standard-Windows-Fensterklassen nicht kompatibel sind, außerdem in Amerika bei weitem nicht so populär sind wie hier, ist in näherer Zukunft auch nicht mit einer vollen Select-and-Say-Unterstützung zu rechnen.

Gelegentlich kommt es vor, dass eine Select-and-Say-fähige Anwendung diese Fähigkeit verliert. In der Regel ist dann entweder nötig, das entsprechende Add-In wieder zu aktivieren, oder - im Falle von Microsoft Word - die Dokumentenvorlage normal.dot zu löschen. In schweren Fällen sind auch andere Eingriffe nötig, zum Beispiel das Löschen der ctfmon.exe. Der geneigte Leser findet eine Anleitung in der Nuance Knowledge Base unter der Nummer 3118.

Bugs in Dragon berichten

Wer Bugs in Dragon NaturallySpeaking findet, kann diese hier melden. Wichtig ist, so viel Information wie möglich zu liefern, damit sich das Problem reproduzieren lässt. Dafür hat man allerdings gerade mal 1.000 Zeichen Platz. Viel mehr Mühe geht drauf für eine Systembeschreibung, Eingabe der Seriennummer usw. Außerdem darf man zwar seine E-Mail angeben, erhält aber nach Absenden des Reports eine Meldung:

Thank you for your report to Nuance. We appreciate your effort in reporting this issue along with the details of how to re-create. We will review all reported bugs for possible resolution in a future release.

ISSUES SUBMITTED ON THIS FORM WILL NOT RECEIVE A RESPONSE.


Böse Zungen würden jetzt behaupten, viele Probleme seien schon so oft reproduziert und in diversen Foren gemeldet (sowie teils behoben) worden, dass Nuance einfach mal dort nachlesen sollte - aber vielleicht hilft es ja trotzdem... die Prozedur ist ansonsten dieselbe wie beim Problemformular unter http://epay.scansoft.com/de/, wo man aber wenigstens gelegentlich eine Antwort erhält.

19 Dezember 2008

Spracherkennung unter Linux als Open Source

Simon listens ist der Titel eines österreichischen Projekts, das unter Windows, aber auch unter Linux eine Open-Source-Spracherkennung zur Verfügung stellen will. Die erste Alpha-Version ist vor kurzem erschienen. Ein Video der Funktionsweise ist auf der Webseite abrufbar.

Bei Simon handelt es sich um eine einfach zu benutzende grafische Schnittstelle für die Spracherkennungs-Software Julius und das HTK-Toolkit. Die benötigten Wörterbücher holt Simon direkt aus dem Wiktionary, einem Wikipedia-Schwesterprojekt. Dateien importiert die Software im HADIFIX- oder HTK-Format. Simon trainiert die Sprache anhand einfacher Beispiele und erkennt so neue Wörter. Da Simon über das TCP/IP-Protokoll auf die Julius-Engine zugreift (die man separat startet), kann die Spracherkennung auf einem zentralen Server erfolgen.

Die Julius-Engine gibt es schon etwas länger, wobei sie als Erkenner zunächst sprachunabhängig entwickelt wurde, um Sprachmodelle beliebiger Sprachen aufzunehmen. Konkret gab es dort Entwicklungen für Japanisch und Englisch, beide noch nicht sehr weit fortgeschritten. Simon-Listens integriert nun ein deutsches Sprachmodell in die Engine, so dass auch Deutsch erkannt wird.

Simon Listens bezieht sich übrigens darauf, dass das Projekt ursprünglich angetreten ist, einem behinderten Jungen namens Simon den Zugang zum Computer zu ermöglichen. Unterstützer werden noch gesucht (mehr dazu hier). Gerade zur Weihnachtszeit doch eine schöne Sache!

(mit Informationen von http://www.linux-community.de/Internal/Nachrichten/Simon-freie-Spracherkennung-fuer-Linux

15 Dezember 2008

Sauber diktieren!

Dieser Beitrag passt sehr gut zu meinem letzten Eintrag: will ich ein ordentliches Ergebnis beim Diktieren, muss ich auch ordentlich diktieren.

"Dragon hält uns da den Spiegel vor und zeigt uns, wie wir denken und Material organisieren. Und anstatt frustriert oder verärgert zu sein über das, was ich auf dem Bildschirm lese, nehme ich es als Gelegenheit wahr, meine Fähigkeiten zu verfeinern, Texte zu verfassen und zu schreiben."


Den zitierten Aphorismus von Lichtenberg "Bücher sind wie Spiegel, und wenn Affen hinein schauen, blicken keine Menschen zurück" würde ich aber lieber etwas kundenfreundlicher formulieren. Wer wird schon gern als Affe bezeichnet? Also lieber so:

Optimieren Sie Ihren Input, dann optimieren Sie auch das Ergebnis.

(Dank an Rüdiger Wilke!)

13 Dezember 2008

Äh! (Nothing but speech)

Beim Kunden gestern machte ich einige interessante Erfahrungen. Zwei Ärzte sollten geschult werden,. Der eine gehörte zu der Fraktion der Diktanten, die an viele Wörter ein äh-Geräusch hängen bzw. zunächst unartikulerte Laute ausstoßen, bevor sie ein Wort sagen.

(Vielen ist das gar nicht bewußt. Für Spracherkennung ist es aber Gift, statt "der" etwas wie "nnder" und statt "Punkt" z.B. "Punktäh" zu sagen, was vom Drachen dann getreulich als "Inder" und "Punkte" geschrieben wird. Nicht immer liegt der Fehler hinter dem Bildschirm!)

Der andere sprach flüssig, zwischendurch entschlüpfte ihm aber auch das ein oder andere "äh" auf der Suche nach dem richtigen Wort.

Dragon schreib nun bei Arzt 1 ständig kleine Wörter wie "in", "der", "um" ins Diktat. Bei Arzt 2 wurden die gelegentlichen "äh" ignoriert. Warum? Nun, wohl weil letzterer das "äh" nicht mit einem Wort verschmolz, sondern als einzelnes "Wort" sprach. Hier greift die "Nothing-but-speech"-Option von Dragon, die Nebengeräusche ausfiltert.

Wenn die Nebengeräusche jedoch so dicht an ein Wort artikuliert werden, dass sie als Teil des Wortes (fehl-) erkannt werden, hat Dragon keine Chance. Hier hilft der Logopäde.

Mehr dazu auch hier.

03 Dezember 2008

Neues von der Medica

Wegen ausreichender Arbeitsbelastung sowie einer Operation am Weisheitszahn komme ich leider erst heute dazu, ein paar Neuigkeiten von der Medica 2008 in Düsseldorf zu berichten, wie inzwischen auch schon zwei Wochen her ist.

Das größte Ereignis sicherlich die Ankündigung von Nuance, man werde fortan im medizinischen Bereich die vor einigen Wochen von Philips aufgekaufte SpeechMagic (Dragon NaturallySpeaking erkannte an dieser Stelle "zwiespältig :-)-Lösung einsetzen.

(Die Pressemitteilung: http://www.nuance.de/news/20081119_medica.asp)

Aus Sicht des Herstellers ist dies nur logisch: man hat einen zweistelligen Millionenbetrag für die Philips-Spracherkennung ausgegeben und will diese dort nutzen, wo sie ihre Stärken hat, nämlich im medizinischen Geschäft, bei Workflow-Lösungen in einem Krankenhaus, wo ein Arzt zwar mit Spracherkennung digital diktieren soll, sich aber nicht weiter um die Korrektur und Bearbeitung der Diktate kümmern soll, sondern dies dem Schreibbüro überlässt. Hier bietet die jetzt neu benannte SpeechMagic Solution Builder-Lösung einen bekannten und eingeführten Workflow.

Angesichts der Tatsache, dass Dragon NaturallySpeaking auch im medizinischen Bereich ein gut eingeführtes Produkt ist, wird dies natürlich die Frage auf, was mit Dragon
passieren wird. Gerade auch meine eigene Firma, die 4voice AG, hat ja einen eigenen Workflow - bis vor nicht allzu langer Zeit in direkter Konkurrenz zur Philips-Lösung -, der genau dasselbe zu leisten verspricht, aber mit Dragon NaturallySpeaking-Spracherkennung (und natürlich einigen Extras, die Philips so nicht bietet - aber das ist ein anderes Thema).

Letztlich wird die 4voice AG aber von dieser Entwicklung sogar profitieren: als langjähriger Partner von Nuance können wir jetzt auch die Philips-Lösung anbieten, behalten aber unsere Kompetenz mit Dragon NaturallySpeaking weiter. Das bedeutet auch: wenn ein großer Workflow mit Philips-Lösung gefragt ist, können wir dies bedienen; in anderen Fällen können wir weiter unsere Lösungen mit Dragon NaturallySpeaking anbieten.

Zu erwarten steht außerdem die Dragon NaturallySpeaking Medical Edition 10, die allerdings auf der Messe noch nicht gezeigt wurde und für die auch noch kein Erscheinungstermin feststeht. Wenn diese erst mal da ist, hat Nuance zwei schlagkräftige Produkte - einen Workflow und ein Produkt für Ärzte, die lieber alleine arbeiten wollen, das sich aber auch in einem Workflow integrieren lässt.

Wie der Markt auf diese Entwicklung reagiert, wird sich zeigen: es gab genauso Rückmeldungen, die diesen Entwicklungen positiv entgegensehen, wie auch andere, die eine allzu große Marktkonzentration eines Herstellers eher negativ finden. Dies sind aber nur die ersten Eindrücke - in den nächsten Wochen und Monaten wird sich zeigen, wie es tatsächlich weitergeht.

Zum Schluss sei noch die erfreuliche Tatsache vermeldet, dass der Kontakt zum neuen Nuance- (und ehemaligen Kuhlmann-) Vertriebsteam sehr freundlich verlaufen ist, wo jetzt nicht mehr gegeneinander antreten! Für mich der schönste Aspekt der Messe.

15 November 2008

Google stellt Suche mit Spracherkennung für iPhone vor

Google stellt Suche mit Spracherkennung für iPhone vor

Gestern kündigete Google eine Applikation für das iPhone an, mit der eine Suche über eine Spracheingabe ermöglicht werden soll: Ich spreche in mein (ach wäre es doch mein!) iPhone "suche China-Restaurant in Berlin-Neukölln", das iPhone schickt die Anfrage an den Goolge-Server, und Google weist mich zu meinem Liebligs-Chinesen Herrn Tang in der Karl-Marx-Straße... um das Prinzip zu verdeutlichen.

Leider geht diese Applikation noch nicht in Berlin, sondern erst in Amerika. Cool ist es trotzdem, gerade weil auch lokale Suche integriert ist. Der GPS-Empfänger sagt der Applikation, wo man sich gerade befindet, und Google spuckt die China-Restaurants in der Nähe aus, so dass ich nicht mal wissen muss, in welchem Teil der Welt ich mich gerade befinde.

Ein Vorab-Video gibt es z.B. hier zu sehen. Die Applikation soll über den AppStore für das iPhone erhältlich sein.

23 Oktober 2008

Test: Dragon NaturallySpeaking Legal 10

Seit kurzem ist Dragon NaturallySpeaking Legal 10 erhältlich, und ich habe mir diese speziell für Juristen zugeschnittene Version über meine Dragon NaturallySpeaking Professional installiert. Bestehende Nutzer bleiben dabei erhalten. Daher habe ich jetzt die Möglichkeit, einige Unterschiede in diesen beiden Editionen mehr hervorzuheben:

Dragon NaturallySpeaking Legal ergänzt Dragon NaturallySpeaking Professional um ein juristisches Fachvokabular. Worin allerdings die Unterschiede zwischen den juristischen und dem allgemeinen Vokabular (das im Dragon NaturallySpeaking Legal ebenfalls enthalten ist) bestehen, darüber kursieren verschiedene Auskünfte. Der Hersteller gab vor Jahren einmal an, dass das juristische Vokabular im Verhältnis zum allgemeinen Vokabular um 80.000 Einträge erweitert worden sei. Dies kommt uns schon deswegen merkwürdig vor, weil der aktive Wortschatz eines Dragon NaturallySpeaking-Vokabulars in der Regel immer rund 150.000 Wörter beträgt - diese 80.000 Wörter können also allenfalls teilweise in den aktiven Wortschatz übergegangen sein. Dazu kam, dass der Hersteller bei der Markteinführung der analog positionierten Dragon NaturallySpeaking Medical Edition explizit keine Zahl nennen wollen, sondern darauf hingewiesen wurde, dass das Vokabular aus ganz anderem Material gewonnen wurde.

Dies ist auch bei Dragon NaturallySpeaking Legal der Fall. Daher möchte ich hier auf ein ganz wichtiges Konzept hinweisen, was vielen Anwendern gar nicht bewusst ist:

Das Sprachmodell.

Ein Sprachmodell enthält statistische Informationen über den Gebrauch bestimmter Wörter und Ausdrücke in einem bestimmten Kontext, ihre Häufigkeit und Wahrscheinlichkeit. Da Spracherkennung letztlich ein statistisches Verfahren ist, bei dem die Software jedes Mal rät, welches Wort wohl am wahrscheinlichsten dem Geräusch entspricht, welches durch das Mikrofon aufgenommen wurde, hat das Sprachmodell eine immense Bedeutung für die Genauigkeit der Spracherkennung.

Bei meinen ersten Diktaten mit Dragon NaturallySpeaking Legal zeigte sich genau dies: alltägliche Wörter und Wortverbindungen wurden häufig nicht erkannt zu Gunsten von juristischen Fachausdrücken, die ganz ähnlich klangen. Dies ist kein Mangel der Software, sondern ein Vorteil: das juristische Vokabular erwartet juristisches Diktat, kein allgemeines.

Und hier zeigt sich auch der Vorteil der Legal-Version für Rechtsanwälte, die oftmals meinen, die paar Fachausdrücke auch selbst zum Wortschatz hinzufügen zu können:

Das Legal-Sprachmodell gibt den professionellen Sprachgebrauch eines Juristen wesentlich genauer wieder als das allgemeine Sprachmodell. Es geht nicht nur um das Lernen einiger Ausdrücke, sondern um eine ganze Fachsprache mit ihren spezifischen Wendungen, die Dragon NaturallySpeaking Legal neben dem allgemeinen deutschen Sprachgebrauch beherrscht, andere Editionen aber nicht.

Einige andere Dinge kommen hinzu: so formatiert Dragon NaturallySpeaking Legal Ausdrücke wie "§ 32 Abs. 4 S. 2" (zumindest in der Theorie) korrekt; Aufzählungen mit "1., 2., 3." werden direkt mit Zahlen geschrieben, Gesetzesfundstellen werden im entsprechenden Kontext korrekt abgekürzt, und was dergleichen mehr Eigenheiten sind, die ein juristischer Schriftsatz wesentlich häufiger braucht als, sagen wir, eine durchschnittliche geschäftliche E-Mail.

Fazit: Juristen profitieren von Dragon NaturallySpeaking Legal, weil das Sprachmodell wesentlich genauer auf ihre spezifischen Bedürfnisse zugeschnitten ist und daher sehr viel schneller und ohne Modifikationen eine gute Erkennungsgenauigkeit erreicht werden kann. Bei den durchschnittlichen Stundensätzen eines Juristen dürfte sich damit die Investition recht schnell bezahlt machen.

Hier noch die Adresse eines Berliner Spezialisten für juristische Wortschätze:
www.cs-spracherkennung.de

22 Oktober 2008

Testbericht: Grundig Digta Cordex

Seit einer Woche ziert das Grundig Digta Cordex meinen Schreibtisch, ein - Grundig sagt: das 1. - schnurloses Mikrofon zum digitalen Diktat und für Spracherkennung. Mikrofon und Ladestation machen optisch einen sehr ansprechenden Eindruck, das Mikrofon liegt auch gut in der Hand, der Schiebeschalter wurde noch einmal gegenüber dem anderen Grundig-Mikrofone verbreitert und lässt sich sehr gut bedienen. 3 Funktionstasten oberhalb des Schalters sind sehr gut zu erreichen, die anderen 3 Funktionstasten liegen zu weit unten, als dass man sie ohne Umgrifen erreichen könnte. Das Gewicht des Geräts und die Größe sind sehr angenehm, so dass ein Diktat auch über einen längeren Zeitraum hinweg den Sprecher nicht belastet.

Die Bedienung der mitgelieferten digitalen Diktatsoftware ist sehr logisch gestaltet und kann komplett über das Mikrofon erfolgen. Interessant ist die Lösung, den Schiebeschalter zur Auswahl in den Software-Menüs zu verwenden.

Auch für Spracherkennung ist das CordEx sehr gut geeignet. Es gilt hier wie bei jedem Handmikrophon die Einschränkung, dass man genau in das Mikrofon sprechen muss, um eine optimale Erkennungsgenauigkeit zu erzielen, diese ist dann aber wirklich sehr gut.

Das Gerät wird mit einem Akku geliefert, der in der Ladestation geladen wird. Leider muss sie dazu mit dem Netz verbunden werden; ein Laden allein über den USB-Anschluss des Computers ist nicht möglich.

Das Digta Cordex lässt sich auch mit mehreren Ladestationen verbinden, so dass ein Wechsel zum Beispiel von einem Behandlungszimmer z.B. in einer Arztpraxis möglich ist. Ganz ohne Umstände gilt dies allerdings nicht ab.

Vorbildlich ist dafür die Behandlung, wenn man sich mit dem Gerät einmal zu weit vom Computer entfernt: Das Gerät ist mit einem internen Speicher für bis zu 1 Minute Diktat ausgestattet, so dass man auch bei vorübergehender Verbindungsunterbrechung zum Rechner Diktate aufnehmen kann. Wenn also die Verbindung einmal abbricht, kann man ohne Angst vor Verlusten weiter diktieren; sobald das Mikrofon sich wieder mit dem Computer verbindet, wird das Diktat übertragen. Dies funktioniert auch wunderbar mit Spracherkennung. Man kann dann zu sehen, wie sie vor 1 min gesprochenen Wörter Schritt für Schritt am Bildschirm transferiert werden.

Eine Einschränkung im Betrieb mit Spracherkennung ist eigentlich keine: Dragon NaturallySpeaking macht es nicht ohne weiteres möglich, die Spracherkennung über das Mikrofon ein- und auszuschalten (mit einer Zusatzsoftware wie der 4voice Local geht das aber). Jedoch kann man die Spracherkennung einmal ausschalten und dann den Schiebeschalter dazu verwenden, das Mikrofon stumm zu schalten - Dragon hört dann zwar noch weiter zu, es kommt aber kein Signal an, was außerdem zur Folge hat, dass nach einer längeren Diktierpause die Spracherkennung wesentlich schneller reagiert als wenn sie abgeschaltet ist.

Es bleibt abzuwarten, wie die Akzeptanz des Grundig Digta Cordex sein wird: mit einem empfohlenen Verkaufspreis von 499 € empfiehlt es sich eher für den gehobenen Geschmack. Die ersten Exemplare sollen demnächst an Händler ausgeliefert werden.

17 Oktober 2008

Test: Plantronics Callisto Bluetooth-Headset

Gerne würde ich an dieser Stelle Erfreuliches über das Plantronics Calisto-Headset berichten, welches in Dragon NaturallySpeaking 10 Wireless Edition mitgeliefert wird. Ein solches Gerät habe ich seit zwei Wochen zum Test; vorher hatte mein Kollege es bereits - und uns fiel beiden dasselbe auf:

Wenn es uns gelingt, das Gerät anzuschließen, erkennt es recht ordentlich. Die Schwierigkeit besteht aber im Anschließen des Geräts.

Hier bestätigt sich meine alte Bluetooth-Phobie: es ist mir niemals gelungen, ein Bluetoothgerät dauerhaft und problemlos mit einem PC zu verbinden. Diese Geschichte zieht sich seit Jahren durch meine Erfahrungen - schon das erste spracherkennungstaugliche Bluetooth-Headset, dass Sony HBH-300, ließ sich zwar verwenden, gab auch eine sehr gute Erkennungsqualität, musste aber jeden Morgen aufs neue mit dem Rechner gepaart werden. Mit anderen Headsets wie dem Parrott Bluetooth-Headset habe ich ebenfalls qualitativ gute Erfahrungen gemacht, es aber niemals dauerhaft mit dem Rechner verbinden können. Mit einer Bluetooth-Maus was übrigens auch nicht anders - entweder es liegt an mir oder einem Bluetooth-Standard, aber wir beiden passen einfach nicht zusammen :-)

Auch bei den Calisto-Headset habe ich nach dem dritten oder vierten Versuch aufgegeben. Zwischenzeitlich war es mir gelungen, eine Verbindung herzustellen und zu diktieren, und es zeigte sich, dass das Diktat gut erkannt wurde, sofern ich das Headset als neu Diktierquelle eingerichtet hatte, das heißt also ein Kurztraining von 7 min Dauer durchgeführt hatte (wird in ein anderes Profil diktiert, dass nicht speziell auf dieses Headset zugeschnitten ist ist die Erkennungsgenauigkeit unter aller Kritik).

Ob es an mir oder am Gerät liegt - wer es zum Laufen bekommt, wird sicherlich damit glücklich werden, ich fühle mich in meinem Urteil bestätigt und werde weiterhin andere schnurlose Alternativen bevorzugen, wie zum Beispiel das Plantronics CS 60, das Jabra GN 9350 oder das neue Grundig Digta Cordex-Handmikrophon (Test folgt in Bälde).

Ein Hoch dem Nuance-Support!

Gestern hatte ich zum ersten Mal das Vergnügen, mit dem Nuance-Kundensupport zu sprechen. (Für Uneingeweihte: als Händler hat man einen eigenen Support, der als erstes die Dragon.log-Datei anfordert, um diese dann umgehend ad acta zu legen - daher der Wert der Foren, Distributoren und inoffizieller Quellen).

Problem: Bei einem Upgrade auf Dragon NaturallySpeaking 10 von 9 wollte die Installationsroutine einen "Security Key" zur Aktivierung haben. Gab es diesen nicht, so wurde die gesamte Installation rückgängig gemacht. Die Aktivierung wird normalerweise nach dem 1. Programmstart vorgenommen, so dass ich zuerst die Anforderung ignorierte - und dies mit drei Stunden fruchtloser Installationsversuche bezahlen musste.

Ein Anruf beim Kundensupport brachte unerwarteterweise des Rätsels Lösung: Während der Installation generiert Dragon einen Hardware-Key, aus dem dann mit der Seriennummer zusammen der Security Key generiert wird, welcher wiederum, bei der Aktivierung an Nuance übertragen wird. Dieser Hardware-Key war fehlerhaft. Dies war der freundlichen Dame in dem Moment klar, wo ich ihr den Key angab, und sie generierte auf der Stelle einen Security Key, mit dem ich problemlos die Installation abschließen konnte.

Fazit: Sollte während der Installation ein Security Key angefordert werden, 069 51 70 93 63 anrufen - hier werden Sie geholfen.

Übrigens auch zu loben: die Qualität der Computerstimme in der Warteschleife. Da hat Nuance Beachtliches geleistet - nur Dragon hat immer noch die viele Jahre alte "Vera", die einem Text vorquäkt.

02 Oktober 2008

Nuance übernimmt die Spracherkennungssparte von Philips

Nuance übernimmt die Spracherkennungssparte von Philips und will damit das Geschäft im Medizinmarkt vergrößern.

In Deutschland ist Philips mit SpeechMagic, vertreten u.a. durch die Firma Kuhlmann, der stärkste Mitbewerber von Nuance. In anderen Ländern tritt Nuance gar nicht an, weil Dragon in der Landessprache nicht verfügbar ist. Wenn Nuance Philips Speech Recognition jetzt übernimmt, sind sie auch in diesem Gebiet der Platzhirsch.

Ob beide Produktlinien weitergeführt werden, eine mit der Zeit verschwinden wird oder sich in die andere integriert, wird sich zeigen. Dragon ist eher auf den Consumer-Markt ausgerichtet und im Vergleich zu SpeechMagic wenig spezialisiert. Von daher ist für beide Produkte Platz.

Ich erinnere an zwei andere Übernahmen in den letzten Jahren. IBM Via Voice wurde nach der Übernahme in den Nuance-Vertrieb ausgehungert. Der Erwerb von Dictaphone und die anschließende Einführung des Powerscribe-Workflow in Deutschland waren nicht wirklich erfolgreich; Dragon und seine Fachhändler haben dies ganz gut überstanden. Hier hat es also der Markt, d.h. die fehlende Akzeptanz geregelt.

Welche Strategie Nuance mit dieser doch sehr spektakulären Übernahme weiter fahren wird, ist noch nicht bekannt. Bis auf weiteres soll sich für die Dragon-Händler nichts ändern - warten wir's ab. Im Moment ist es noch zu früh, etwas zu sagen.

27 September 2008

FAQ: Audio-Assistent von Dragon NaturallySpeaking

Frage: Kennen Sie eine Lösung für die wiederholte Aufforderung, beim Wechsel der Headsets (USB, Kabel etc.) die Lautstärke- und Qualitätsprüfung von Dragon NaturallySpeaking immer wieder neu vornehmen zu müssen?


Antwort: Der Audio-Assistent prüft die Lautstärke des Sprachsignals und die Nebengeräusche beim Diktieren, legt also die akustischen Rahmenbedingungen für die Spracherkennung fest. Deshalb lässt er sich auch nicht abschalten oder umgehen.

Es ist aus diesen Gründen sinnvoll, den Audio-Assistenten beim Wechsel des Eingabegerätes immer wieder laufen zu lassen: zum einen haben verschiedene Geräte verschiedene Audio-Eoigenschaften, die für die Qualität der Spracherkennung nötig sind. Zum anderen verändert sich während des Diktierens auch die Stimme, so dass der Audio-Assistent Dragon dabei hilft, wieder optimal zu erkennen. Daher sollten Sie den Audio-Assistent regelmäßig, zumindest aber beim Wechsel des Eingabegerätes ausführen - besser eine Minute lesen als viele Fehler zu korrigieren.