28 April 2006

Key Mute, Teil 2

Gestern berichtete ich schon über KeyMute, ein Tool, das Dragon während der Benutzung von Tastatur und Maus stummschaltet. Gestern morgen fragte ich mich noch, wer so was wohl braucht; gestern abend diktierte ich in mein Notebook und merkte: Ich.

Da der Download inzwischen virenfrei ist bzw. mein neuer Virenscanner unter Paranoia litt, werde ich jetzt fröhlich ans Werk schreiten und das Teil mal ausprobieren. Interesse ist durchaus nicht nur bei mir vorhanden, wie ich im Scansoft- und Knowbrainer-Forum sehe.

Übrigens dürfte es wohl sinnvoll sein, zunächst mit den Standardeinstellungen zu testen. Auf meine ersten Frgen hin erhielt ich schon folgende nützlichen Hinweise:

Zu Ihren nachfolgenden Fragen:

Microphone On/off - der Key sollte derselbe sein wie in Dragon?

"Microphone On/Off" - wie auch der HotKey für "Press-to-Talk" von KeyMute muss jeweils mit dem gleichlautenden HotKey in NaturallySpeaking übereinstimmen, damit die Steuerung funktioniert.

Global On/Off: dieser Key sollte ein anderer sein - und den muss ich mir angewöhnen, um Dragon mit KeyMute tatsächlich stummzuschalten. Stimmts?

"Global Microphone On/Off": Hier muss eine andere, dritte Funktionstaste gewählt werden, wie Sie richtig festgestellt haben. Natürlich bietet es sich an, an dieser Stelle diejenige Taste zu wählen, die Sie bereits zuvor zur Stummschaltung von Dragon verwendet hatten, damit Sie sich nicht umgewöhnen müssen.

Für den Moment empfehle ich F11 für "Press-to-Talk", F9 für "Microphone On/Off" und F10 für "Global On/Off" zu verwenden. Interferenzen mit anderen Programmen können zwar wohl nicht ausgeschlossen werden, sie lassen sich aber immerhin dadurch minimieren, dass bei den "Excepted Keys" alle Funktionstasten mit einem Häkchen versehen werden. Auf diese Tasten reagiert KeyMute dann überhaupt nicht mehr.


(Ich hoffe aber darauf, dass demnächst nicht nur die F-Tasten zr Verfügung stehen werden :-)

27 April 2006

Neues Tool zur automatischen Geräuschunterdrückung

KeyMute nennt sich die Anwendung, die Dragon während der Benutzung von Maus und Keyboard stummschaltet, um Störgeräuche auszuschließen. Natürlich stellt sich die prinzipielle Frage, ob es nicht einfacher ist, die Taste auf der Tastatur (am Mikro, Headset und so weiter) zu drücken...

Die offizielle Homepage des Entwicklers liegt unter http://www.fritz-eit.de/KeyMute/, ist aber bis jetzt noch frei von jedem Inhalt. Alle Informationen also bitte aus dem Forums-Post beziehen.

Aber weil ich neugierig bin, werde ich mir das Programm herunterladen und mal schauen, ob es tatsächlich hilft. Nicht, dass ich noch Probleme mit Nebengeräuschen hätte - das VXI Parrott TalkPro unterdrückt Nebengeräusche so effektiv, dass sogar mein Kollege hinter mir telefonieren kann.

5 Minuten später:

Beim Download schlägt mein Virenscanner Alarm! Und das, obwohl der Entwickler ausdrücklich im Knowbrainer-Forum gelobt wird.

24 April 2006

Neue Rezension: Dragon und Microsoft Speech Recognition

AnandTech, nach eigenen Angaben "the leading IT source for hardware analysis and industry news", hat einen ausführlichen - leider nicht ganz von Abschweifungen freien - Beitrag mit Benchmark-Test über Spracherkennung. Interessant für uns deutsche Anwender ist, dass der Rezensent die in MS Office 2003 (US-Version) enthaltene Spracherkennung dagegen testet (das ist die, deren ctfmon.exe-Datei so viel Unheil in unseren armen deutschen Installationen anrichtet).

Einige interessante Ergebnisse:

- Dragon ist besser als Microsoft (Überraschung). Da Office 2003 in der deutschen Version keine Spracherkennung enthält, dürfte diese Nachricht hier auf recht geringe Aufmerksamkeit treffen.
- Es hilft bei Dragon, in den Optionen "Maximale Genauigkeit" einzustellen - die Genauigkeit ist tatsächlich spürbar höher. In MS Office führt die maximale Genauigkeit paradoxerweise zum schlechtesten Ergebnis.
- Eine Aufnahme des Diktats führt im Benchmark-Test zu bessderen Ergebnissen als ein direktes Diktat. Verzaget nicht, ihr Diktiergerät-Benutzer! möchte man ausrufen, denn meine Praxis kann das nicht unbedingt bestätigen.
- Spricht man nicht mt "Diktierintonation", sondern in normalem Sprechtempo, sinkt die Genauigkeit von Dragon rapide von 96-97% auf 90-91%. Dies ist bei MS Office nicht so ausgeprägt (Any Americans out there: Did you know you can use MS Word as a notes taker?) Jedoch ist auch hier der Verlust bei der Transkription einer Wav-Datei geringer. Der Tester führt das darauf zurück, dass Dragon in diesem Falle das Diktat auch nicht auf Befehle untersucht; hat ihm mal jemand was vom "Diktiermodus" erzählt?
- Dragon braucht wesentlich mehr Prozessorleistung als MS Office; ein Dual Core-Prozessor bringt jedoch keine Verbesserung. (Nuance ist da offiziell anderer Meinung, aber IBM trat beim Naunce Productivity Summit ja auch als Sponsor auf ;-)

Sehr interessant auch der Kommentar im Knowbrainer-Forum, in dem es u.a. um die Wichtigkeit eines guten Headsets geht. Die Herren von eMicrophone.com haben da eine sehr dezidierte Meinung - Sennheiser gibt 100%, why settle for less? (Wobei sich dann die Frage stellt: Wenn sie nichts schlechteres als Sennheiser akzeptieren, wie kann ein Mikro dann besser sein?)

Und was die Zukunft angeht: Warten wir auf Windows Vista, und ob/wie Nuance kontert. Gerüchteweise soll der Launch von DNS 9 ja erst nach der Einführung von Vista kommen (dann können wir es gleich DNS 10 nennen ;-)

13 April 2006

Google patentiert sprachgesteuerte Suche

Heise meldet, dass Google eine sprachgesteuerte Suche zum Patent angemeldet hat. Hier wird das garantiert nicht um digitales Diktieren gehen - das große Geld liegt in der Spracherkennung ja eigentlich bei ganz anderen Anwendungen. Vielmehr geht es hier um das, was in letzter Zeit auch bei mir verstärkt angefragt wurde, nämlich die Abfrage von Informationen per Sprache. Anders ausgedrückt: man telefoniert nicht mehr mit einem Menschen, sondern mit einem Computer. Wenn sich Google hier schon engagiert, weist das darauf hin, dass wir in zwei Jahren diese Technik für ganz normal halten werden. Aber vielleicht sichern sie sich auch nur das Patent, ohne dass etwas konkretes daraus wird...

12 April 2006

VXI Parrott TalkPro USB-Headsets

In Amerika sind sie seit langer Zeit bei Nutzern von Dragon NaturallySpeaking beliebt, ScanSoft hat die mit fünf Drachen ausgezeichnet, jetzt gibt es sie auch in Deutschland: VXI Parrott TalkPro USB-Headsets. Ich habe zwei verschiedene Modelle getestet. Vorweg: ich bin mit der Leistung sehr zufrieden. Jetzt im einzelnen:

Das VXI Parrott TalkPro USB-Headset 100 war mein erstes Gerät im Test. Es ist monaural mit nur einer Hörmuschel, mit der Seriennummer 200 gibt es auch ein Stereo-Headset mit zwei Hörmuscheln. Die Lieferung erfolgte in einer robusten braunen Schachtel, es mussten ein paar Kabel zusammengestellt werden, danach wird das Headset einfach über USB angeschlossen und installiert sich unter Windows XP sofort. Der Audiotest (dessen Wert ja sowieso umstritten ist) brachte zwar nur einen Wert von 18 Punkten bei der ersten Installation, doch die Erkennungsgenauigkeit war sofort spürbar besser als die des Philips SpeechMike und des Olympus DR 2000, die ich vorher an meinem Rechner im Einsatz hatte. Natürlich ist ein Headset immer besser als ein Handmikrofon, weil der Abstand zwischen Mund und Mikrophon nicht variiert, aber dass ich durch einen simplen Wechsel der Hardware die Fehlerquote tatsächlich praktisch auf Null bringen würde, hatte ich dann doch nicht erwartet. Noch ein positiver Nebeneffekt war, dass die Erkennung wesentlich schneller vor sich ging. Hier spielt wahrscheinlich auch eine Rolle, das im Hintergrund keine Steuerungssoftware läuft. Nachdem ich außerdem in letzter Zeit immer wieder Schwierigkeiten mit Nebengeräuschen bei den Handmikrofonen hatte, die dazu führten, dass Dragon NaturallySpeaking mehr oder weniger abstürzt, war mir außerdem die hohe Resistenz gegenüber Nebengeräuschen sehr willkommen. Schließlich gibt's noch einen Schalter, mit denen sich das Headset umschalten lässt. Merkwürdigerweise ist es stumm, wenn der Schalter gedrückt ist, und aktiv, wenn er losgelassen ist - hier hätte ich eine andere Logik erwartet.

Der deutsche Vertrieb lieferte mir ein paar Tage später noch ein anderes Headsets mit einem Umschalter, mit dem sich das Gerät auch ans Telefon anschließen lässt. Das war auch gut so - nachdem ein Kunde das VXI Parrott TalkPro USB-Headset bei mir gesehen hatte, probierte er es an seinem Notebook aus, erreichte auf Anhieb 26 Punkte im Audio-Assistenten und nahm das Gerät gleich mit.

Die zweite getestete Kombination besteht aus einem VXI Parrott TalkPro SP1 Kopfhörer mit NC-Mikrophon, einer ganzen Reihe von verschiedenen Kabeln, die alle ineinander gesteckt werden müssen, einen USB-Adapter und einer Umschaltung zwischen Computer und Telefon. Die Verkabelung gestaltete sich naturgemäß etwas komplexer, war aber auch kein großes Problem, und auch dieses Headset ließ sich unter Windows XP umstandslos installieren.

Die Telefon-Kombination funktioniert wider Erwarten genauso gut wie das reine USB-Headset. Auch hier gab der Audio Assistent sofort ein sehr gutes Signal, und die Erkennungsgenauigkeit ist praktisch perfekt. Beide Headsets sind von der Konstruktion identisch, sehr bequem zu tragen, mit einem robusten Metallbügel, leicht und komfortabel.

Gewöhnungsbedürftig ist lediglich die Umschalterbox. Ein großer Schalter, der mit einem Symbol für Headset und einem Symbol für Telefonhörer versehen ist, schaltet nicht etwa zwischen Computer und Telefon hin und her, sondern zwischen Telefon-Headset und Telefonhörer. Die Umschaltung zwischen Computer und Telefon geschieht durch einen zweiten, kleinen gelben Knopf, bei dem nicht ganz genau ersichtlich ist, in welchem Zustand er das Signal wohin sendet. Die Umschalter-Box wird zwischen Headset auf der einen Seite und USB-Adapter beziehungsweise Telefon auf der anderen Seite eingeschliffen. Die Verbindung zum Telefon geschieht durch (im Lieferumfang nicht enthalte) Kabel, die beim Telefon in den Stecker für den Hörer gesteckt werden. An der anderen Buchse wird der Hörer selbst angeschlossen. Eine Fernannahme eines Telefongesprächs ist nicht vorgesehen. Der deutsche Vertrieb versucht im Moment einen amerikanischen Hersteller eine bessere Lösung durchzusetzen, hoffen wir auf Erfolg.

Da ich hier ausschließlich schnurlose Telefone zur Verfügung habe, kann ich leider nicht prüfen, wie sich die Arbeit mit der Umschaltung im täglichen Einsatz gestaltet, wenn man das Headset tatsächlich zum Telefonieren und zum Diktieren nutzen will. Auf jeden Fall sind beim Diktat mit Spracherkennung keinerlei Einschränkungen zu erwarten. Wer lieber mit einem Headset statt mit einem Hörer telefoniert, und eine Möglichkeit hat, einen entsprechenden Anschluss zu schalten, erhält mit dieser Kombination eine brauchbare Lösung.

Zum Schluss schon eine Vorschau: diesen Beitrag diktiere ich mit dem neuen GN Netcom GN 9350, ein schnurloses Headset, das ebenfalls zwischen Telefon und Hörer eingeschliffen werden kann und eine USB-Verbindung zum Computer besitzt. Den Erfahrungsbericht veröffentliche ich, wenn ich genügend Erfahrungen damit gesammelt habe. Die Erkennungsgenauigkeit beim Diktat in Firefox (wird offiziell nicht von Dragon unterstützt) ist auf jeden Fall zufrieden stellend. Stay tuned!

GN Netcom GN 9350 Schnurloses USB-Headset - erste Eindrücke

Zwei Tage Arbeit mit den GN 9350 lassen zwar nicht unbedingt eine qualifizierte Rezension zu, bevor ich mich aber für die nächsten 10 Tage verabschiedet, möchte ich doch wenigstens meine ersten Eindrücke veröffentlichen. Also:

Der Vorzug des schnurlosen DECT-Headsets GN 9350 von GN Netcom liegt darin, dass es sich sowohl mit dem Computer als auch mit dem Telefon verwenden lässt. An der Ladestation befinden sich zwei Tasten, mit denen zwischen Computer und Telefon umgeschaltet werden kann. So braucht man immer nur ein Gerät zum Diktieren und telefonieren (das richtige Telefon vorausgesetzt).

Das GN 9350 installiert sich unter Windows XP problemlos nach dem Einstecken des USB-Steckers. Das Audio-Training bei Dragon NaturallySpeaking erreicht auf Anhieb einen Wert von 20 bis 21. Für ein schnurloses Headset ist das sehr gut.

Auch in der Praxis zeigt sich eine hohe Erkennungsgenauigkeit, die nur von der Emfindlichkeit gegenüber Nebengeräuschen getrübt wird. Natürlich liegt die Genauigkeit nicht ganz so hoch wie bei einem schnurgebundenen Headset, kann aber mit einem Handmikrofon durchaus konkurrieren. Dieses dürfte auch der natürliche Konkurrenz des GN 9350 sein - wer konzentriert und lange diktiert, zieht sicherlich ein Schnur gebundenes Headset mit bester Erkennungsrate vor. Wer häufig kürzere Texte zu diktieren hat oder während der Arbeit immer wieder abgelenkt wird, den Platz wechseln muss, also mobil sein will, der braucht entweder ein Handmikrofon, welches man sofort weg legen kann, oder eben ein schnurloses Headset, das einen nicht an seinem Rechner fesselt. Hier ist das GN 9350 eine echte Alternative.

Die Umschaltung zwischen Telefon und PC ist vorbildlich - es gibt je einen Schalter, der die Verbindung zum einen oder anderen Gerät herstellt, und der mit einer LED gekennzeichnet ist. Unter dem Deckel der Basisstation befinden sich außerdem zahlreiche Einstellungsmöglichkeiten. Dort kann man z. B. auch die Reichweite regeln, und damit die Strahlungsbelastung reduzieren. Überhaupt ist das Design sehr gelungen.

Da ich hier kein kompatibles Telefon benutze (wir haben eine komplett schnurlose Telefonanlage), kann ich leider nicht viel über die Arbeit mit dem Telefon berichten. Das Headset wird zwischen Telefon und Hörer eingeschlichen, es ist sowohl möglich, Telefongespräche direkt Headset entgegenzunehmen, wie auch einen Telefonhörer-Lifter einzubinden, der dann bei einem entsprechenden Telefon automatisch den Hörer in die Höhe hebt. Der Bedienungskomfort ist also ohne Zweifel sehr gut. Ob der Anschluss auch an einer komplett schnurlosen Anlage möglich ist, müsste man ausprobieren. Bei unserer speziellen Konfiguration geht es nicht (das liegt aber auf jeden Fall an uns).

Was allerdings stört, ist ein Grundrauschen im Ohrhörer, der sich auch nicht dadurch beseitigen lässt, dass man die Lautstärke herunterregelt. Erst nach einiger Zeit der Arbeit zeigt ich ein anderes Problem: das Polster am Ohr besteht offensichtlich aus Kunstleder, liegt jedenfalls nicht sehr bequem an.

Zwischenbilanz: schön designt, praktisch in der Anwendung, leider mit leichten Schwächen in der Anwendung (Tragekomfort und Erkennung).

30 März 2006

DSS Player Pro-Upgrade

Olympus stellt ein neues Upgrade für den DSS Player Pro, Versionsnummer 4.8.2, zum Download bereit. In der Unterstützung des DR-2000 wurden einige Probleme beseitigt. Außerdem wurde die Funktionalität der Tasten leicht verändert, so dass sie einem Diktiergerät ähnlich werden. Wenn der Schiebeschalter auf "Play" steht, kann man mit der REW-Taste jetzt zurückspulen und dabei alle paar Sekunden ins Diktat reinhören, um schneller eine Passage zum Übersprechen bzw. Einfügen zu finden.

Der direkte Link zum Download der Software (Deutsch): http://downloads.olympus-europa.com/consumer/VoiceRecorder/635/P4UP82GR.exe
(nur für lizenzierte Nutzer des DSS Player Pro 4!)

28 März 2006

Dragon NaturallySpeking Legal Wireless Edition!

Dragon NaturallySpeaking Professional Wireless Edition und Dragon NaturallySpeaking Preferred Wireless Edition gibt es schon seit November 2005. Damals hat Nuance mit Plantronics einen Vertrag abgeschlossen, der es erlaubt, ein schnurloses Headset entweder vollkommen kostenlos oder nur für einen relativ geringen Aufpreis mitzuliefern.

Rechtsanwälte, Notare und Juristen konnten von diesem Angebot allerdings bisher nur eingeschränkt profitieren. Die spezielle Legal Edition von Dragon NaturallySpeaking wurde nämlich nach wie vor mit einem preiswerten analogen Headset ausgeliefert.

Dies ändert sich ab sofort: das Angebot gilt jetzt auch für Dragon NaturallySpeaking Legal Edition - auch diese wird jetzt ohne Aufpreis mit einem schnurlosen Headset Plantronics CS 60 USB über ausgesuchte Fachhändler ausgeliefert! Und zwar nur, solange der Vorrat reicht - und hier ist, im Gegensatz zu der von Nuance im Oktober initiierten Aktion, der Vorrat tatsächlich auf eine geringe Anzahl begrenzt.

Und weil diese Netznotizen vom zertifizierten Fachhandel gesponsert werden ;-) gibt es auch einen Link, wo Sie die Software kaufen können:
http://www.abitz.com/spracherkennung/natspeaklegal.php3

23 März 2006

Audio Mining mit Dragon NaturallySpeaking?

Auf der CeBIT wurde mehrere Male die Frage gestellt, ob es mit der Spracherkennung Dragon NaturallySpeaking möglich ist, zum Beispiel aus Radiosendungen oder Telefongesprächen einzelne Wörter herauszufiltern, nach denen die Aufnahmen verschlagwortet werden können. Nachdem mich genügend Anfragen dazu erreicht hatten, habe ich mich einmal kundig gemacht.

Im Internet bietet Nuance unter http://www.nuance.com/AudioMining (in englischer Sprache) Informationen zum Thema an. Als mündliche Auskunft habe ich darüber hinaus erfahren, dass die Software Teil des SDK (Software Development Kit) ist, welches sich an Software-Entwickler wendet, die Spracherkennung in ihre Produkte integrieren wollen. Dieses SdK wird zum Preis von 5.000 EUR inklusive einem Jahr Entwicklersupport angeboten. Enthalten ist unter anderem ein Werkzeug zum Audio mining. Dieses Werkzeug ist auch auf Deutsch verfügbar, es erreicht bei der Auswertung von Telefongesprächen eine Erkennungsgenauigkeit von circa 50 bis 60%. Auch hier wird empfohlen, aktiv am zu Grunde liegenden Vokabular zu arbeiten, um die Erkennungsgenauigkeit zu verbessern. Je genauer das Vokabular auf die Textsorte zugeschnitten ist, die bearbeitet werden soll, desto höher ist die Erkennungsgenauigkeit. Für den genannten Zweck reichen aber die 50 bis 60% meist schon aus, da es ja nur darum geht, einzelne Wörter zu isolieren.

Immer noch interessiert? Für Entwickler stelle ich gern einen Kontakt her.

22 März 2006

Netznotizen

Regelmäßige Leser erinnern sich, dass ich vor ca. einem Monat dazu aufgerufen hatte, eine Alternative zu "Blog" vorzuschlagen. Sintflutartig stürzten die Vorschläge nicht auf mich ein, doch fand ich gleich den zweiten so charmant, dass ich ihn im Titel verwenden werde. Achtung: Dieses Blog heißt ab sofort "Digital diktieren: Netznotizen zur Spracherkennung". Und Sie, lieber Leser, waren soeben Zeuge eines performativen Sprechaktes.

Herzlichen Glückwunsch, M. Kempin - wenn Sie sich bei mir melden, erhalten Sie eine OCR-Software ReadIris Pro 9 als Belohnung! Eine Spracherkennung haben Sie doch hoffentlich schon?

21 März 2006

FAZ-Test: Olympus DirectRec vs. Philips SpeechMike

- Achtung: kostenpflichtig! -

Aus urheberrechtlichen Gründen kann ich den gesamten Beitrag hier nicht veröffentlichen, aber immerhin einige Punkte aus den heutigen FAZ-Vergleichstest des Olympus DR 2000 mit dem Philips SpeechMike Classic zusammenfassen beziehungsweise zitieren.

SpeechMike Classic

Diktiermikrophone wie die beiden getesteten Geräte wenden sich an Vieldiktierer, die meistens im Büro, der Kanzlei oder der Praxis diktieren und daher kein digitales Diktiergerät benötigen. Statt dessen können sie sofort in den PC diktieren und ihn sozusagen als digitales Aufnahmegerät nutzen. Das Philips SpeechMike ist hinlänglich bekannt und seit vielen Jahren auf dem Markt.

Olympus DR-2000

Das Olympus DR 2000 habe ich hier bereits angekündigt, die ersten Exemplare sind auf der CeBIT zu besichtigen gewesen (am Stand von Nuance, in meinen Händen :-)

Beide Geräte zielen auf dieselbe Anwendung - ein Phonodiktat in den PC in eine Diktatverwaltung. Michael Spehr, der FAZ-Rezensent, merkt richtig an, dass die Geräte für Spracherkennung nur bedingt geeignet sind. Das hat nichts mit der Qualität zu tun, sondern mit der Bedienung: der Schiebeschalter eignet sich nicht dazu, die Spracherkennung zu bedienen.

Dies liegt meiner Meinung nach an der Logik des Schiebeschalters: Dragon NaturallySpeaking wird mit einer einzigen Funktionstaste ein- und ausgeschaltet. Der Schiebeschalter hat dagegen unterschiedliche Positionen für ein und aus. Dies ist logisch nicht aufeinander abzubilden. Ich habe es selbst seit einigen Monaten immer mal wieder probiert, und es gelingt nicht. Herr Spehr mahnt beim Hersteller an, hier für Abhilfe zu sorgen; einfacher ist es natürlich, ein SpeechMike Pro mit Einzeltasten oder ein Olympus DR 1000, ebenfalls mit Einzeltasten, aber leider noch nicht auf dem Markt, zu erwerben. Diese Tasten können einzeln programmiert werden, so dass man sie zum Einschalten und Ausschalten der Spracherkennung benutzen kann. (Übrigens arbeite ich im Moment gerade mit einem Philips SpeechMike Classic, bei dem ich einfach eine der zusätzlichen Funktionstasten für die Bedienung der Spracherkennung nutze.)

Jetzt zum eigentlichen Vergleich: positiv fällt am Olympus DR 2000 vor allem die Bedienung auf - das Gerät ist schwerer als das SpeechMike, macht einen soliden Eindruck, und vor allen Dingen ist der Schiebeschalter wesentlich besser verarbeitet als bei der Konkurrenz. Das SpeechMike kann dagegen mit den zusätzlichen Funktionstasten punkten, die unter anderem die Maus überflüssig machen und die Steuerung anderer Programme mit demselben Gerät ermöglichen - ideal zum Beispiel für den Arzt, der zwischendurch Röntgenbilder ansehen möchte.

Schließlich zur Software: Die Software selbst ist bei beiden Geräten ganz zugeschnitten auf das direkte Diktat in den Rechner, alle Funktionen können mit dem Schiebeschalter bedient werden, die Diktate werden dann in eine Diktatverwaltung übernommen und an das Schreibbüro oder an die Sekretärin weitergegeben, oder aber direkt zur Spracherkennung Dragon NaturallySpeaking geschickt. In dieselbe Diktatverwaltung können auch die Diktiergeräte der jeweiligen Hersteller eingebunden werden. Kritisch wird vermerkt, dass Philips für den Betrieb der Software ein USB-Dongle verlangt, was bei Olympus nicht der Fall ist. Im übrigen ist das Philips-Gerät mit Speech Exec-Software um ungefähr 200 EUR teurer als Olympus-Gerät (550 EUR gegenüber 350 EUR).

Meine Meinung dazu? Ich arbeite im Moment am einen Rechner mit einem SpeechMike, am anderen Rechner mit einem Olympus DR 2000. Für mich interessant sind natürlich vor allem die Leistungen bei der Spracherkennung; hier kann ich keinen spürbaren Unterschied feststellen. Auch beim Audio-Test erzielen beide Geräte ein vergleichbares Ergebnis. Wie bei Diktiergeräten sind also wohl auch die Diktiermikrophone Gefühlssache: welches liegt besser in der Hand, welche Bedienung seit einem Jahr zu? Rein unter dem Gesichtspunkt der Flexibilität ist das Philips SpeechMike dem Olympus DR 2000 überlegen (und es stimmt: die Spracherkennung kann ich mit dem Olympus nicht einschalten - mein Fehler oder der von Olympus? Ich weiß es nicht). Was aber die Bequemlichkeit der Handhabung angeht, so kann man dem FAZ-Rezensenten nur zustimmen.

Wie dem auch sei - wir warten noch ab, bis das DR-1000 von Olympus auf dem Markt ist. Dann werde ich einen ausführlichen Vergleich aller Geräte, von Philips, Olympus und Grundig, durchführen und hier veröffentlichen. Stay tuned!

17 März 2006

CeBIT vorbei und nichts Neues?

Wirklich - im Bereich Spracherkennung und digitales Diktat habe ich auf der CeBIT nichts Neues gesehen. Das könnte aber daran liegen, dass ich die meiste Zeit am Stand gestanden habe und insofern eher Teil der Ausstellung war. Eine Erkenntnis habe ich aber gewonnen:

Pocket Dictate eignet sich nicht wirklich zur Arbeit auf einem XDA II. Nicht nur, dass es das falsche Format machte (das war meine eigene Dummheit), die Software und die Hardware vertragen sich nicht. Alle meine Aufzeichnungen konnte ich mehr oder weniger vergessen. Wenn ich aber die Auswahl habe, ein vorhandenes Profi-Diktiergerät zu nutzen oder mir einen neuen Pocket PC zu kaufen, ist für mich persönlich die Wahl klar.

Apropos Diktiergerät: das Olympus DS 660 gibt es nur noch bis zum 31. März in der vorhandenen Konzeption. Nachdem ich jetzt aber mit dem DS 4000 und meiner neuen Liebe, dem DS 3300, gearbeitet habe, weine ich persönlich dem Gerät nicht nach. Allein die Möglichkeit, Autorennamen und Arbeitsarten auf dem Diktiergerät eingeben zu können, ist für mich schon ein unschätzbarer Vorteil gegenüber dem DS 660, das das alles nicht kann.

Und wenn ich die nicht etwas Zeit habe, dann schreibe ich man etwas schönes darüber, was die Vorteile des DS 3300 gegenüber dem DS 4000 sind (oder umgekehrt - wie man's nimmt). Dieser Beitrag wurde übrigens komplett diktiert - mit Dragon NaturallySpeaking in Mozilla Firefox.

09 März 2006

Die CeBIT beginnt

... und der Autor dieser Zeilen ist vom 10.-12.3. am Stand von Nuance, Halle 1, D 88 anzutreffen. Wenn meine geschätzten Leser mich also in persona treffen wollen, so stehe ich gern zur Verfügung.

totaler Durchblicksstrudel

Der rote Pfeil auf dem Lageplan weist genau auf mich!

08 März 2006

DictaNet Mobile kostet jetzt wieder (und andere Alternativen für Pocket PC)

DictaNet Mobile hat in der letzten Zeit eine Menge Veränderungen erfahren müssen. Dies bezieht sich weniger auf die Ausstattung der Software als auch das Modell der Lizenzierung - die Preise sind Achterbahn gefahren, kürzlich kam die Meldung, dass die Software komplett kostenlos abgegeben werden sollte (der kostenlosen Download verlangte aber nach einer Lizenznummer), und jetzt hat man sich auf ein neues Modell geeinigt:

Für Privatanwender ist Dictanet Mobile unter dem Namen SoundClipper ab sofort kostenlos und kann unter www.dicta.net geladen werden. Für den gewerblichen Einsatz kostet es 28 EUR zuzüglich Mehrwertsteuer. Spracherkennungstauglich ist es leider immer noch nicht - obwohl das zumindest auf dem Pocket PC hardwaretechnisch kein Problem wäre. Aber o weh, die Abtastrate ist immer noch nicht danach.

Als Alternative teste ich gerade Pocket Dictate, einen Pocket PC-Recorder aus Australien, dessen Lizenzmodell ähnlich zu sein scheint - mindestens habe ich bis jetzt noch nicht bemerkt, dass ich irgendwo eine Registrierung vornehmen müsste, um es zu nutzen. Man hofft also auch hier auf die Ehrlichkeit der Kunden.

Was die Bedienung betrifft, ist dieser Recorder sehr viel komfortabler als der Recorder, der mit Dragon NaturallySpeaking geliefert wird (wenn auch nicht ganz so konsequent auf Tastenbedienung ausgerichtet wie der Dictanet Mobile-Recorder). Schade ist nur, dass die Aufnahmetaste anscheinend fest konfiguriert ist, und zwar für eine Taste, die bei meinem Gerät überhaupt nicht vorhanden ist. Dieses Problem hatten außer mir offenbar auch schon andere Anwender - vielleicht gibt es ja in der nächsten Version die Möglichkeit, diese Taste zu definieren. Dann wäre die Software schon fast perfekt - auch mit Spracherkennung arbeitet sie sehr gut zusammen.

06 März 2006

Beim diktieren erscheinen nur drei Fragezeichen

Re: Bei diktieren erscheinen nur drei Fragezeichen

Wer kennt dieses Problem? Eine Antwort, die mir auch noch nicht bekannt war, gibt ein Kollege im Dragon-Forum:

Welches Programm wird genutzt (Preferred od. Prof.?).
Ich hatte dies Problem auch bei der Preferred-Vers.. Es entstand, wenn die Zahl der hinzugefügten neuen Worte die maximal mögliche Anzahl erreicht hatte. Nach einem Upgrade auf Prof. trat es nicht mehr auf.


Das ist doch mal ein Argument fürs Upgrade :-)

Surfen im freien Dialog

Unter dem Titel Surfen im freien Dialog verbirgt sich ein sprachgesteuertes Interface, über das Informationen z.B. im Auto direkt aus dem Internet gezogen werden können. Beispiel:

Samstag, 17.30h: "Wie hoch hat Hertha heute verloren?"
Auto: "4:2".

Na gut, ganz so einfach geht es doch noch nicht: "Die Dialogform ist allerdings eingeschränkt – beliebige Fragen wird der Bordcomputer im Auto nicht beantworten können. Vielmehr spielt sich die Interaktion in einer Mischung aus "Push" und "Pull" ab: Sobald das Fahrzeug den Empfangsbereich eines DMB (Digital Multimedia Broadcasting)-Senders erreicht, lädt das Bordgerät die auf dessen SmartWeb-Server gespeicherte Information herunter und aktualisiert sie hin und wieder. Der Sprachdialog findet dann zwischen Fahrer und Bordgerät anhand von Menüpunkten und Unterpunkten statt." Aber ein Anfang ist es allemal. Auf der CeBIT kann man das System in Halle 9, Stand A44: Mensch-Technik-Interaktion sehen, übrigens auch die "Hirnschreibmaschine" aus meinem letzten Eintrag.

03 März 2006

Hirnschreibemaschine

Die nächste Generation in der Bedienung von Computern: die Hirnschreibemaschine. Warum sich mit Sprechen aufhalten, wenn man auch die Gedanken direkt aufzeichnen kann? Die Surrealisten hätte es in den 1920ern gefreut; heutige Surrealisten müssen sich aber noch in Geduld üben - nach Serienreife sieht es noch nicht aus. Aber interessant ist es auf jeden Fall!

02 März 2006

Pocket PC Addict Forum - Dragon Naturally Speaking for Pocket PC/Desktop Review

Eine ausführliche Besprechung von Dragon auf Desktop und Pocket PC gibt Brad Isaac in Pocket PC Addict Forum - Dragon Naturally Speaking for PPC/Desktop Review. Er arbeitet mit der US-amerikanischen Version, die sich in Einzelheiten von der deutschen unterscheiden mag. Bei aller Begeisterung für Dragon ist die Besprechung fair und geht auch auf einige Probleme (und ihre Lösungen) ein. Empfohlene Lektüre!

27 Februar 2006

Philips-Bug behoben

In den neueren Versionen der Software des Philips SpeechMike trat ein Bug auf, der dazu führte, dass beim Start der Steuerungssoftware (Control Application) kein Schema gestartet wurde. D.h. hatte man z.B. die Tasten so programmiert, dass sie Dragon NaturallySpeaking steuerten, musste man dies immer erst manuell einstellen, sonst führte ein Tastendruck ins Nichts.

In der neuen Version der Software ist dieser Fehler behoben. Das SpeechMike startet jetzt mit der Tastenkonfiguration, die als letzte gespeichert wurde.

Die Software gibt es hier zum Download (wählen Sie Ihre Version unter "Diktieren am Arbeitsplatz"). Eine Liesmich-Datei mit weiteren Informationen steht dabei.

24 Februar 2006

Neues vom Drachen

Der diesährige Nuance Productivity Summit fand am 22.und 23.2. in Köln statt. Abgesehen von einigen Irritationen, die damit verbunden waren, dass in Köln Weiberfastnacht gefeiert wurde, wartete die versammelte Händlerschar natürlich v.a. auf Neues vom Drachen, insbesondere auf die Ankündigung der Version 9 - und wurde vertröstet. Für einen konkreten Erscheinungstermin, hieß es, ist es noch zu früh.
Das neue Nuance-Team
Martin Held, der in Deutschland für die technische Entwicklung zuständig ist, stellte immerhin die Pläne für die kommende und weitere Versionen vor.

So soll es möglich werden, das selbe Sprachprofil für eine Online- und Offline (serverbasierte) Spracherkennung zu nutzen, und der Zugriff auf Roaming Users soll auch über http im Intranet (oder gar Internet? Wer's braucht) möglich sein. Im medizinischen Bereich interessant ist die Unterstützung von Citrix auf Thin Clients und das bessere Diktat in Nicht-Standardfenster, wie sie bei Klinikinformationssystemen verwendet werden.

Im Bereich der Mobilität wird auch das mp3-Format unterstützt werden (DSS dagegen ist nicht geplant); auf die neuen Headsets von Plantronics, Sennheiser und GN Netcom, die im Begleitprogramm gezeigt wurden, antwortet man mit Bluetooth- und Wireless-Unterstützung. Schließlich sollen auch mobile Endgeräte besser verwendet werden können.

Zur besseren Anwendung versucht man, auf das Benutzertraining zu verzichten, Select-and-Say besser anzuzeigen (das heißt, dass klarer werden soll, was sich direkt per Stimme ansteuern lässt); schließlich werden die Lernprogramme dahin überarbeitet, dass sie stärker auf konkrete Aufgaben zugeschnitten sind.

An Steigerung der Erkennungsrate erhofft man sich weitere 15-20%.

Dies klingt schon nicht schlecht; allerdings machte Martin Held auch sehr deutlich, wie viel es noch zu tun gibt. Anhand einer Aufnahme einer Ärztin - O-Ton! - und der strukturierten Abschrift zeigte er den Unterschied zwischen dem Gesagten und Gemeinten. Ob es dem Drachen eines Tages möglich sein wird, nicht das Gesagte, sondern das Gemeinte zu schreiben?

Der Autor dieser Zeilen mit Dragon-Distributoren

Schließlich wurde hier und in anderen Vorträgen auch angesprochen, welches Ziel sich Nuance gesetzt hat: Spracherkennung und sprachgesteuerte Bedienung in so vielen Bereichen des Lebens wie möglich einzusetzen, seien es Handys, Diktiersysteme, Autos, Computerspiele oder Call Center. Mit dem Diktat, wie es im Moment läuft, hat dies dann nicht mehr viel zu tun.