23 Januar 2012

Ein frohes neues Jahr des Drachen!

Heute beginnt das chinesische neue Jahr. 2012 steht im Zeichen des Drachen. Nach chinesischer Sitte ist dies ein gutes Jahr für Geschäfte. Kinder, die im Jahre des Drachen geboren werden, erwartet Gesundheit, Reichtum und Weisheit.



Ich wünsche ein gesundes, erfolgreiches, mit Weisheit angefülltes Neues Jahr!

19 Januar 2012

Patentantrag: Dauernde Verbesserung der Spracherkennung

Über Rüdiger Wilke kam ich an den Link zum Patentantrag für ein System zur kontinuierlichen Verbesserung der Erkennungsleistung von Spracherkennungssoftware während des Diktats. Diese Technologie ist in neueren Versionen von Dragon NaturallySpeaking bereits eingebaut und wird unter dem Namen „SilentAdapt“ vermarktet.

Der Patentantrag beschreibt sowohl die allgemeine Funktionsweise von Spracherkennung wie auch die kontinuierliche Anpassung des Systems an den Sprecher, die dafür sorgt, dass auch ohne ein anfängliches Training Spracherkennung sehr schnell mit sehr guten Resultaten möglich sein kann. Eine vollständige Übersetzung spare ich mir hier aus offenkundigen Gründen. Einige wesentliche Funktionsweisen lassen sich so darstellen:

Spracherkennung bearbeitet ein akustisches Signal (die aufgenommene Sprache), indem das Signal zunächst in kurze Einheiten zerlegt wird. Diese werden mit einem Inventar von Lauten der betreffenden Sprache abgeglichen und aufgrund von Transformationsmodellen einem oder mehreren möglichen Kandidaten für die Erkennung (also Wörtern) zugewiesen. Der wahrscheinlichste Kandidat ist das Wort, welches letztlich im Text erscheint.

Ein anfängliches Training ist in der Regel nötig, um das in der Software bereits enthaltene akustische Modell einer Sprache mit der tatsächlichen Aussprache eines Sprechers abzugleichen. Dazu wird die Aussprache des Sprechers analysiert und Transformationsregeln bestimmt, nach denen diese Aussprache in das in der Software enthaltene Modell umgerechnet wird. Was Dragon also tut, ist zum Beispiel eine extrem tiefe Stimme „höher“ zu rechnen, oder eine extrem hohe Stimme „tiefer“ usw., um den tatsächlichen Input mit dem kompatibel zu machen, was die Software sozusagen als Input erwartet.

Während des Vorlesens eines Trainingstextes werden Daten gesammelt, die anschließend diese Anpassung möglich machen. Das hier referenzierte Patent beschreibt, dass diese Anpassung auch während des Diktates, also ohne vorheriges Training, gemacht werden kann.

Dazu werden die Äußerungen des Sprechers während des Diktates analysiert und zur Adaption herangezogen. Dieser Mechanismus nennt sich Online Unsupervised Feature space Adaptation (OUFA), die Transformation des ankommenden Signals zur Adaption basiert auf einer Constrained Maximum Likelihood Linear Regression (CMLLR) adaptation. Entsprechend dieser Algorithmen wird das Eingangssignal transformiert und zur Verbesserung der Erkennungsgenauigkeit, also zur Erhöhung der statistischen Trefferquote des richtigen Kandidaten, herangezogen.

Ein weiteres Einsatzgebiet ist die in Dragon NaturallySpeaking enthaltene „akustische Optimierung“, bei der, basierend auf den während des Diktats gesammelten Informationen, das Sprecherprofil noch einmal in einem eigenen Prozess angepasst wird, der auf denselben Algorithmen beruht wie die kontinuierliche Anpassung während des Diktats.

Zu dieser akustischen Optimierung macht der Patentantrag eine für mich überraschende Aussage: unter Absatz [0032] folgt auf die Beschreibung der Mechanismen zur akustischen Optimierung der Hinweis: „it is possible that this might lead to a decrease in accuracy“. Auf die Gefahr hin, dass ich die technische Beschreibung nicht korrekt verstanden habe, stellen sich mir dann 2 Fragen:

1. wenn das Profil bereits während des Diktates angepasst wird, wozu muss dann eine nachträgliche akustische Optimierung noch sein?
2. wenn diese akustische Optimierung zu einer verschlechterten Erkennungsgenauigkeit führen kann, sollte man dann nicht darauf verzichten?

Sicherlich gibt es hierauf keine eindeutige Antwort, da sehr viel auch von der Qualität des Input abhängt. Die Beschreibung gibt allerdings eine Antwort auf ein Phänomen, welches wir immer wieder beobachtet haben, nämlich dass nicht nur nach einer akustischen Optimierung, sondern auch nach einigen Monaten des Diktats die Spracherkennung in der Qualität wieder abnimmt. Dies scheint also offensichtlich im System eingebaut zu sein.

Praktische Empfehlung daher:

Trainieren Sie Ihren Benutzer auf ein möglichst hohes Niveau und speichern Sie ihn dann an einem sicheren Ort ab. Nimmt die Erkennungsgenauigkeit irgendwann ab, haben Sie bereits einen fertig trainierten Benutzer, auf den Sie dann zurückgreifen können.

12 Januar 2012

Nuance-Neuheiten auf der CES

Der junge Mann im Bild ist der Dragon Guy, welcher derzeit die CES in Las Vegas unsicher macht (Bild getwittert von P. Mahoney, Oberster Drachenkämpfer bei Nuance).

Nuance zeigt dort neue mobile Lösungen. So ist mit Dragon Go! eine neue Android-App erschienen, die viele der von Siri bekannten Funktionen für Android nutzbar macht. Dragon Go! findet z.B. Restaurants, Musik, Wettervorhersagen, Suchergebnisse (von Wolfram Alpha), und was man sonst noch unterwegs auf seinem Smartphone braucht. Unter nuancemobilelife.com werden die in den USA bereits erhältlichen Apps vorgestellt. Und auch ein Dragon TV ist dabei - das scheint ja the next big thing zu werden...

10 Januar 2012

CES zeigt Sprachsteuerung für Fernseher und Xbox

Die in die Gestensteuerung Kinect neu integrierte Sprachsteuerung für die Microsoft Xbox ist eigentlich gar nicht mehr neu. Bei Steve Ballmers Abschiedsvorstellung auf der diesjährigen CES (Consumer Electronics Show) in Las Vegas sorgte aber die Ankündigung für Aufsehen, dass Kinect inklusive Sprachsteuerung in Windows 8 integriert werden soll.

LG hat derweil zumindest in den USA Google TV auf seinen Fernsehern integriert und will die Fernbedienung um eine Sprachsteuerung ergänzen. Im Hinblick auf die Gerüchte um den mit Siri versehenen Apple-Fernseher ist das wohl auch eine gute Strategie.

Ergänzung 11.1.: Auch Lenovo stellt einen Fernseher vor, der Android 4 und eine Spracherkennung integriert, aber zunächst nur in China auf den Markt kommt.

Auch der Knowbrainer, der größte Anbieter von Spracherkennung in den USA und Betreiber des besten Online.-Forumes, nimmt übrigens an der CES teil, oder in den Worten seiner aktuellen Signatur,
I will be handcuffed to the KnowBrainer Booth 70005 at the Las Vegas Consumer Electronics Show Jan 10-13.
Dies in der Kategorie "Emerging Technologies" - aber doch nicht mit seit Jahren hervorragend eingeführten Produkten?

02 Januar 2012

Pause vor Befehlen erhöhen – Korrektur beschleunigen!

Allen Leserinnen und Lesern ein gesundes und erfolgreiches neues Jahr 2012!

Seit Erscheinen der Version 11 von Dragon NaturallySpeaking tauchen in einigen Konstellationen Schwierigkeiten mit Latenzen auf, das heißt mit Verzögerungen in der Niederschrift des Diktates und in der Ausführung von Befehlen. Während einige dieser Probleme mit der 11.5 behoben worden, macht insbesondere das Buchstabierfenster immer noch Probleme – zwar nicht überall, aber doch immer wieder kommt es vor, dass bei einer Korrektur das Buchstabierfenster einzufrieren scheint, wieder Diktat noch Tastatureingabe annimmt, bis nach einer gefühlt unendlichen Wartezeit endlich die Korrektur gemacht werden kann.

Abhilfe scheint eine kleine Veränderung in den Dragon-Einstellungen zu schaffen – dies legt zumindest eine Diskussion im Knowbrainer-Forum nahe.

Erhöht man unter „Optionen – Befehle“ die Pause vor Befehlen minimal von 250 auf 300 ms, schiebt also den Regler ein kleines Stück weiter nach rechts bis zum nächsten Strich, so scheinen diese Latenzen behoben zu sein.

Warum? Keiner weiß es. Probieren Sie aus, ob es hilft – Feedback ist in diesem Falle besonders willkommen, da ich normalerweise keine Schwierigkeiten mit den Latenzen habe, und daher zur Bestätigung auf die Mitarbeit meiner geneigten Leser angewiesen bin.

30 Dezember 2011

Dragon Recorder App jetzt auf Deutsch erhältlich

Die vor einigen Wochen angekündigte Dragon Recorder App für das iPhone ist seit kurzem auch auf Deutsch erhältlich und kann im AppStore heruntergeladen werden.

Die App macht es möglich, das iPhone wie ein digitales Diktiergerät zu benutzen, Diktate aufzusprechen, abzuhören, zu ergänzen und schließlich an den Rechner zu senden, wo sie von der Spracherkennung umgesetzt werden können. Inwieweit es möglich ist, auch Passagen in eine Diktat einzufügen, habe ich noch nicht herausfinden können.

Die Übertragung geschieht über WLAN oder über iTunes.

Ein Video zur Bedienung gibt es bisher nur auf Englisch. Die Erklärung ist sehr kleinschrittig gehalten und gut verständlich.

28 Dezember 2011

Apple-Fernseher mit Sprachsteuerung?

Digitimes hört das Gras wachsen: im nächsten Jahr soll ein Fernseher aus dem Hause Apple auf den Markt kommen. Ob der dann Fernsehen und Internet vermählt? Oder iTunes zur endgültig größten Videothek der Welt macht?

Spiegel Online vermutet auf jeden Fall schon Siri zur Bedienung. "Siri, heute abend will ich Dr. House sehen, aber ich komme erst um 22h nach Hause. Zeichnest du mir die Folge auf?"

Also das iPhone versteht so was... meistens. Gestern ausprobiert.

22 Dezember 2011

Nuance will Vlingo übernehmen

Wie heute bei Heise und in einer Nuance-Pressemitteilung zu lesen ist, bereitet Nuance die Übernahme des Spezialisten für mobile Spracherkennung, Vlingo, vor. Vlingo bietet einen Siri-ähnlichen sprachgestützten Assistenten für verschiedene mobile Geräte, z.B. BlackBerry, Androiden und Windows-gestützte Handys an.

Nuance-Technologie ist ja schon in Siri enthalten, wenn dies auch nicht an die große Glocke gehängt wird. Mit der angekündigten Übernahme wird Nuance versuchen, auch auf Smartphones seine marktbeherrschende Stellung zurückzuerobern bzw. auszubauen (je nachdem, aus welchem Blickwinkel man die aktuellen Technologien sieht).

Die Pressemitteilung ist da ganz eindeutig: nachdem in den letzten Monaten die Nachfrage nach Sprachsteuerung sprunghaft gestiegen ist (Hallo Siri!), sieht man einen Markt in der Größenordnung von 5 Milliarden $ für die Sprachsteuerung von Smartphones, Tablet PCs, Musik-Abspielgeräten, Navigationssystem usw. Die bewährte Strategie von Nuance ist, Anbieter von solchen Technologien aufzukaufen und die Technologie entweder in eigene Produkte einzubauen oder die Produkte gleich mit zu übernehmen.

5 Milliarden $ finde ich allerdings schon eine Hausnummer. Nuance geht offensichtlich davon aus, dass jetzt endlich die soziale Akzeptanz da ist, mobile Geräte, Computer usw. per Sprache zu steuern. Auch hier war Apple wieder Vorreiter.

Eigentlich merkwürdig, dass trotz hartnäckiger Bemühungen Spracherkennung und Sprachsteuerung am PC seit vielen Jahren ein Nischendasein fristet. Hat Nuance nicht laut genug verbreitet, welche Möglichkeiten Dragon NaturallySpeaking schon seit langem bietet, ist die Firma einfach nicht cool genug, oder liegt es am Ende doch an der Qualität des Produktes? Wir erinnern uns an die Reklamen von vor 12 Jahren, als die 1. Spracherkennungssysteme für Privatkunden auf den Markt kamen mit der Versprechungen, man könne ab sofort Tastatur und Maus verbrennen. Davon sind wir immer noch weit entfernt (und das wird auch so bleiben). Seitdem hat die Spracherkennung am Computer ein massives Imageproblem, und das völlig ohne Not: Dragon NaturallySpeaking kann den Computer komplett ohne Handy steuern, und auch die seit Windows Vista ins Betriebssystem eingebaute Spracherkennung hat in dieser Beziehung Maßstäbe gesetzt, die nur leider am Publikum völlig vorbeigegangen sind.

Und das sogar bei Anwendern, die eine Sprachsteuerung bitter nötig hätten. Vor ein paar Wochen habe ich noch mit einem Dragon NaturallySpeaking-Händler telefoniert, der Körperbehinderte ausstattet und berichtet, dass ein Großteil seiner Kunden sich weigert, den Computer per Sprachbefehl zu steuern, obwohl es viel einfacher für sie wäre…

Wenn Siri, Majel oder wer auch immer hier etwas bewirken, ist schon eine Menge erreicht.

15 Dezember 2011

Androiden und Drachen...

... im heutigen Netzwelt-Ticker von Spiegel Online.

Dass Google an einer Sprachsteuerung für Androiden-Handys arbeitet, die über das bisherige hinausgeht, ist eigentlich kein Geheimnis. Der Spiegel berichtet jetzt einige weitere Details über das "Majel" genannte Projekt, und natürlich tritt Google an, besser zu sein als Siri. Mal abwarten.

Auch Nuance arbeitet an einem vergleichbaren Produkt, Details dazu sind aber noch nicht bekannt.

Um aber endlich wieder einmal über unseren geliebten kleinen Drachen berichten zu können, kommt der Netzwelt-Ticker gerade recht: die 2. Meldung zeigt einen ebensolchen, der versucht, virtuelle Ameisen von einem Smartphone zu fressen. Klicken Sie sich durch oder schauen Sie sich einfach das Video hier an:



So viel zum Thema "Dragon auf Smartphones"!

07 Dezember 2011

Spracherkennung als Lügendetektor?

Spiegel online stellt heute eine neue Technologie vor, mit der Spracherkennung zur Identifikation von Emotion der Sprecher genutzt werden kann. Angeblich ist es aufgrund sprachlicher Muster bereits mit 70-prozentiger Wahrscheinlichkeit möglich, z.B. einer Aussage als Lüge zu entlarven – Menschen können das nur in ungefähr 57% der Fälle.

Außer als Lügendetektor lässt sich die Spracherkennung auch einsetzen, um in automatischen Benutzerdialogen festzustellen, ob ein Kunde glücklich oder genervt ist.

Soviel zum Thema Anthropomorphisierung...

FAZ über Siri

Nachdem bereits Spiegel online vor einigen Tagen einen ausführlichen Bericht über Siri, die neue Spracherkennung im iPhone, gebracht hat, jetzt auch ein ausführlicher Bericht in der FAZ (Technik und Motor, 06.12.2011). Autor ist wie immer Dr. Michael Spehr, der Spracherkennungsexperte der Frankfurter Allgemeinen Zeitung. (Artikel im Blog von Michael Spehr lesen)

Seiner Meinung nach liegt die wichtigste Neuerung von Siri in der engen Verzahnung der Spracherkennung mit dem Betriebssystem, die dafür sorgt, dass der Computer Anweisungen, die er per Sprache erhält, sofort umsetzen kann, ohne dass der Benutzer noch eingreifen muss. Das funktioniert deshalb, weil es auf dem iPhone praktisch keine Auswahlmöglichkeiten gibt, in welchem Programm der Befehl umgesetzt werden muss – ein Kalendereintrag greift immer auf denselben Kalender zu und hat nicht die Auswahl zwischen Outlook, dem Google-Kalender Kalender oder Lotus Notes; eine Websuche nutzt immer den Standard-Browser und die voreingestellte Suchmaschine Wolfram Alpha, die wiederum in der Lage ist, strukturierte Anfragen zu verarbeiten und zu beantworten. Damit ändert sich grundlegend die Interaktion des Nutzers mit dem Computer. Michael Spehr sieht solche Änderungen auch schon für Desktop-Computer voraus und prophezeit:

„Die Frage ist nicht mehr, ob und wie gut die Technik funktioniert, sondern ob man gewillt ist, in aller Öffentlichkeit oder zumindest im Büro mit seinem iPhone zu sprechen. Es geht allein um die soziale Akzeptanz. Wer die Idee für abstrus hält, denke zurück an eine Bürowelt ohne Telefone im 19. Jahrhundert.“

In der Tat scheint die soziale Akzeptanz, glaubt man zumindest den zahlreichen Kommentaren in diversen Foren, das entscheidende Kriterium zu werden. Noch immer können sich viele nicht vorstellen, unterwegs – also vor aller Augen der Öffentlichkeit – „mit ihrem Handy zu sprechen“. Obwohl sie natürlich schon seit vielen Jahren in aller Öffentlichkeit in ihr Handy sprechen und private Details vor den Ohren einer ganzen U-Bahn ausbreiten, aber das scheint etwas anderes zu sein.

Das Schlüsselwort ist tatsächlich „Anthropomorphisierung“. Schon das Diktat in einem Computer sorgt dafür, dass man ihm menschliche Eigenschaften zuschreibt (wie oft benutze ich eigentlich die Phrase „liebenswerte Eigenheiten unseres kleinen Drachen“?); Wenn die Maschine dann auch noch antwortet wie ein Mensch, verschwimmen die Unterschiede immer weiter. Neben der sozialen Akzeptanz stellt sich daher auch noch eine ethische Dimension. Wollen wir wirklich mit der Maschine umgehen wie mit einem Menschen? Dass auch hier die Kategorien bisweilen verrutschen, zeigt sich bei (fast) allen Hundebesitzern...

Aktuelle neue Fehlermeldung: Benutzerprofil kann nicht geöffnet werden

In den letzten Tagen häufen sich bei mir die Anfragen, dass ein Benutzerprofil, welches bisher vollkommen unschuldig vor sich hin gearbeitet hat, nicht mehr geöffnet werden kann.

Es scheint so, als sei dieses auf ein neues Windows-Update zurückzuführen. Dieses sorgt dafür, dass Benutzer (also unter Windows mit der Rolle „Benutzer“ angemeldete Anwender) keinen Zugriff mehr auf die Speicherorte haben, in denen Dragon NaturallySpeaking die Benutzerprofile lokal ablegt.

Abhilfe schafft hier folgendes:

Gehen Sie über den Windows Explorer in den Ordner C:\Program Data\Nuance\ und markieren Sie dort den Ordner „NaturallySpeaking11“. Machen sie einen Rechtsklick auf den Ordner und wählen Sie „Eigenschaften“ und dann „Sicherheit – Bearbeiten“. Geben Sie den Benutzern Vollzugriff auf diesen Ordner und bestätigen Sie alles mit O.K. Danach lässt sich das Benutzerprofil wieder öffnen.

Angegebene Dateipfade für Windows 7; unter Windows XP scheint das Problem nicht aufzutreten.

02 Dezember 2011

Philips Dictation hat eine neue Website

Philips kündigt die neue Website für seine Diktierprodukte an. Sie ist erreichbar unter http://www.dictation.philips.com/de/home/

Die alte Website ist offenbar schon vom Netz gegangen, jedenfalls kann ich sie nicht mehr aufrufen. (Hallo Philips: eine Umleitung wäre schön gewesen!)

Alles ist sehr viel farbenfroher geworden, aber auch übersichtlich und leicht zu navigieren. Etwas stutzen musste ich beim Produktsupport, weil dort zunächst eine komplette Übersicht aller Produkte angezeigt wird – klickt man aber auf das gewünschte Produkt, erhält man dort alles, was man braucht, in einer praktischen Übersicht.

Ein schicker Relaunch der Seite meiner bevorzugten Diktierhardware.

29 November 2011

Sascha Lobo macht sich Gedanken über Siri

Blogger Sascha Lobo macht sich auf Spiegel Online Gedanken über Siri, die Spracherkennung im neuen iPhone.

Tenor:
Spracherkennung ist der Nachfolger sozialer Netzwerke. Kontexterkennung erschafft einen Markt, vergleichbar mit dem Suchmaschinenmarkt.

Spracherkennung ist nur die Basis, um Informationen durch Einbezug des Kontextes (wer spricht? wo? welche Informationen sind schon bekannt?) zu verknüpfen. Während das eine sehr attraktive Technologie ist, bildet sie gleichzeitig ein sehr hohes vertriebliches Potential - lies: einen weiteren wesentlichen Schritt auf dem Wege zu immer genauerer Werbung.

16 November 2011

Dragon Recorder für iPhone

Die Palette der Anwendungen, die Nuance für das iPhone bereitstellt, ist um einen Recorder ergänzt worden, der das iPhone effektiv in ein digitales Diktiergerät verwandelt. Mit der Dragon Recorder App nehmen Sie auf dem iPhone Diktate auf, senden sie über iTunes oder WLAN an den PC oder Mac (mit MacScribe-Software) und lassen Sie dort mit Dragon NaturallySpeaking bzw. MacScribe transkribieren.

Aufnahmeformat ist WAV. Die drahtlose Übertragung funktioniert dann, wenn sich iPhone und Rechner im selben WLAN befinden.

Die App ist kostenlos im Appstore zu haben. Benötigte Software auf dem Rechner ist nach Aussage von Nuance Dragon 11.5 Premium, Professional oder Legal. bzw. auf einem Mac MacScribe. (DragonDictate für Mac enthält derzeit noch keine Umsetzungsfunktion für digitale Diktate.) Da die Diktate im WAV-Format vorliegen, sollte die Versionsnummer keine große Rolle spielen. Zwar wird das iPhone als Quelle erst ab Version 11.5 akzeptiert – für andere Versionen gibt es aber immer noch die Möglichkeit, „Audiodateien auf Festplatte“ als Quelle anzugeben. Somit dürfte auch Dragon Medical 11 kein Problem sein.

Hier ein englisches Video, in dem die Funktionsweise demonstriert wird, hier die Ankündigung auf der amerikanischen und der deutschen Nuance-Webseite.

15 November 2011

Siri ausführlich

Apples neue Spracheingabe fürs iPhone, Siri, wird von www.cio.de ausführlich getestet und besprochen.

Siri stellt die bisher verfügbaren Lösungen deutlich in den Schatten und zeigt, wie effektiv eine Sprachsteuerung sein kann, wenn man es richtig macht. Das iPhone hat in einigen Bereichen Maßstäbe gesetzt, zum Beispiel bei der Bedienung mittels Touchscreen oder bei der Nutzung des Internet am Smartphone. Auch Siri könnte ein solcher Meilenstein werden. Die Software befindet sich noch im Betastadium, leistet aber teilweise schon Erstaunliches.

Siri ist fast schon eine Sekretärin in der Tasche, die auch komplexe Anfragen und Aufgaben erledigt und bei Bedarf die nötigen Rückfragen stellt. Außerdem erlaubt sie Diktat per Spracherkennung direkt in Anwendungen auf dem iPhone - kein Umweg mehr nötig wie bei der Dragon-App.

Der Dienst läuft immer noch auf Apples Servern. Für wen das ein Sicherheitsproblem darstellt - denken Sie ein paar Sekunden darüber nach, was Ihr iPhone und damit Apple, Google & Co. ohnehin schon über Sie wissen...

14 November 2011

Amazon kauft Startup für Spracherkennung

Heise berichtet, dass Amazon das Startup Yap, welches bisher einen Dienst zur Transkription von Voicemail in Text angeboten hat, übernommen hat. Der Dienst ist zwischenzeitlich eingestellt worden.

Vermutlich macht Amazon es genauso wie Google vor einiger Zeit und kauft einen Anbieter von Spracherkennungs-Dienstleistungen auf, um diese in seine eigenen Produkte zu integrieren. Der Amazon Kindle Fire, der in den nächsten Tagen in den USA startet, ist ja mehr als ein reines Lesegerät und dürfte dem iPad gehörig Konkurrenz machen. Da wird auch ein Dienst ähnlich wie Siri dem Gerät gut zu Gesicht stehen.

Nuance arbeitet derweil selbst an einem ähnlichen Dienst, der sich aber im Moment noch im Planungsstadium befindet. Siri wird ja inzwischen sogar im Werbefernsehen beworben. Es ist doch nicht etwa der Punkt erreicht, an dem sich Spracherkennung tatsächlich in der Masse durchsetzt?

10 November 2011

Olympus vor dem Ende?

Seit eingen Tagen häufen sich die Meldungen, die japanische Firma Olympus habe mit kreativer Buchführung Milliardenverluste kaschiert. Der neue, europäische Chef, der die Unstimmigkeiten in den Bilanzen publik gemacht hat, wurde gegangen; der alte musste sich in japanischer Art entschuldigen und ist inzwischen zurückgetreten. Der Aktienwert des Traditionsunternehmens ist auf ein Fünftel geschrumpft.

Während Olympus hierzulande vor allem als Hersteller von Kameras bekannt ist, macht das Unternehmen den meisten Umsatz mit Medizintechnik und gehört zu den Großen Drei bei den digitalen Diktiergeräten. Das Olympus DS-5000 ist seit Jahren eines der hochwertigsten Diktiergeräte auf dem Markt, und das alte DS-330 war zu seiner Zeit das digitale Diktiergerät mit dem absolut besten Preis-Leistungs-Verhältnis. Mit Philips und Grundig zusammen hat Olympus den DSS-Standard (Digital Speech Standard), eine Art MP3 für Sprache, entwickelt, der digitale Diktate in hoher Qualität auf ein handhabbares Maß komprimiert.

Spiegel Online berichtet über "Falsche Bilanzen" bei Olympus.

12 Oktober 2011

iPhone 4S mit Siri-Sprachsteuerung

Das neue iPhone 4S, das in den nächsten Tagen auf den Markt kommt, verfügt über einen "Siri" genannten Sprachassistenten, der Steuerung der Geräts, Suchen und auch Diktat erlaubt. (Zur Erinnerung: Apple hatte Siri vor einiger Zeit gekauft.) Die Spracheingabe dürfte zu den spektakuläreren Neuerungen gehören, da sie nicht mehr als App geladen wird wie das hinlänglich besprochene Dragon Dictate für iPhone, sondern fest im Betriebssystem verdrahtet ist. Die meisten Beprechungen, die ich bisher gelesen habe, erwähnen sie auch an prominenter Stelle; jedoch scheint den Rezensenten am wichtigsten zu sein, dass das neue Gerät immer noch so aussieht wie das alte - Apple verkauft halt über Design.

Eingehend bespricht Siri der Heise-Bericht über das iPhone 4S. Dort gibt es auch ein Video: Siri in Aktion in lauter Umgebung.

M. Spehr von der FAZ hat Siri im Auto ausprobiert. Sein Fazit in faz.net:

Die Erkennung ist deutlich leistungsfähiger als das Pendant von Nuance mit der Dragon-Dictation-App, obwohl die Software vermutlich von Nuance stammt... Siri ... ist großartig.

Wie Dragon Dictate auch findet die Siri-Erkennung auf einem Remote-Server statt. Zu allfälligen Sicherheitsbedenken will ich mich hier nicht verbreiten - nur: wer Spracheingabe in der Öffentlichkeit nutzt, hat genug Mithörer, auch ohne sich über Spionageserver Gedanken machen zu müssen.

Sprachbefehle besser nutzen mit der Dragon-Randleiste (Sidebar)

Die Dragon-Randleiste gibt es schon lange. Früher öffnete der Befehl "Was kann ich sagen" einen schlicht gestalteten Kasten mit den wesentlichen Befehlen für die gerade aktive Anwendung; seit Version 11 ist die Randleiste optisch auffälliger gestaltet und enthält mehrere Kategorien, u.a. die selbst erstellten Befehle. Nuance hat jetzt eine Umfrage (englisch) gestartet, ob und wie die Anwender von Dragon NaturallySpeaking die Randleiste nutzen. Nehmen Sie teil!

Sie kennen die Sidebar gar nicht? Über das Menü "Extras - Optionen - weitere Einstellungen können Sie sie einblenden. Ich empfehle, sie "frei beweglich" zu halten. Das geht durch Rechtsklick auf die Randleiste; im sich öffnenden Menü können Sie die Position auswählen.

Praktisch ist die Dragon-Randleiste auch für alle, die eigene Befehle programmiert haben: über die Registerkarte "Eigene Befehle" können Sie sich alle selbst programmierten Befehle anzeigen lassen. Auch wer von seinem Dragon NaturallySpeaking-Händler Steuerungsbefehle für seine Anwendungen erhalten hat, kann diese hier einsehen.

Und weil man selbst ja auch immer wieder Neues entdeckt, fand ich in der Randleiste eine Liste der Befehle, mit der sich die Maus per Sprache bewegen lässt. Dies ist sicherlich nicht für alle interessant, aber wer in der Bewegung seiner Hand eingeschränkt ist oder (wie ich) gelegentlich Schmerzen beim Mausschubsen hat, findet diese vielleicht ganz hilfreich.

Dabei ist übrigens noch zu ergänzen, dass man in vielen Programmen die Programmmenüs und Schaltflächen per Sprache ansprechen kann, indem man einfach „klick“ und dann den Namen der Schaltfläche sagt. Dies funktioniert z.B. in Microsoft Word und Outlook, aber auch in Mozilla Firefox.

Genauso lassen sich alle installierten Anwendungen per Sprachbefehl öffnen, indem man „öffne“ und dann den Namen der Anwendung sagt, und zwar so, wie er im Windows-Startmenü eingetragen ist. Gängige Microsoft Office-Anwendungen kann man auch einfach mit ihrem Kurznamen aufrufen, also z.B. „öffne Microsoft Word“. Einfach ausprobieren!

Ach so: man schließt die Dragon-Randleiste über den Befehl „Randleiste schließen“.