Колко много мразите да пишете? Появата на големите езикови модели бързо разви технологията за преобразуване на глас в текст. Независимо дали става въпрос за Wispr Flow, който се присъединява към вашите срещи, за да обобщава дискусиите, или за Google, който дебютира с по-интелигентно диктуване на устройството в най-новия си смартфон Pixel, тези инструменти правят много повече от това просто да транскрибират: те интелигентно премахват излишните думи, изчистват нережисираните мисли в движение и безпроблемно посредничат при многоезични разговори.

Сега нов стартъп навлиза в борбата. За разлика от своите колеги, фокусирани върху софтуера, Relay изгражда специализиран, преносим микрофон за висококачествено преобразуване на глас в текст навсякъде. Базирана в Лондон, компанията Relay е основана от двама бивки служители на Nothing: Куки Сю, която е била ръководител на отдела за изкуствен интелект и услуги в Nothing, и Реймънд Джу, хардуерен продуктов мениджър. Въпреки че днес компанията дебютира със своя софтуер, хардуерът – това, което те наричат Relay Q – няма да бъде наличен до началото на 2027 г.

Джу споделя, че когато двамата със Сю са работили в Nothing, са използвали софтуера за транскрипция на Wispr Flow, за да „пишат“ по-голямата част от съобщенията си на работа. Той казва, че това значително е помогнало за обмислянето на идеи, но постоянно са се сблъсквали с един проблем: говоренето на висок глас в офис.

„В офиса никога не успявахме да намерим правилната сила на звука за въвеждане“, споделя Джу пред WIRED. „Ако шепна твърде тихо, Mac-ът не можеше да го улови; твърде силно и колегата до мен можеше да ме чуе. Понякога буквално изваждах слушалката си и правех така“, казва той по време на видеоразговор, държейки слушалка пред устата си, за да демонстрира. „Това изисква специализиран хардуер.“

При стартирането си Relay е ексклузивен за macOS, въпреки че компанията има планове да го пренесе за Windows, iOS и Android. Започва се с десктоп версията, тъй като Джу вярва, че разговорите там са най-сложни. Чатовете с приятели и семейство са лесни на телефоните, но на работа пред компютъра споделяте идеи, обмисляте проекти и използвате различен тон и нива на формалност.

Въпреки че до готовността на микрофона остават още месеци, аз използвам бета версия на приложението на Relay за macOS, което работи със или без специализирания микрофон.

По време на настройката ще трябва да изберете бърз клавиш, който да задейства Relay във всяко текстово поле – по подразбиране това е Fn. Натиснете и задръжте клавиша, докато курсорът ви е в някое текстово поле, и Relay се активира и поема гласовото диктуване. Системата за преобразуване на глас в текст се захранва от моделите Gemini на Google.

Той също така може да извършва контекстни действия – наречени умения (Skills) – като например да го помолите да изпрати съобщение до колега в Slack, което кара Relay да стартира приложението, да намери получателя и да подготви чернова на текста. Имах известни затруднения с това умение за Slack, въпреки че софтуерът нямаше проблем със създаването на събитие в календара на Google Calendar. Relay има някои предварително зададени умения, които можете да активирате за популярни приложения каквито са WhatsApp и Gmail, но можете да създавате и свои собствени и да свързвате други приложения.

Тази автоматизация изисква широки системни разрешения. Relay се нуждае достъп до вашия микрофон, но можете също така да му дадете достъп за записване на екранна снимка по всяко време, когато е активиран, което е начинът да изпълнява тези умения. Компанията твърди, че съхранява данните локално на устройството на потребителя, където те могат ръчно да ги редактират или изтриват. Когато данните се изпращат за обработка, те преминават през сървърите на Relay по пътя към сървърите на Google, но Relay не ги запазва. Въпреки това, предоставянето на поглед на AI моделите върху вашата операционна система носи присъщи компромиси с поверителността и сигурността, подобно на функцията Recall на Microsoft.

Транскрипцията на Relay не е толкова впечатляваща, колкото тази, която наскоро изпробвах с функцията Rambler на Google в серията Pixel 11. Тя не улавя перфектно всяка дума и понякога може да сгреши пунктуацията. Също така може да разбере кога сте сгрешили при говорене и да преформулира изреченията, премахвайки маловажните части. И да, може да вмъква емоджита вместо вас, макар че по време на тестовете ми правеше това непоследователно. Например, когато я помолих да добави сърце емоджи, тя го направи безупречно. Но когато се опитах да го прикача в края на изречението, тя просто изписа „heart emoji“ (емоджи сърце). Колко романтично.

Като цяло софтуерът разбира кога искате да извърши действие, което е отделно от съобщението. Например изпратих съобщение чрез Relay до съпругата си, че наистина искам да хапна в определен ресторант, и на същия дъх помолих Relay да предостави линк в Google Maps към мястото – и той го направи. Това обаче понякога може да бъде малко несигурно. Ще го отдам на бета версията.

Не съм го използвал достатъчно дълго, за да може софтуерът да се адаптира към моя начин на говорене, но можете да добавяте бележки в приложението Relay, за да го накарате да следва определени шаблони. Например рядко завършвам изречение с точка в съобщенията си в Slack, така че му казах да избягва добавянето на точки и то последва правилото. Има голяма доза персонализация за конкретни хора, с които разговаряте редовно (което системата разпознава), така че можете да се уверите, че съобщенията ви до шефа звучат професионално, докато съобщенията до приятелите ви са непринудени. Или дори можете да го настроите така, че съобщенията до колега, живеещ в друга държава, да се превеждат на неговия език.

Разчитам на Mac Mini и микрофона в...