Sobre IA i agents de veu

Com sona un agent de veu IA? Naturalitat, veu i el que els teus pacients realment noten

· 12 min de lectura
cómo suena un agente de voz IA

Fa dies que li dones voltes. El preu no et bloqueja. La LOPD tampoc, perquè ja has llegit un parell d’articles i has vist que és compliment normal. El que et frena és una altra cosa, més visceral: com sonarà el meu agent de veu IA quan una pacient li truqui?

I al darrere de la pregunta n’hi ha una altra, la de veritat: què pensaran els meus pacients de mi quan s’adonin que qui ha contestat no era una persona?

És una pregunta legítima, i mereix una resposta honesta. No la que et donarà un venedor. La que et donaria una amiga que ja hi ha passat.

La pregunta que et fas està mal plantejada

La pregunta habitual és: «Sonarà com una persona?»

I la resposta habitual —la que et donen als vídeos comercials, als webinars i a les demos preparades— és: «Sí, no es nota.»

No et creguis del tot cap de les dues.

Sí es nota, sovint. Encara que la veu sigui bona, hi ha detalls (petites pauses, entonació lleugerament diferent, respostes una mica més estructurades del que faria una persona) que un pacient atent identifica en trenta segons. Especialment si ho està buscant, i cada cop hi ha més gent que ho busca.

I això no és el problema.

El problema és que estàs comparant l’agent de veu IA amb el que no tens: una recepcionista amb quinze anys d’experiència a la teva consulta, que coneix cada pacient pel nom, que sap el teu horari de memòria i que respon com respondries tu.

La comparació de veritat és una altra. La comparació de veritat és amb el que ara mateix passa a la teva consulta quan sona el telèfon i estàs en visita:

  • No contestes.
  • Salta el contestador («Gràcies per trucar, deixi’ns un missatge…»).
  • Contestes el mòbil personal amb una mà mentre amb l’altra estàs traient les agulles a un pacient, i qualsevol de les dues parts se’n ressent.
  • La trucada perduda es converteix en la trucada al següent professional de Google.

En aquesta comparació —la real, la que passa cada dia— la pregunta «sonarà com una persona?» perd força. La que compta és una altra: «la meva pacient prefereix una IA que li respon amb calma i li deixa una cita, o un contestador que li diu que deixi missatge?»

En la immensa majoria de casos, la resposta és la primera. I si no ho creus, pregunta-t’ho tu mateix: quan trucaves ahir a la clínica del cotxe i et va contestar una veu automatitzada que et va donar cita en menys d’un minut, t’hi vas quedar o vas penjar?

Què vol dir de veritat «sonar bé»

Deixem la pregunta «sona com una persona» i posem-ne una millor: què fa que un agent de veu IA soni bé?

Perquè «bé» no vol dir «humà». Vol dir cinc coses molt concretes que pots avaluar a la primera trucada de prova, i que és el que la teva pacient nota (sovint sense saber que ho està notant):

1. Ritme calmat

Un agent que es precipita fa la sensació que «no t’està escoltant». Un que dona un mig segon de marge després que la persona acabi de parlar fa la sensació contrària: que hi ha algú que ha rebut el que has dit.

El ritme calmat és, probablement, l’element que més contribueix a la sensació de «professional que sap el que fa». Curiosament, no és una característica humana en si — és una característica d’una persona que domina la seva feina. I es pot dissenyar.

2. Pauses que respiren

Un agent que no fa pauses sona a àudio pregravat. Un que fa pauses en els llocs on una persona en faria (després d’una pregunta important, quan reformula el que ha dit la trucant, quan dona una dada rellevant) sona a conversa.

Aquestes pauses no són «temps mort»: són espai per pensar. La teva pacient no vol una màquina que li respongui abans d’acabar la frase; vol una que sembli que està processant el que ha dit.

3. Entonació que respecta el sentit

Les entonacions planes (totes les frases pujant o baixant igual) són el marcador més ràpid de «aquesta veu no ha entès el que ha dit». Un agent modern varia l’entonació segons el que està dient: puja lleugerament a la pregunta, baixa a la confirmació, marca amb pes les paraules importants («primera visita», «dilluns a les cinc», «no és una urgència real»).

No cal que soni com un actor. Cal que soni com una persona que sap el que està dient.

4. No interrompre

Aquest és un dels elements més fàcils de detectar en 20 segons de trucada. Un agent que interromp quan la persona encara no ha acabat de parlar és insuportable, i és el marcador més ràpid de «aquí no m’escolten». Els agents ben dissenyats esperen. Els mal dissenyats no.

Si estàs provant un agent per contractar, aquest és el primer indicador: què passa quan comences una frase, fas una pausa curta i encara no has acabat. Si l’agent salta a parlar en aquesta pausa, no cal que continuïs la prova.

5. Admetre honestament el que no sap

Aquest és el més contraintuïtiu i el més important. Un agent que inventa —que dona un preu que no existeix, que confirma una cita que no pot confirmar, que respon a una pregunta clínica per no quedar malament— fa mal molt més gran que un agent que digui «aquesta pregunta te la respondrà millor la doctora quan la vegis; t’agendo la cita i n’hi parles?«

Un bon agent té un límit clar i el diu. Un dolent, quan no sap, s’inventa. La naturalitat de veritat no és no equivocar-se; és saber dir «no ho sé».

Cinc senyals d’alarma: senyals que un agent sona malament

Si estàs provant un agent —el nostre o el de qualsevol altre proveïdor—, aquestes són les cinc coses que et delaten un producte a evitar. En una trucada de prova de tres minuts es detecten totes.

Senyal 1: respostes automàtiques que no toquen la pregunta. Preguntes «què val una primera visita per lumbàlgia?» i et respon amb un llistat de tots els preus de tots els serveis. No ha escoltat la pregunta; ha detectat la paraula «preu» i ha llançat el guió.

Senyal 2: insistència. Vols acabar la trucada i l’agent segueix intentant que agendis. O li dius «no, gràcies, m’ho penso» i l’agent respon amb tres arguments seguits per convèncer-te. Aquest agent no està dissenyat per atendre: està dissenyat per vendre. En una consulta sanitària, això és inacceptable.

Senyal 3: entonació completament plana. Cada frase amb la mateixa cadència. Cap paraula amb pes. Sona a «audiollibre llegit per un programa antic». Els agents moderns tenen prou variació entonacional per no caure aquí. Si el que estàs provant hi cau, encara està usant tecnologia de fa dos anys.

Senyal 4: resposta massa ràpida, sense marge d’escolta. Acabes de parlar i mig segon després ja té resposta. Semblaria bo, però no ho és: fa la sensació d’algú que «estava esperant a què acabessis per llançar el següent bloc de guió». Un agent ben dissenyat espera una mica més, com faria una persona pensant.

Senyal 5: promesa exagerada. L’agent diu «és clar, la doctora et curarà» o «et confirmo que amb aquesta pauta el problema desapareixerà». Aquest agent no ha estat dissenyat per una consulta sanitària. Aquest agent ha estat dissenyat per una centraleta de televenda i li han canviat les paraules per damunt. A la teva consulta cap agent ha de prometre resultats clínics. Mai.

El que el pacient realment nota (spoiler: menys del que et penses)

Anem al que et preocupava des del principi: què pensaran els meus pacients?

Basat en el que t’expliquen les consultes que ja porten mesos amb un agent de veu IA:

Un percentatge nota alguna cosa. No sempre identifiquen «és una IA» — sovint diuen «hi ha alguna cosa una mica formal» o «sonava com un servei d’atenció al client». Però ho registren.

Un percentatge no nota res. Especialment els pacients que ja han trucat a serveis d’atenció automatitzats en altres contextos (bancs, companyies elèctriques, cites mèdiques públiques): el filtre «no és una persona amb qui parlar de casa meva» el tenen ja assumit i el gestionen sense pensar-hi.

Un percentatge ho pregunta directament. «Ets una persona?» Un agent honest respon la veritat: «soc una assistent virtual de la consulta; si necessites parlar amb la doctora, te la passo dilluns o et pot trucar ella si em deixes un número«. Aquesta resposta és molt millor que fingir. Els pacients ho valoren.

I aquí ve el que la immensa majoria de professionals descobreixen quan porten dos mesos amb l’agent en marxa: el que els queda malament als pacients no és que sigui una IA. És perdre la trucada.

Perdre la trucada un divendres a les set. Perdre la trucada mentre estava en visita. Perdre la trucada dissabte al matí quan el pacient s’havia decidit finalment a demanar hora. Aquestes són les pèrdues que et cremen la reputació silenciosament, no un pacient que ha detectat que qui li ha contestat era un agent virtual i li ha deixat la cita ben apuntada al calendari.

Sis preguntes per avaluar la naturalitat de qualsevol agent (proveïdor)

Si estàs a punt de contractar un agent de veu IA —a nosaltres o a qualsevol altre proveïdor—, aquestes són les sis preguntes a fer abans de signar. Cap d’elles té una resposta acceptable «ja ho veuràs quan el provis«. Si el proveïdor no et respon amb concreció, tens un problema abans de començar.

Pregunta 1: puc trucar-lo jo abans de contractar? Sí o no. Si no, no continues.

Pregunta 2: puc dissenyar amb tu el que ha de dir davant d’una persona angoixada, o només puc pujar dades? (Aquesta és la diferència entre «informació» i «comportament» que va explicar aquest article sobre assistents barats de configuració ràpida. Si el proveïdor només et deixa carregar un FAQ, no és el que necessites per una consulta.)

Pregunta 3: què fa quan no sap alguna cosa? La resposta bona és «deriva o admet que no sap«. La resposta mala és «intenta respondre com pot«. Si el proveïdor diu la segona, no és per tu.

Pregunta 4: interromp o espera? Prova-ho tu. Fes una pausa d’un segon i mig al mig d’una frase. Si l’agent salta, ho tens vist.

Pregunta 5: puc escoltar 3 o 4 trucades reals de clients seus, amb el seu permís? El proveïdor seriós les té. Si diu «no en tenim» o «és confidencial» per a tot, prova a fer números.

Pregunta 6: què passa si un pacient em pregunta si és una IA? Ha de tenir una resposta clara, honesta i escrita — no un «bé, això depèn«.

Aquestes sis preguntes serveixen per a qualsevol proveïdor. Nosaltres inclosos.

On encaixem nosaltres

A SomAgents dissenyem el comportament del teu agent de veu, no només l’omplim d’informació. Anayda porta vint anys treballant en gestió de conflictes i conducta —dissenyar com es comporta una persona en una interacció humana difícil és el seu ofici— i això es tradueix en el guió del teu agent: el ritme, les pauses, l’ordre de les preguntes, com respon quan algú està angoixat, com admet el que no sap, com deriva quan és una urgència real. La veu sintètica és una part del paquet, i escollim les que sonen millor per a català i castellà a Catalunya; la part més important, però, és el que l’agent fa durant els tres o quatre minuts que dura la conversa amb la teva pacient.

Si vols escoltar-ho tu mateix abans de decidir, aquí pots parlar amb la nostra agent demo i comprovar les cinc coses que fan que soni bé i les cinc que farien que sonés malament — a la conversa real, no en un vídeo preparat. I si vols entendre el detall de què pots contractar i a quin preu, tot està a la pàgina de paquets i a la comparativa de preus de recepcionista virtual.

Veure els paquets: https://somagents.com/ca/preus/

Preguntes freqüents

El meu pacient s’adonarà que és una IA?

Alguns sí, alguns no, alguns ho preguntaran directament. El punt honest és que importa menys del que et penses. El que et cremaria la reputació de veritat és perdre trucades, no que hagin detectat que qui ha respost era un agent virtual que els ha atès amb calma i els ha deixat una cita.

La veu pot sonar en català natural, no traduït?

Sí. Les veus modernes tenen models entrenats en català nadiu, amb prosòdia catalana i vocabulari propi. Que la veu sigui «en català natural» és una cosa diferent de la comprensió bilingüe, que ja vam tractar a aquest article sobre atenció bilingüe. Abans de signar, escolta’t tu mateix un fragment en català real i no una demo en castellà «traduïda».

Si un pacient està plorant, l’agent l’atendrà com una persona?

No l’atendrà com una persona, i és honest dir-ho. L’atendrà amb calma, amb un ritme baix, sense pressa i, quan detecti que la persona no està en condicions de tramitar una cita, derivarà a la professional o donarà els telèfons d’emergència pertinents (024 per conducta suïcida, 016 per violència de gènere, 112 per urgències vitals). El que no farà mai és fingir contenció emocional que no pot donar. Aquesta línia clara és, sovint, el que fa que l’agent sigui millor que un contestador que diu «gràcies, deixi missatge» en aquell moment concret.

📘 Guia gratuïta: si vols anar un pas més enllà, descarrega’t la nostra guia «Com omplir l’agenda de la teva clínica sense perdre ni una trucada» — els moments en què s’escapen les trucades, trucs per aplicar avui i com tancar-ho del tot. La tens aquí: https://somagents.com/guia-clinicas/

Vols veure-ho per a la teva consulta?

SomAgents fa la part del telèfon. Tu, la teva feina. Sense compromís per fer la primera passa.

Veure els paquets Trucada gratuïta, sense compromís