Innehåll
ElevenLabs har släppt Eleven v4, en ny generation av sina röstmodeller. Det låter som en nyhet för ljudboksbranschen och spelstudior — men den variant som faktiskt påverkar ditt företag heter Eleven v4 Turbo, och den är byggd för röstagenter som svarar i telefon i realtid.

Här går vi igenom vad som är nytt, vad som bara är marknadsföring, och vad du ska fråga innan du låter en ny röstmodell svara dina kunder.
Vad är Eleven v4?
Eleven v4 är en modellfamilj i två varianter, enligt ElevenLabs egen modelldokumentation:
- Eleven v4 — den som ger högst ljudkvalitet och störst uttrycksomfång. Den klarar upp till 10 000 tecken per anrop (ungefär tio minuters ljud) och är tänkt för ljudböcker, speaker-röster, spel och dialog med flera röster.
- Eleven v4 Turbo — realtidsvarianten. ElevenLabs anger en median på omkring 100 millisekunder i inferenslatens och rekommenderar den uttryckligen för sin agentplattform, alltså för röstagenter i kundservice och AI-assistenter.
Båda stöder över 90 språk, röstkloning som ska hålla samma röst stabil genom långa texter, och Turbo-varianten har så kallade ljudtaggar för att styra hur en replik framförs.
v3 mot v4 — sida vid sida
Den tidigare generationen, v3, är nu det ElevenLabs kallar «previous generation». Så här skiljer sig realtidsvarianterna åt enligt dokumentationen:
| v3 Conversational | v4 Turbo | |
|---|---|---|
| Språk | 70+ | 90+ |
| Latens (angiven) | ca 280 ms | ca 100 ms (median) |
| Ljudtaggar | Ja | Ja |
| Svenska | Ja | Ja |
För den icke-realtidsbaserade modellen fördubblas gränsen per anrop: från 5 000 tecken i v3 till 10 000 i v4. Det spelar roll för den som gör ljudböcker eller långa inspelningar — inte för ett telefonsamtal, där varje replik är några meningar lång.
Varför latensen spelar roll i ett samtal
I telefon märks tystnad direkt. En paus på en sekund efter att kunden slutat prata känns som att ingen lyssnar; det är då folk säger «hallå?» eller lägger på.
Det är därför siffran 280 → 100 millisekunder är intressant. Men den behöver läsas rätt: det är röstmodellens tid att börja generera ljud (latens i röstsyntesen). Den totala väntan i ett samtal består också av taligenkänning, språkmodellen som bestämmer vad som ska sägas, eventuella uppslag i en kalender och själva telefonnätet. En snabbare röstmodell kortar en del av kedjan — den gör inte hela samtalet tre gånger snabbare.
Kunden mäter inte millisekunder. Kunden märker om det känns som ett samtal eller som att vänta på en maskin.
Vårt test: så snabb är v4 på svenska
Siffror från en modellsida är en sak. Vi ville veta hur det ser ut för ett svenskt samtal, så vi mätte själva på lanseringsdagen: samma svenska mening, samma svenska röst, tre körningar per modell, från vår egen dator i Sverige.
| Modell | Första ljud (median) | Hela meningen |
|---|---|---|
| v3 Conversational (det vi kör i dag) | 162 ms | 1,7 s |
| v4 Turbo | 332 ms | 1,9 s |
| v4 (vanliga) | 934 ms | 4,0 s |
| Flash v2.5 | 202 ms | 0,4 s |
Resultatet gick alltså åt andra hållet mot vad lanseringen lovar:
- v4 Turbo var långsammare än v3 i vårt test — ungefär dubbelt så lång tid till första ljud. Enskilda körningar låg mellan 324 och 476 ms, klart över de siffror ElevenLabs själva anger.
- Vanliga v4 passar inte i telefon. Nästan en sekund innan första ljudet hörs är för länge i ett samtal — men den är inte heller byggd för realtid, utan för inspelat ljud.
- Flash v2.5 var snabbast på hela meningen. Den är en äldre och enklare modell som prioriterar fart framför uttryck.
Två förbehåll, för att vara rättvisa mot v4 Turbo: vi mätte på lanseringsdagen, när trafiken mot en ny modell brukar vara hög, och vi mätte via vanlig strömmande text-till-tal — inte via samma koppling som en röstagent använder i ett samtal. Siffrorna säger alltså hur modellerna står sig mot varandra, inte exakt hur lång pausen blir för den som ringer.
Slutsatsen för svenska samtal just nu: v3 är fortfarande snabbast av de uttrycksfulla modellerna. Nyare betyder inte automatiskt bättre i telefonen.
Och svenskan?
Svenska finns med i språklistan för både v3 och v4, och v4 stöder fler språk totalt. Men fart är bara halva bilden — att ett språk «stöds» säger inget om hur det låter på just ett svenskt telefonsamtal. Det som brukar skilja bra från dåligt är vardagliga saker:
- Uttalar den gatuadresser och ortnamn rätt — Mölndal, Hägersten, Järfälla?
- Läser den upp telefonnummer, datum och klockslag som en svensk skulle säga dem?
- Håller den sig till svenska när kunden blandar in ett engelskt ord?
- Låter den lika bra genom telefonnätets smalare ljud som i en demo i hörlurar?
Inget av det framgår av en modellsida. Det måste höras på riktiga samtal — lyssna på hur Menodi låter i riktiga samtal.
Vad det betyder för Menodi
Menodis AI-receptionist körs i dag på ElevenLabs v3-generation för realtidssamtal, och efter vårt test blir det så tills vidare. v4 Turbo är den naturliga efterträdaren, och vi mäter igen när den nya modellen har satt sig. Men ett byte av röstmodell är en ändring i hur varje kunds telefon låter, och det behandlar vi som vilken annan ändring i agenten som helst:
- Mäts och testas på svenska först — fart, men också adresser, nummer, tider och namn, inte bara en demofras.
- Människa lyssnar och granskar innan något går skarpt på ett kundnummer.
- Du behåller ditt nummer — Menodi arbetar med vidarekoppling, så en modelluppgradering kräver ingenting av dig.
Det är poängen med en tjänst i stället för ett eget bygge: du ska inte behöva läsa modellsidor för att din telefon ska låta bättre nästa år.
Frågor att ställa till din leverantör
- Vilken röstmodell svarar mina kunder med i dag? Ett tydligt svar är ett gott tecken.
- Hur testas ett modellbyte på svenska innan det slås på?
- Kan jag höra ett riktigt samtal — med adress och telefonnummer — i stället för en inspelad demo?
- Vad händer om den nya modellen låter sämre för just min bransch? Går det att backa?
Nya röstmodeller kommer att fortsätta släppas i snabb takt. Det som avgör om kunden bokar är inte versionsnumret, utan att någon svarar — snabbt, på bra svenska och med rätt fakta om ditt företag. Väger du fortfarande alternativen? Jämför AI-receptionist, telefonsvarare och svarstjänst.
Hör hur en AI-receptionist låter på svenska
Menodi svarar dina samtal dygnet runt, håller sig till era fakta och bokar in jobbet. Hör själv i en kort demo.
Boka demo