Faktisk live: dine talerør til vores egen AI, mens du taler
Mens du optager, siden skærer mikrofonen stream i korte segmenter! et par sekunder hver, skære adaptivt så den næste skibe det øjeblik, den foregående kommer tilbage ! og rører hver lige til vores GPU-servere, hvor den samme Whisper-klasse model, der magter hele webstedet transcribes det straks. Teksten lander i de levende feed sekunder bag din stemme og holder flyder så længe du holder taler. Ingen browser tale service, ingen tredjeparts diktation API! den live tekst er ægte Whisper output fra vores egen hardware.
Fordi det kun har brug for mikrofon optagelse, live-mode fungerer i hver moderne browser! Chrome, Edge, Safari, og Firefox, desktop og telefon. Hver lyd segment er slettet fra vores servere i det øjeblik dens tekst kommer tilbage.
Det levende foder vs den endelige udskrift
Segment-by-segment transskription har en indbygget grænse: modellen ser et par sekunder ad gangen, så et ord, der strækker to segmenter kan komme ud klippet, og tegnsætning på tværs segment grænser er gætteri. Det er derfor strømmen slutter med et andet trin: den fulde optagelse holdes i din browser, mens du taler, og trykke på Transcribe kører det gennem modellen som en enkelt tage ~ fuld kontekst, korrekt tegnsætning, tidsstempler, editoren, og TXT/SRT / VTT eksport.
Brug live- feed til at bekræfte at det holder op og at få fat i tekst i det øjeblik det tales (der er en kopi- knap på feedet); brug det endelige pass for noget du vil beholde. For lyd du allerede har som en fil, upload tilstand på ethvert værktøj side er den kortere sti.
Ofte stillede spørgsmål
Er det virkelig live, eller optaget og sendt bagefter?
Faktisk live: optagelse og transskription overlapper. Siden sender hvert par sekunders stykke lyd til vores GPU'er, mens du stadig taler den næste, så tekst akkumuleres under optagelsen, ikke efter det. Forvent feedet til at køre en håndfuld sekunder bag din stemme! den tid det tager en skive at afslutte, uploade og transskribere.
Hvorfor er der en live sms et par sekunder bag mig?
Tre små forsinkelser stakke op: en skive skal slutte bliver optaget (tre sekunder eller deromkring), rejse til serveren, og passere gennem modellen. Det normalt sætter foderet omkring 4-8 sekunder bag din stemme ! og hvis vores GPU'er er kort optaget, siden tilpasser sig ved at sende lidt længere skiver i stedet for at falde bag. Naturlig tale med pauser føles glat.
Hvilke browsere arbejder live mode i?
Alle moderne dem ~ Chrome, Edge, Safari, og Firefox, på skrivebordet og telefoner. Det er baseret på standard mikrofon optagelse snarere end en browser taletjeneste, så det virker i Firefox lige så godt som i Chrome.
Hvor går min stemme hen, mens levende transskription kører?
Til vores servere kun, og ærligt beskrevet: live-tilstand streamer din lyd til os i korte segmenter, som du taler! det er, hvad der gør det live ! og hvert segment slettes straks efter sin tekst kommer tilbage. Intet går til Google, Apple, eller enhver tredjeparts tale service. Den fulde optagelse forbliver i din browser, indtil du trykker på Transskriber, og anonyme udskrifter auto-delete inden for 24 timer.
Kan jeg bruge det til at følge et møde eller foredrag i rummet?
Som en personlig hjælp, ja! sætte enheden nær højttaleren og feed spor klar tale godt, omkring ti sekunder bag. Kend grænserne: en mikrofon, så fjerne stemmer og crosstalk nedbryde det, og det er ikke en certificeret billedtekstering service for tilgængelighed overholdelse. Tryk Transcribe i slutningen og fuld-kontekst pass normalt inddriver, hvad den live foder fumlede.
Hvilke sprog arbejder live, og skal jeg vælge et?
De samme 90+ sprog som hver transkription på dette websted ! det er den samme model. Et tip specifikt for live-mode: vælge dit sprog i vælgeren i stedet for at forlade auto-detect on. Detection kører per segment, og syv sekunder er ikke meget bevis, så pinning sproget holder foderet fra vaklende på korte eller accent sætninger.