Patiesībā dzīvot: jūsu runas caurules mūsu pašu AI, kamēr jūs runājat
Kamēr jūs reģistrējat, lapa sagriež mikrofona plūsmu īsos segmentos — dažas sekundes katru, sagriež adaptīvi, lai nākamais viens kuģi brīdī, kad iepriekšējā nāk atpakaļ — un caurules katru taisni uz mūsu GPU serveriem, kur pats Whisper klases modelis, kas var visu vietni tranratēt to nekavējoties. Teksts nolaiž dzīvās padeves sekundes aiz jūsu balss un turpina plūst tik ilgi, kamēr jūs turpināt runāt. Nav pārlūka runas pakalpojumu, neviena trešās puses diktācija API — tiešraidē teksts ir reāla Whisper izejas no mūsu pašu aparatūras.
Tā kā tam ir nepieciešams tikai mikrofona ieraksts, tiešraides režīms darbojas katrā modernajā pārlūkprogrammā — Chrome, Edge, Safari un Firefox, darbvirsma un tālrunis. Katrs audio segments tiek dzēsts no mūsu serveriem, kad nāk tā teksts.
Dzīvās barības pret galīgo transkriptu
Segmenta-pa-segment transkripcija ir viens iebūvēts limits: modelis redz dažas sekundes laikā, tāpēc vārds, ka straiders divi segmenti var izgriezt, un pieturas pāri segmenta robežas ir spēlfilma. Tāpēc plūsma beidzas ar vienu soli: pilna ierakstīšana tiek saglabāta jūsu pārlūkprogrammā, kamēr jūs runājat, un nospiežot Trancrat darbojas to caur modeli kā vienu pārņem — pilns konteksts, pareizu pieturas, timestamp, redaktors, un TXT/SRT/VTT eksports.
Izmantojiet dzīvo barību, lai apstiprinātu, ka tas tur un lai satvertu tekstu brīdī, kad tas ir runājis (ir kopiju poga uz barības); izmantojiet galīgo caurlaidi par visu, ko jūs turat. Attiecībā uz audio jums jau ir kā failu, augšupielādes režīms jebkurā rīku lapā ir īsāks ceļš.
Bieži uzdotie jautājumi
Vai tas patiesībā ir dzīvs, vai arī ierakstīts un nosūtīts pēc tam?
Patiesībā tie ir dzīvi: ierakstīt un pārraidīt. Lapas katru pāris sekunžu griezumu mūsu GPU uzpilda, kamēr jūs joprojām runājat par nākamo, tāpēc teksts uzkrājas ieraksta laikā, nevis pēc tā. Iecerēt, ka padeve palaisties nedaudz sekundes aiz jūsu balsis — laiks, kad tas aizņem griezumu, lai pabeigtu, augšupielādētu un transkripciju.
Kāpēc šis teksts ir dažas sekundes aiz manis?
Trīs nelielas kavēšanās kaudze uz augšu: šķēle ir pabeigts tiek ierakstīts (trīs sekundes vai tā), ceļot uz serveri, un iet caur modeli. Tas parasti liek barības apmēram 4-8 sekundes aiz jūsu balsi — un, ja mūsu GPU ir īsi aizņemts, lapa pielāgo, sūtot nedaudz garākas šķēles nevis atpaliek. Dabas runa ar pauzi jūtas gluda.
Kurās pārlūkprogrammās darbojas dzīvais režīms?
Visi modernie — Chrome, Edge, Safari un Firefox – ir balstīti uz standarta mikrofona ierakstīšanu, nevis uz pārlūkprogrammas runas pakalpojumu, tāpēc tas darbojas Firefox, kā arī Chrome.
Kur paliek mana balss, kamēr notiek transkripcija?
Mūsu serveriem, un godīgi aprakstīti: dzīvā režīma plūsmas jūsu audio mums īsos segmentos, kā jūs runājat — tas ir tas, kas padara to dzīvu — un katrs segments tiek dzēsts uzreiz pēc tā teksta nāk atpakaļ. Nekas iet uz Google, Apple, vai jebkuras trešās puses runas pakalpojumu. Pilna ierakstīšana paliek jūsu pārlūkprogrammā, līdz jūs nospiediet Atšifrēt, un anonīmi transkripti auto-delet 24 stundu laikā.
Vai es varu to izmantot, lai sekotu tikšanās vai lekcijai telpā?
Kā personīga palīdzība, jā — novietojiet ierīci blakus skaļrunim un barības celiņiem, labi izrunājiet runu, aptuveni desmit sekundes aiz tās. Ziniet robežas: viens mikrofons, tik tālu balsis un krustpunkts to noārda, un tas nav sertificēts aprakstošs pakalpojums pieejamības ievērošanai. Preses atšifrēšana beigās un pilna konteksta caurlaide parasti atgūst to, ko dzīvā barība fumbled.
Kuras valodas darbojas, un vai man vajadzētu izvēlēties vienu?
Tas pats 90+ valodas, kā katru transkripciju šajā vietnē — tas ir tas pats modelis. Viens padoms īpašs uz dzīvo režīmu: izvēlēties savu valodu selektors, nevis atstāt auto-noteikt. Detection notiek uz segmentu, un septiņas sekundes nav daudz pierādījumu, tāpēc ping valodu saglabā barību no wangring uz īsu vai izceltu frāzes.