Textnizer - Vodič

Izdvojite tekst iz govora, snimki zaslona i datoteka. Podržava prepoznavanje glasa u stvarnom vremenu, OCR snimki zaslona i skupnu obradu audio, video, slikovnih i PDF datoteka.


Početak rada

Odaberite jedan od tri načina rada na glavnom zaslonu:

  1. Live Transcription — pretvaranje govora u tekst u stvarnom vremenu s mikrofona
  2. Capture Transcription — OCR sa snimki zaslona ili kamere
  3. File Transcription — skupna obrada audio, video, slikovnih ili PDF datoteka

Live Transcription

Prepoznavanje govora u stvarnom vremenu s mikrofona ili audio ulaznog uređaja.

Pogoni za govor

PogonVrstaNajbolji za
Google SpeechOnline APIVisoka točnost, mnogo jezika (zadano)
WhisperLokalni modelOffline upotreba, privatnost (modeli od tiny do large)
VoskOfflineLagan, brz, mnogo jezika

Mogućnosti snimanja

  • Odabir audio ulaznog uređaja
  • Audio Format: MP3 ili WAV
  • Audio Quality: low / medium / high
  • Neobavezno snimanje videa s pretpregledom kamere
  • Neobavezna Speaker Classification (prepoznaje različite govornike)

Capture Transcription

Izdvojite tekst iz snimki zaslona ili snimki kamere pomoću OCR-a.

  • Camera capture — odaberite uređaj kamere, snimite jedan kadar
  • Full screen capture — snimite cijeli zaslon
  • Region selection — nacrtajte pravokutnik za snimanje određenog područja
  • Window capture — snimite određeni prozor

OCR pogon: Tesseract (zadano japanski). Rezultati se prikazuju uz snimljenu sliku.


File Transcription

Obrađujte datoteke skupno povlačenjem i ispuštanjem ili pomoću preglednika datoteka.

Podržani formati

VrstaFormatiMetoda
AudioMP3, WAV, M4A, FLAC, AAC, OGG, WMAPogon za govor
VideoMP4, AVI, MOV, MKV, WMV, FLVIzdvajanje zvuka → pogon za govor
SlikaJPG, PNG, BMP, TIFF, GIFTesseract OCR
DokumentPDFStranica → slika → OCR

Workset History

  • Svaka sesija transkripcije sprema se kao workset
  • Filtrirajte po ključnoj riječi, vrsti (Live/Capture/File) i statusu
  • Dvostruko kliknite za ponovno otvaranje prethodne sesije
  • Stupci za sortiranje: naziv, vrsta, metoda, datum, status

Postavke

PostavkaOpisZadano
Recognition ModelZadani pogon za govorGoogle
Audio FormatFormat snimanjaWAV
Audio QualityRazina kompresijeMedium
Video CaptureOmogući snimanje s kamereOff
Speaker ClassificationIdentifikacija različitih govornikaOff

Savjeti

  • Offline transkripcija — Koristite Whisper ili Vosk za potpuno offline prepoznavanje govora
  • Bilješke sa sastanaka — Omogućite Speaker Classification za razlikovanje tko je što rekao
  • Skupni OCR — Ispustite cijelu mapu skeniranih dokumenata za skupnu obradu
  • Izdvajanje PDF-a — Svaka stranica PDF-a pretvara se u sliku i OCR obrađuje pojedinačno

Privatnost

  • Pogoni Whisper i Vosk rade u potpunosti na vašem uređaju
  • Google Speech šalje audio na poslužitelje Googlea radi prepoznavanja
  • Svi rezultati transkripcije i snimke pohranjuju se samo na vašem lokalnom disku
  • Bez analitike ili praćenja