Kiadta a Google a Gemini 3.5 Transcribe nevű modelljét, amely akár három beszélő szövegét is képes pontosan leiratozni, a beszélők változását pedig időbélyeggel jelzi.
Új audiomodellt mutatott be a Google. A Gemini 3.5 Transcribe nevű mesterséges intelligencia fő erőssége, mint a nevéből is sejthető, a szöveget átírása, amely a cég szerint továbbfejlesztett beszédfelismerő algoritmust használ a kiejtett szavak pontosabb és jobb megértése érdekében.A Google azt állítja, hogy a modell képes a felhasználó „strukturálatlan beszédét” formázott szöveggé alakítani. Emellett használható hangparancsokkal történő szerkesztésre is, a leiratozás során pedig eltávolítja a töltelékszavakat.A Google szerint a modell képes megtanulni az egyéni szókincset és az egyedi írásmódokat is, emellett pedig pontosan rögzít alfanumerikus karakterláncokat. Ez utóbbi például akkor lehet hasznos, ha egy cég rendelések fogadására, a telefonos ügyfélszolgálat megerősítésére használja az AI-t: a rendelési számok vagy az irányítószámok rögzítése sokkal pontosabb lesz. https://x.com/Google/status/2092659280604205090A cég azt állítja, a Gemini 3.5 Transcribe akár három ember beszédét is képes egy időben leírni, amelyekhez időbélyeget is használ. Ez rendkívül hasznos lehet, ha valaki például egy podcast leiratát akarja elkészíteni.A Google azt ígéri, a fejlesztés szövegfelolvasó funkcióját hamarosan bármely weboldalon használni lehet majd a Chrome-ban, emellett pedig a válaszokat le lehet majd diktálni – például egy weboldal kommentmezőjénél.A megoldás hamarosan elérhetővé válik, a fejlesztők pedig hozzáférhetnek majd a modellhez, hogy testreszabják azt.Ha máskor is tudni szeretne hasonló dolgokról, lájkolja a HVG Tech rovatának Facebook-oldalát.











