Gemini 3.5 Transcribe คือโมเดลแปลงเสียงเป็นข้อความรุ่นใหม่ของ Google ที่มาแทน Chirp 3 โดยข้อมูลที่อ้างอิงการวัดของ Artificial Analysis ระบุว่าใช้เวลาจนได้ข้อความฉบับสมบูรณ์ลดลง 70% พร้อมอัตราความคลาดเคลื่อน 4.0% ในโหม... โมเดลนี้ออกแบบมาเพื่อเปลี่ยนคำพูดที่ไม่เป็นระเบียบให้เป็นข้อความพร้อมใช้งาน ด้วยการตัดคำฟุ่มเฟือ...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Lunaรูปภาพสร้างด้วย GPT Image 1.5
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google เปิดตัว Gemini 3.5 Transcribe ในฐานะโมเดลแปลงเสียงเป็นข้อความที่ไม่ได้มีเป้าหมายเพียงถอดทุกคำตามที่ได้ยิน แต่ยังพยายามเปลี่ยนคำพูดที่ไม่เป็นระเบียบ พูดติดขัด หรือมีการเปลี่ยนประโยคกลางคัน ให้กลายเป็นข้อความที่เรียบเรียงและจัดรูปแบบพร้อมใช้งานมากขึ้น Google ระบุว่าโมเดลนี้เป็นโมเดลแปลงเสียงเป็นข้อความที่แม่นยำที่สุดของบริษัท และเป็นก้าวสำคัญจาก Chirp 3 รุ่นก่อนหน้า 1
12
ความสามารถนี้มีประโยชน์อย่างมากกับการพิมพ์ตามเสียง การจดโน้ต การเขียนข้อความ และการสั่งแก้ไขด้วยเสียง แต่ก็มีประเด็นสำคัญที่ควรเข้าใจ: ระบบที่ลบคำอย่าง “เอ่อ” หรือ “อืม” รวมประโยคที่ผู้พูดแก้ไขใหม่ และตีความว่าผู้พูดต้องการสื่ออะไร อาจสร้างงานเขียนที่อ่านดีขึ้น ขณะเดียวกันก็เก็บถ้อยคำจริงของผู้พูดไว้น้อยลง
Gemini 3.5 Transcribe พัฒนาบนแนวคิดที่ Google เรียกว่า “การถอดเสียงอัจฉริยะ” แทนที่จะถือว่าทุกคำลังเลหรือประโยคที่พูดค้างต้องถูกเก็บไว้ในผลลัพธ์สุดท้าย โมเดลสามารถลบคำฟุ่มเฟือย นำคำแก้ไขของผู้พูดมารวมเป็นประโยคที่สมบูรณ์ เติมวรรคตอน และจัดรูปแบบข้อความได้ นอกจากนี้ยังรองรับคำสั่งแก้ไขด้วยเสียง และเปลี่ยนการพูดแบบกระจัดกระจายให้เป็นร้อยแก้วที่อ่านง่ายขึ้น 1
8
12
จุดนี้ทำให้โมเดลเหมาะกับการใช้งานเสียงในชีวิตประจำวันเป็นพิเศษ ผู้ใช้สามารถพูดเป็นโน้ตสั้น ๆ หรือประโยคแบบภาษาพูด แล้วได้ข้อความที่ใกล้เคียงกับร่างข้อความ เอกสาร หรือคำตอบในแบบฟอร์มที่พร้อมนำไปใช้ต่อ
Google ยังออกแบบให้โมเดลรับมือกับเสียงรบกวน คำศัพท์ทางเทคนิค และศัพท์เฉพาะทางได้ดีขึ้น ผู้ใช้สามารถใส่คำศัพท์แบบกำหนดเอง เพื่อช่วยให้ชื่อบุคคล ชื่อผลิตภัณฑ์ หรือคำเฉพาะในแต่ละอุตสาหกรรมถูกถอดด้วยการสะกดที่ต้องการ โมเดลตรวจจับภาษาได้โดยอัตโนมัติมากกว่า 85 ภาษา 1
7
สำหรับไฟล์เสียงที่บันทึกไว้ Google ระบุว่าระบบรองรับการใส่ไทม์สแตมป์ และการแยกผู้พูดได้สูงสุด 3 คน ทำให้นักพัฒนาสามารถเชื่อมโยงแต่ละช่วงของบทถอดเสียงกับผู้พูดแต่ละรายได้ 1
Google นำเสนอ Gemini 3.5 Transcribe ว่าเป็นการปรับปรุงครั้งใหญ่จาก Chirp 3 ซึ่งเป็นโมเดลถอดเสียงก่อนหน้า ข้อมูลที่อ้างอิงการวัดของ Artificial Analysis ระบุว่า Gemini 3.5 Transcribe มีอัตราความคลาดเคลื่อนของคำอยู่ที่ 2.6% สำหรับเสียงแบบไม่สตรีมมิง และ 4.0% สำหรับเสียงแบบสตรีมมิง พร้อมลดเวลาจนได้บทถอดเสียงฉบับสมบูรณ์ลง 70% 3
4
9
อย่างไรก็ตาม ตัวเลขเหล่านี้ไม่ควรถูกมองเป็นการรับประกันประสิทธิภาพในทุกสถานการณ์ อัตราความคลาดเคลื่อนของคำขึ้นอยู่กับภาษา สำเนียง คุณภาพการบันทึก เสียงรบกวน และชุดข้อมูลที่ใช้ประเมิน ข้อมูลของ Google เองระบุผลทดสอบบน FLEURS ซึ่งพบอัตราความคลาดเคลื่อน 5.50% ในโหมดสตรีมมิง ตัวเลขนี้ไม่สามารถนำไปเทียบตรง ๆ กับผลวัดจากทุกแหล่งได้ เพราะเงื่อนไขการทดสอบแตกต่างกัน 1
ข้อสรุปในทางปฏิบัติจึงชัดเจนกว่าการยึดตัวเลขใดตัวเลขหนึ่ง: Google กำลังพัฒนาโมเดลให้มีความหน่วงต่ำลงสำหรับการโต้ตอบสด และให้ผลลัพธ์สุดท้ายที่สะอาดขึ้นสำหรับเสียงบันทึกหรือการพูดเพื่อร่างข้อความ
Google อธิบายการใช้งานโมเดลแยกตามลักษณะของแอปพลิเคชัน
ตัวเลือกแบบสดเหมาะกับแอปที่ต้องรับสตรีมเสียงต่อเนื่องและตอบสนองอย่างรวดเร็ว Gemini Live API รองรับการโต้ตอบด้วยเสียงแบบเรียลไทม์ที่มีความหน่วงต่ำ และสามารถส่งบทถอดเสียงทั้งจากเสียงของผู้ใช้และเสียงตอบกลับของโมเดลได้ 12
20
การผสานระบบลักษณะนี้อาจนำไปใช้กับผู้ช่วยเสียง คำบรรยายสด อินเทอร์เฟซสนทนา และแอปที่ต้องแสดงข้อความในขณะที่ผู้ใช้กำลังพูดอยู่ เอกสารอ้างอิง API ของ Google ยังแยกรูปแบบการเรียกใช้งานเป็นแบบ unary, streaming และ real-time สำหรับแอป Gemini ด้วย 24
สำหรับเสียงที่บันทึกไว้ นักพัฒนาสามารถอัปโหลดหรืออ้างอิงไฟล์เสียง แล้วส่งผ่านกระบวนการโต้ตอบของ Gemini API วิธีนี้เหมาะกับงานที่ต้องประมวลผลไฟล์เดิม โดยให้ความสำคัญกับไทม์สแตมป์ การจัดรูปแบบ คำศัพท์เฉพาะ และการระบุว่าใครเป็นผู้พูด มากกว่าการตอบสนองภายในเสี้ยววินาที 1
12
18
เอกสาร Gemini API ระบุว่า Interactions API เป็นอินเทอร์เฟซมาตรฐานที่แนะนำสำหรับแอป Gemini ใหม่ ส่วน Live API มีไว้สำหรับประสบการณ์เสียงและภาพแบบต่อเนื่องที่ต้องการความหน่วงต่ำ 19
20
Gemini 3.5 Transcribe ไม่ได้เป็นเพียงเทคโนโลยีที่อยู่ในช่วงสาธิตสำหรับนักพัฒนา รายงานระบุว่าโมเดลนี้ถูกนำไปใช้กับ Rambler ฟีเจอร์พิมพ์ด้วยเสียงบน Gboard ของ Android และแอป Gemini บน macOS แล้ว 2
13
26
Google ยังระบุว่าความสามารถแปลงเสียงเป็นข้อความกำลังจะมาถึง Chrome โดยผู้ใช้จะสามารถพูดเพื่อกรอกข้อความลงในช่องต่าง ๆ บนเว็บไซต์ได้ ไม่ว่าจะเป็นการตอบข้อความ เขียนโพสต์ กรอกแบบฟอร์ม หรือพิมพ์คำสั่ง แทนที่จะจำกัดการใช้งานไว้เฉพาะในแอปสำหรับพิมพ์ด้วยเสียง 1
8
13
โมเดลนี้เปิดตัวพร้อมกับ Gemini 3.5 Live และ Gemini 3.5 Live Experimental ภายใต้กลุ่มผลิตภัณฑ์เสียงที่ Google เรียกรวมว่า Gemini Audio โดย Transcribe เน้นการเปลี่ยนเสียงพูดเป็นข้อความ ขณะที่โมเดล Live มุ่งไปที่ประสบการณ์เสียงแบบโต้ตอบ 12
26
ความสามารถที่โดดเด่นที่สุดของ Gemini 3.5 Transcribe ก็เป็นข้อจำกัดสำคัญที่สุดเช่นกัน การลบคำฟุ่มเฟือยและรวมคำแก้ไขทำให้ข้อความอ่านง่ายขึ้น แต่ก็ทำให้ความสัมพันธ์ระหว่างเสียงต้นฉบับกับบทถอดเสียงเปลี่ยนไป
ผลลัพธ์ที่ผ่านการขัดเกลาอาจตัดช่วงลังเลที่มีความหมาย เก็บไว้เฉพาะประโยคที่ผู้พูดแก้ไขแล้ว หรือลดทอนลักษณะการพูดเฉพาะตัวของแต่ละคน สิ่งเหล่านี้มักเป็นข้อดีเมื่อใช้พูดเพื่อเขียนข้อความหรือจดโน้ต แต่จะเป็นข้อเสียเมื่อความถูกต้องของถ้อยคำทุกคำมีความสำคัญ
สำหรับบทสัมภาษณ์ เอกสารทางกฎหมายหรือการแพทย์ งานวิจัย เอกสารด้านการเข้าถึงสำหรับผู้พิการ หรือข้อความที่ต้องนำไปอ้างอิง ผู้ใช้ควรเก็บไฟล์เสียงต้นฉบับไว้และตรวจสอบช่วงสำคัญด้วยตนเอง หากระบบที่นำไปใช้งานไม่มีโหมดถอดเสียงแบบคำต่อคำอย่างชัดเจน Gemini 3.5 Transcribe ควรถูกมองว่าเป็นระบบถอดเสียงที่ช่วยเรียบเรียงเนื้อหา ไม่ใช่เครื่องบันทึกเสียงเป็นข้อความที่เป็นกลางและตรงตามต้นฉบับทุกคำ
การประกาศของ Google กำลังขยับเทคโนโลยีรู้จำเสียงพูดเข้าใกล้การเป็น “ผู้ช่วยเขียนด้วยเสียง” มากขึ้น Gemini 3.5 Transcribe รวมการถอดเสียงเข้ากับการลบคำฟุ่มเฟือย การจัดรูปแบบ การตรวจจับภาษา การกำหนดคำศัพท์เฉพาะ และข้อมูลผู้พูด พร้อมแยกขั้นตอนการทำงานสำหรับเสียงสดและเสียงที่บันทึกไว้ 1
12
สำหรับนักพัฒนา นี่อาจลดงานประมวลผลภายหลังจากการรู้จำเสียงได้ไม่น้อย ส่วนผู้ใช้ทั่วไปอาจรู้สึกว่าการพูดเพื่อเขียนไม่จำเป็นต้องพูดให้เป๊ะเหมือนกำลังอ่านสคริปต์ให้เครื่องฟังอีกต่อไป แค่พูดเป็นร่างคร่าว ๆ แล้วปล่อยให้ระบบช่วยเรียบเรียงก็ได้
แต่คำถามสำคัญยังไม่ใช่เพียงว่าโมเดลสร้างข้อความที่อ่านดีขึ้นได้หรือไม่ หากเป็นว่าแอปพลิเคชันแต่ละประเภทต้องการ “ข้อความที่อ่านดี” หรือ “บันทึกที่ตรงกับสิ่งที่พูดทุกคำ” กันแน่
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Gemini 3.5 Transcribe คือโมเดลแปลงเสียงเป็นข้อความรุ่นใหม่ของ Google ที่มาแทน Chirp 3 โดยข้อมูลที่อ้างอิงการวัดของ Artificial Analysis ระบุว่าใช้เวลาจนได้ข้อความฉบับสมบูรณ์ลดลง 70% พร้อมอัตราความคลาดเคลื่อน 4.0% ในโหม...
Gemini 3.5 Transcribe คือโมเดลแปลงเสียงเป็นข้อความรุ่นใหม่ของ Google ที่มาแทน Chirp 3 โดยข้อมูลที่อ้างอิงการวัดของ Artificial Analysis ระบุว่าใช้เวลาจนได้ข้อความฉบับสมบูรณ์ลดลง 70% พร้อมอัตราความคลาดเคลื่อน 4.0% ในโหม... โมเดลนี้ออกแบบมาเพื่อเปลี่ยนคำพูดที่ไม่เป็นระเบียบให้เป็นข้อความพร้อมใช้งาน ด้วยการตัดคำฟุ่มเฟือย รวมคำแก้ไขของผู้พูด จัดวรรคตอนและรูปแบบ รองรับคำศัพท์กำหนดเอง และตรวจจับภาษาได้มากกว่า 85 ภาษา
นักพัฒนาสามารถเลือกใช้การประมวลผลเสียงแบบเรียลไทม์หรือไฟล์เสียงที่บันทึกไว้ ขณะที่เทคโนโลยีนี้ถูกนำไปใช้กับฟีเจอร์พิมพ์ด้วยเสียง Rambler บน Gboard และแอป Gemini บน macOS แล้ว ส่วนการรองรับ Chrome กำลังจะตามมา
Gemini 3.5 Transcribe คือโมเดลแปลงเสียงเป็นข้อความรุ่นใหม่ของ Google ที่มาแทน Chirp 3 โดยข้อมูลที่อ้างอิงการวัดของ Artificial Analysis ระบุว่าใช้เวลาจนได้ข้อความฉบับสมบูรณ์ลดลง 70% พร้อมอัตราความคลาดเคลื่อน 4.0% ในโหม... โมเดลนี้ออกแบบมาเพื่อเปลี่ยนคำพูดที่ไม่เป็นระเบียบให้เป็นข้อความพร้อมใช้งาน ด้วยการตัดคำฟุ่มเฟือ...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Lunaรูปภาพสร้างด้วย GPT Image 1.5
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google เปิดตัว Gemini 3.5 Transcribe ในฐานะโมเดลแปลงเสียงเป็นข้อความที่ไม่ได้มีเป้าหมายเพียงถอดทุกคำตามที่ได้ยิน แต่ยังพยายามเปลี่ยนคำพูดที่ไม่เป็นระเบียบ พูดติดขัด หรือมีการเปลี่ยนประโยคกลางคัน ให้กลายเป็นข้อความที่เรียบเรียงและจัดรูปแบบพร้อมใช้งานมากขึ้น Google ระบุว่าโมเดลนี้เป็นโมเดลแปลงเสียงเป็นข้อความที่แม่นยำที่สุดของบริษัท และเป็นก้าวสำคัญจาก Chirp 3 รุ่นก่อนหน้า 1
12
ความสามารถนี้มีประโยชน์อย่างมากกับการพิมพ์ตามเสียง การจดโน้ต การเขียนข้อความ และการสั่งแก้ไขด้วยเสียง แต่ก็มีประเด็นสำคัญที่ควรเข้าใจ: ระบบที่ลบคำอย่าง “เอ่อ” หรือ “อืม” รวมประโยคที่ผู้พูดแก้ไขใหม่ และตีความว่าผู้พูดต้องการสื่ออะไร อาจสร้างงานเขียนที่อ่านดีขึ้น ขณะเดียวกันก็เก็บถ้อยคำจริงของผู้พูดไว้น้อยลง
Gemini 3.5 Transcribe พัฒนาบนแนวคิดที่ Google เรียกว่า “การถอดเสียงอัจฉริยะ” แทนที่จะถือว่าทุกคำลังเลหรือประโยคที่พูดค้างต้องถูกเก็บไว้ในผลลัพธ์สุดท้าย โมเดลสามารถลบคำฟุ่มเฟือย นำคำแก้ไขของผู้พูดมารวมเป็นประโยคที่สมบูรณ์ เติมวรรคตอน และจัดรูปแบบข้อความได้ นอกจากนี้ยังรองรับคำสั่งแก้ไขด้วยเสียง และเปลี่ยนการพูดแบบกระจัดกระจายให้เป็นร้อยแก้วที่อ่านง่ายขึ้น 1
8
12
จุดนี้ทำให้โมเดลเหมาะกับการใช้งานเสียงในชีวิตประจำวันเป็นพิเศษ ผู้ใช้สามารถพูดเป็นโน้ตสั้น ๆ หรือประโยคแบบภาษาพูด แล้วได้ข้อความที่ใกล้เคียงกับร่างข้อความ เอกสาร หรือคำตอบในแบบฟอร์มที่พร้อมนำไปใช้ต่อ
Google ยังออกแบบให้โมเดลรับมือกับเสียงรบกวน คำศัพท์ทางเทคนิค และศัพท์เฉพาะทางได้ดีขึ้น ผู้ใช้สามารถใส่คำศัพท์แบบกำหนดเอง เพื่อช่วยให้ชื่อบุคคล ชื่อผลิตภัณฑ์ หรือคำเฉพาะในแต่ละอุตสาหกรรมถูกถอดด้วยการสะกดที่ต้องการ โมเดลตรวจจับภาษาได้โดยอัตโนมัติมากกว่า 85 ภาษา 1
7
สำหรับไฟล์เสียงที่บันทึกไว้ Google ระบุว่าระบบรองรับการใส่ไทม์สแตมป์ และการแยกผู้พูดได้สูงสุด 3 คน ทำให้นักพัฒนาสามารถเชื่อมโยงแต่ละช่วงของบทถอดเสียงกับผู้พูดแต่ละรายได้ 1
Google นำเสนอ Gemini 3.5 Transcribe ว่าเป็นการปรับปรุงครั้งใหญ่จาก Chirp 3 ซึ่งเป็นโมเดลถอดเสียงก่อนหน้า ข้อมูลที่อ้างอิงการวัดของ Artificial Analysis ระบุว่า Gemini 3.5 Transcribe มีอัตราความคลาดเคลื่อนของคำอยู่ที่ 2.6% สำหรับเสียงแบบไม่สตรีมมิง และ 4.0% สำหรับเสียงแบบสตรีมมิง พร้อมลดเวลาจนได้บทถอดเสียงฉบับสมบูรณ์ลง 70% 3
4
9
อย่างไรก็ตาม ตัวเลขเหล่านี้ไม่ควรถูกมองเป็นการรับประกันประสิทธิภาพในทุกสถานการณ์ อัตราความคลาดเคลื่อนของคำขึ้นอยู่กับภาษา สำเนียง คุณภาพการบันทึก เสียงรบกวน และชุดข้อมูลที่ใช้ประเมิน ข้อมูลของ Google เองระบุผลทดสอบบน FLEURS ซึ่งพบอัตราความคลาดเคลื่อน 5.50% ในโหมดสตรีมมิง ตัวเลขนี้ไม่สามารถนำไปเทียบตรง ๆ กับผลวัดจากทุกแหล่งได้ เพราะเงื่อนไขการทดสอบแตกต่างกัน 1
ข้อสรุปในทางปฏิบัติจึงชัดเจนกว่าการยึดตัวเลขใดตัวเลขหนึ่ง: Google กำลังพัฒนาโมเดลให้มีความหน่วงต่ำลงสำหรับการโต้ตอบสด และให้ผลลัพธ์สุดท้ายที่สะอาดขึ้นสำหรับเสียงบันทึกหรือการพูดเพื่อร่างข้อความ
Google อธิบายการใช้งานโมเดลแยกตามลักษณะของแอปพลิเคชัน
ตัวเลือกแบบสดเหมาะกับแอปที่ต้องรับสตรีมเสียงต่อเนื่องและตอบสนองอย่างรวดเร็ว Gemini Live API รองรับการโต้ตอบด้วยเสียงแบบเรียลไทม์ที่มีความหน่วงต่ำ และสามารถส่งบทถอดเสียงทั้งจากเสียงของผู้ใช้และเสียงตอบกลับของโมเดลได้ 12
20
การผสานระบบลักษณะนี้อาจนำไปใช้กับผู้ช่วยเสียง คำบรรยายสด อินเทอร์เฟซสนทนา และแอปที่ต้องแสดงข้อความในขณะที่ผู้ใช้กำลังพูดอยู่ เอกสารอ้างอิง API ของ Google ยังแยกรูปแบบการเรียกใช้งานเป็นแบบ unary, streaming และ real-time สำหรับแอป Gemini ด้วย 24
สำหรับเสียงที่บันทึกไว้ นักพัฒนาสามารถอัปโหลดหรืออ้างอิงไฟล์เสียง แล้วส่งผ่านกระบวนการโต้ตอบของ Gemini API วิธีนี้เหมาะกับงานที่ต้องประมวลผลไฟล์เดิม โดยให้ความสำคัญกับไทม์สแตมป์ การจัดรูปแบบ คำศัพท์เฉพาะ และการระบุว่าใครเป็นผู้พูด มากกว่าการตอบสนองภายในเสี้ยววินาที 1
12
18
เอกสาร Gemini API ระบุว่า Interactions API เป็นอินเทอร์เฟซมาตรฐานที่แนะนำสำหรับแอป Gemini ใหม่ ส่วน Live API มีไว้สำหรับประสบการณ์เสียงและภาพแบบต่อเนื่องที่ต้องการความหน่วงต่ำ 19
20
Gemini 3.5 Transcribe ไม่ได้เป็นเพียงเทคโนโลยีที่อยู่ในช่วงสาธิตสำหรับนักพัฒนา รายงานระบุว่าโมเดลนี้ถูกนำไปใช้กับ Rambler ฟีเจอร์พิมพ์ด้วยเสียงบน Gboard ของ Android และแอป Gemini บน macOS แล้ว 2
13
26
Google ยังระบุว่าความสามารถแปลงเสียงเป็นข้อความกำลังจะมาถึง Chrome โดยผู้ใช้จะสามารถพูดเพื่อกรอกข้อความลงในช่องต่าง ๆ บนเว็บไซต์ได้ ไม่ว่าจะเป็นการตอบข้อความ เขียนโพสต์ กรอกแบบฟอร์ม หรือพิมพ์คำสั่ง แทนที่จะจำกัดการใช้งานไว้เฉพาะในแอปสำหรับพิมพ์ด้วยเสียง 1
8
13
โมเดลนี้เปิดตัวพร้อมกับ Gemini 3.5 Live และ Gemini 3.5 Live Experimental ภายใต้กลุ่มผลิตภัณฑ์เสียงที่ Google เรียกรวมว่า Gemini Audio โดย Transcribe เน้นการเปลี่ยนเสียงพูดเป็นข้อความ ขณะที่โมเดล Live มุ่งไปที่ประสบการณ์เสียงแบบโต้ตอบ 12
26
ความสามารถที่โดดเด่นที่สุดของ Gemini 3.5 Transcribe ก็เป็นข้อจำกัดสำคัญที่สุดเช่นกัน การลบคำฟุ่มเฟือยและรวมคำแก้ไขทำให้ข้อความอ่านง่ายขึ้น แต่ก็ทำให้ความสัมพันธ์ระหว่างเสียงต้นฉบับกับบทถอดเสียงเปลี่ยนไป
ผลลัพธ์ที่ผ่านการขัดเกลาอาจตัดช่วงลังเลที่มีความหมาย เก็บไว้เฉพาะประโยคที่ผู้พูดแก้ไขแล้ว หรือลดทอนลักษณะการพูดเฉพาะตัวของแต่ละคน สิ่งเหล่านี้มักเป็นข้อดีเมื่อใช้พูดเพื่อเขียนข้อความหรือจดโน้ต แต่จะเป็นข้อเสียเมื่อความถูกต้องของถ้อยคำทุกคำมีความสำคัญ
สำหรับบทสัมภาษณ์ เอกสารทางกฎหมายหรือการแพทย์ งานวิจัย เอกสารด้านการเข้าถึงสำหรับผู้พิการ หรือข้อความที่ต้องนำไปอ้างอิง ผู้ใช้ควรเก็บไฟล์เสียงต้นฉบับไว้และตรวจสอบช่วงสำคัญด้วยตนเอง หากระบบที่นำไปใช้งานไม่มีโหมดถอดเสียงแบบคำต่อคำอย่างชัดเจน Gemini 3.5 Transcribe ควรถูกมองว่าเป็นระบบถอดเสียงที่ช่วยเรียบเรียงเนื้อหา ไม่ใช่เครื่องบันทึกเสียงเป็นข้อความที่เป็นกลางและตรงตามต้นฉบับทุกคำ
การประกาศของ Google กำลังขยับเทคโนโลยีรู้จำเสียงพูดเข้าใกล้การเป็น “ผู้ช่วยเขียนด้วยเสียง” มากขึ้น Gemini 3.5 Transcribe รวมการถอดเสียงเข้ากับการลบคำฟุ่มเฟือย การจัดรูปแบบ การตรวจจับภาษา การกำหนดคำศัพท์เฉพาะ และข้อมูลผู้พูด พร้อมแยกขั้นตอนการทำงานสำหรับเสียงสดและเสียงที่บันทึกไว้ 1
12
สำหรับนักพัฒนา นี่อาจลดงานประมวลผลภายหลังจากการรู้จำเสียงได้ไม่น้อย ส่วนผู้ใช้ทั่วไปอาจรู้สึกว่าการพูดเพื่อเขียนไม่จำเป็นต้องพูดให้เป๊ะเหมือนกำลังอ่านสคริปต์ให้เครื่องฟังอีกต่อไป แค่พูดเป็นร่างคร่าว ๆ แล้วปล่อยให้ระบบช่วยเรียบเรียงก็ได้
แต่คำถามสำคัญยังไม่ใช่เพียงว่าโมเดลสร้างข้อความที่อ่านดีขึ้นได้หรือไม่ หากเป็นว่าแอปพลิเคชันแต่ละประเภทต้องการ “ข้อความที่อ่านดี” หรือ “บันทึกที่ตรงกับสิ่งที่พูดทุกคำ” กันแน่
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Gemini 3.5 Transcribe คือโมเดลแปลงเสียงเป็นข้อความรุ่นใหม่ของ Google ที่มาแทน Chirp 3 โดยข้อมูลที่อ้างอิงการวัดของ Artificial Analysis ระบุว่าใช้เวลาจนได้ข้อความฉบับสมบูรณ์ลดลง 70% พร้อมอัตราความคลาดเคลื่อน 4.0% ในโหม...
Gemini 3.5 Transcribe คือโมเดลแปลงเสียงเป็นข้อความรุ่นใหม่ของ Google ที่มาแทน Chirp 3 โดยข้อมูลที่อ้างอิงการวัดของ Artificial Analysis ระบุว่าใช้เวลาจนได้ข้อความฉบับสมบูรณ์ลดลง 70% พร้อมอัตราความคลาดเคลื่อน 4.0% ในโหม... โมเดลนี้ออกแบบมาเพื่อเปลี่ยนคำพูดที่ไม่เป็นระเบียบให้เป็นข้อความพร้อมใช้งาน ด้วยการตัดคำฟุ่มเฟือย รวมคำแก้ไขของผู้พูด จัดวรรคตอนและรูปแบบ รองรับคำศัพท์กำหนดเอง และตรวจจับภาษาได้มากกว่า 85 ภาษา
นักพัฒนาสามารถเลือกใช้การประมวลผลเสียงแบบเรียลไทม์หรือไฟล์เสียงที่บันทึกไว้ ขณะที่เทคโนโลยีนี้ถูกนำไปใช้กับฟีเจอร์พิมพ์ด้วยเสียง Rambler บน Gboard และแอป Gemini บน macOS แล้ว ส่วนการรองรับ Chrome กำลังจะตามมา