เอกสารประกอบสำหรับการดำเนินการด้านเสียงใน node OpenAI ใน n8n ซึ่งเป็นแพลตฟอร์มอัตโนมัติของ workflow รวมรายละเอียดการดำเนินการและการกำหนดค่า และลิงก์ไปยังตัวอย่างและข้อมูลประจำตัว
ใช้การดำเนินการนี้เพื่อสร้างเสียง หรือถอดเสียงหรือแปลการบันทึกใน OpenAI อ้างถึง OpenAI สำหรับข้อมูลเพิ่มเติมเกี่ยวกับ node OpenAI
สร้างเสียง
ใช้การดำเนินการนี้เพื่อสร้างเสียงจากข้อความแจ้ง
ป้อน parameter เหล่านี้:
- Credential to connect with : สร้างหรือเลือกที่มีอยู่ OpenAI credentials.
- Resource : เลือก Audio.
- Operation : เลือก Generate Audio.
- Model : เลือกรุ่นที่คุณต้องการใช้เพื่อสร้างเสียง อ้างถึง ทีทีเอส | OpenAI สำหรับข้อมูลเพิ่มเติม
- TTS-1 : ใช้ตัวเลือกนี้เพื่อปรับความเร็วให้เหมาะสม
- TTS-1-HD : ใช้ตัวเลือกนี้เพื่อปรับคุณภาพให้เหมาะสม
- Text Input : ป้อนข้อความเพื่อสร้างเสียง ความยาวสูงสุดคือ 4096 อักขระ
- Voice : เลือกเสียงที่จะใช้ในการสร้างเสียง ฟังตัวอย่างเสียงได้ใน คู่มือการอ่านออกเสียงข้อความ | OpenAI .
Options
- Response Format : เลือกรูปแบบสำหรับการตอบสนองเสียง เลือกจาก MP3 (ค่าเริ่มต้น) OPUS, AAC, FLAC, WAV และ PCM.
- Audio Speed : ป้อนความเร็วสำหรับเสียงที่สร้างขึ้นจากค่าจาก
0.25ถึง4.0. ค่าเริ่มต้นเป็น1. - Put Output in Field : ค่าเริ่มต้นเป็น
data. ป้อนชื่อของฟิลด์ output เพื่อใส่ข้อมูลไฟล์ไบนารี่
อ้างถึง สร้างคำพูด | OpenAI เอกสารประกอบสำหรับข้อมูลเพิ่มเติม
ถอดเสียงการบันทึก
ใช้การดำเนินการนี้เพื่อถอดเสียงเป็นข้อความ OpenAI API จำกัดขนาดของไฟล์เสียงไว้ที่ 25 MB OpenAI จะใช้ whisper-1 โมเดลตามค่าเริ่มต้น
ป้อน parameter เหล่านี้:
- Credential to connect with : สร้างหรือเลือกที่มีอยู่ OpenAI credentials.
- Resource : เลือก Audio.
- Operation : เลือก Transcribe a Recording.
- Input Data Field Name : ค่าเริ่มต้นเป็น
data. ป้อนชื่อของคุณสมบัติไบนารี่ที่มีไฟล์เสียงในรูปแบบใดรูปแบบหนึ่งเหล่านี้:.flac,.mp3,.mp4,.mpeg,.mpga,.m4a,.ogg,.wavหรือ.webm.
Options
- Language of the Audio File : ป้อนภาษาของเสียง input ISO-639-1 . ใช้ตัวเลือกนี้เพื่อปรับปรุงความแม่นยำและเวลาแฝง
- Output Randomness (Temperature) : ค่าเริ่มต้นเป็น
1.0. ปรับความสุ่มของการตอบสนอง มีช่วงอยู่ระหว่าง0.0(กำหนดไว้) และ1.0(การสุ่มสูงสุด) เราขอแนะนำให้แก้ไขสิ่งนี้หรือ Output Randomness (Top P) แต่ไม่ใช่ทั้งสองอย่าง เริ่มต้นด้วยอุณหภูมิปานกลาง (ประมาณ 0.7) และปรับตามผลลัพธ์ที่คุณสังเกตเห็น หากการตอบสนองซ้ำหรือเข้มงวดเกินไป ให้เพิ่มอุณหภูมิ หากมันวุ่นวายเกินไปหรือออกนอกลู่นอกทาง ให้ลดมันลง
อ้างถึง สร้างการถอดเสียง | OpenAI เอกสารประกอบสำหรับข้อมูลเพิ่มเติม
แปลการบันทึก
ใช้การดำเนินการนี้เพื่อแปลเสียงเป็นภาษาอังกฤษ OpenAI API จำกัดขนาดของไฟล์เสียงไว้ที่ 25 MB OpenAI จะใช้ whisper-1 โมเดลตามค่าเริ่มต้น
ป้อน parameter เหล่านี้:
- Credential to connect with : สร้างหรือเลือกที่มีอยู่ OpenAI credentials.
- Resource : เลือก Audio.
- Operation : เลือก Translate a Recording.
- Input Data Field Name : ค่าเริ่มต้นเป็น
data. ป้อนชื่อของคุณสมบัติไบนารี่ที่มีไฟล์เสียงในรูปแบบใดรูปแบบหนึ่งเหล่านี้:.flac,.mp3,.mp4,.mpeg,.mpga,.m4a,.ogg,.wavหรือ.webm.
Options
- Output Randomness (Temperature) : ค่าเริ่มต้นเป็น
1.0. ปรับความสุ่มของการตอบสนอง มีช่วงอยู่ระหว่าง0.0(กำหนดไว้) และ1.0(การสุ่มสูงสุด) เราขอแนะนำให้แก้ไขสิ่งนี้หรือ Output Randomness (Top P) แต่ไม่ใช่ทั้งสองอย่าง เริ่มต้นด้วยอุณหภูมิปานกลาง (ประมาณ 0.7) และปรับตามผลลัพธ์ที่คุณสังเกตเห็น หากการตอบสนองซ้ำหรือเข้มงวดเกินไป ให้เพิ่มอุณหภูมิ หากมันวุ่นวายเกินไปหรือออกนอกลู่นอกทาง ให้ลดมันลง
อ้างถึง สร้างการถอดเสียง | OpenAI เอกสารประกอบสำหรับข้อมูลเพิ่มเติม
ปัญหาทั่วไป
สำหรับข้อผิดพลาดหรือปัญหาทั่วไปและขั้นตอนการแก้ปัญหาที่แนะนำ โปรดดูที่ Common issues.

