Synthetic Data Generation for Phrase Break Prediction with Large Language Model 文章主要内容总结本文聚焦于文本到语音(TTS)系统中的短语停顿预测任务,旨在解决传统方法依赖大量人工标注(存在成本高、一致性差等问题)的挑战。研究探索了利用大语言模型(LLMs)生成合成短语停顿标注的可行性,通过与两种传统人工标注(音频导向标注和文本导向标注)的对比,评估了合成数据在多语言场景下的有效性。研究发现,基于LLM的合成数据生成方法能有效缓解短语停顿预测中的数据难题:LLM生成的标注质量与人工标注相当,且具有更高的一致性、更低的成本,仅需少量示例即可实现;同时,该方法在英语、法语、西班牙语等多语言场景中表现出较强的泛化能力,模型在合成数据上训练的性能可媲美甚至优于基于人工标注训练的模型。文章创新点首次实证研究LLM生成短语停顿标注:对比了LLM合成标注与两种传统人工标注(音频导向、文本导向)的一致性和与人类判断的对齐程度。高效且高质量的标注生成:证明LLM生成的标注质量与人工标注相当,但所需样本量显著更少,自动化程度更高,成本更低,一致性更强。跨语言泛化能力:验证了该方法在多语言场景中的有效性,为资源有限的语言提供了低成本解决方案。翻译部分摘要当前短语停顿预测方法虽解决了文本到语音系统中关键的韵律问题,但严重依赖大量来自音频或文本的人工标注,导致大量的人工投入和成本。语音领域中由语音因素驱动的固有变异性,进一步增加了获取一致、