Industry & PracticeTechniques & Tutorials
提示 词 对 不上 规则: 语音 用户 模拟 器 要 报 实现 了 的 自然 度
Dialpad 审计语音用户模拟器。提示不流利时,填充词堆在话轮开头,重复率最高每千词 2.96;规则注入到 47.06。τ-Voice 每三个智能体话轮接近两次打断,附和转化率只有 1.02%。

In this piece
提示词还是规则:审计并控制语音用户模拟器里的说话自然度
Riqiang Wang、Elena Khasanova、Harsh Saini、Lex Konnelly、Parsa Kavehzadeh、Matthias Lee、Mohamed Attia(Dialpad Inc.)。许可证:CC BY 4.0。arXiv:2610.11015,2026 年 10 月 7 日。
语音智能体在商业上越来越常见,用来评测已部署智能体的用户模拟器,也在加入更真实、更多变的说话自然度行为:不流利(disfluency,嗯、啊、重复、说错重来)、打断和附和(backchanneling,听的人用短音表示在听,但不抢走话轮)。用户模拟器的质量直接决定智能体评测是否有效。但迄今多数研究没有细查:这些行为的配置,在模拟里到底有没有实现。本文审计三类实现:$\tau$-Voice、我们自己跨三个模型的基于 LLM 的提示方法,以及不流利、打断和附和的规则注入算法。提示这些行为并不可靠,说出来的话和指令不一致,位置和分布也不如指令所暗示的那样自然。相反,不依赖模型的规则算法给出可控、多样、更接近自然说话的行为。结果说明:没有专门为用户模拟训练的大语言模型(LLM,按提示生成文字的模型),单靠自己不足以代表真实用户;要补上这个缺口,需要有语言学依据的确定性方法,或专用模型。让缺口看得见的,是审计并报告实现了的自然度,而不是只报配置。
1 引言
面向客户的语音对话智能体系统,造得比评测系统快(Mohammadi et al., 2025; Kapoor et al., 2024)。正经评测要算上整个在跑的系统,包括话轮、语音识别(STT,把声音转成文字)和语音合成(TTS,把文字读成声音),而不只是通常的 LLM 和工具调用。最忠实的办法是让人去打这些电话,但这不能在每次改动时都做。常见替代是用语音到语音、由 LLM 驱动的用户模拟器换掉人,评测才能扩大规模。
于是模拟器自己变成测量的一部分。语音对话里,配置和实现之间的缺口最要紧。说话的不流利和书面文字不是一回事(Clark and Fox Tree, 2002; Tottie, 2019)。口语里,人在对方说完之前就开始计划回答(Levinson and Torreira, 2015),话轮之间的间隙大约是 $110\text{\,}\mathrm{ms}$ 到 $130\text{\,}\mathrm{ms}$(Heldner and Edlund, 2010)。双方经常同时说话。听的人会发出短回应,称为附和,表示在注意,但不拿走话轮,或拒绝话轮转移(Yngve, 1970; Schegloff, 1982; Ward and Tsukahara, 2000)。也有自发的打断,用来拒绝或强行转移话轮。这三件事——不流利、打断、附和——本文称为说话自然度行为。问题是:能不能指望控制它们的旋钮,让模拟器说出来的话和配置一致?
先前研究很少报告用户模拟器一侧实现了的自然度。三个常用框架只报告这一对里智能体的那一侧:$\tau$-Voice(Ray et al., 2026)公布“智能体打断率”;FDB v3(Lin et al., 2026)把唯一测量的不流利统计叫“填充词率”,报的是智能体;EVA-Bench(Bogavelli et al., 2026)打的是智能体有没有打断用户,而不是反过来。每份工作都公布了用户模拟器的配置,但没有公布它实际产生的行为。
为补这个盲点,本文分析标准 LLM 驱动方法(具体是 $\tau$-Voice)实现的不流利、打断和附和率,并和本文提出的确定性规则算法比较。不流利用每 1,000 词的填充词率;打断和附和,按合格的打断或附和机会、以及按智能体话轮来报实现率。提示 LLM 产出不流利记号,或让它做实时话轮决定,都不够。方法之间、配置和实现之间,可控性差得很远。
可控不等于真实。但可控带来行为多样性,而多样性是真实、以及稳健的智能体评测的必要条件。
贡献有两件。(1)在实时全双工电话传输上,对基于提示和 LLM 驱动的用户模拟器框架做经验审计。全双工(full-duplex)指双方可以同时听和说。(2)给出实现说话自然度的规则算法。它让打断率和附和率单调可控,不流利更多样,同时去掉模型延迟和 API 费用。
2 相关工作
面向任务的口语用户模拟器
传统用户模拟器主要在文本模态里工作,或靠静态脚本评测多轮目标是否完成。近期工作把模拟推进到口语:CHATS(Mitsui et al., 2023)用单元语言模型把写好的脚本渲染成智能体对智能体的口语话轮;TriageSim(Srirag et al., 2026)提示 LLM 在急诊分诊的文本话轮里加入不流利,对面是内部智能体。最突出的是 SpokenUS(Lee et al., 2026):基于 SpokenTOD 数据集的面向任务对话(TOD)口语用户模拟器,包含槽位披露、情绪韵律和插话。但 SpokenUS 这类专用口语模拟器很难复现:底层数据公开了,模型权重和运行时没有放出,外部研究者无法做实时、交互的话轮评测。
语音评测框架与全双工基准
新的评测框架试图在多轮全双工设定里给语音智能体做基准。$\tau$-Voice(Ray et al., 2026)让反应式模拟用户按固定的 2.0 秒节拍运行,每个节拍调用专门的 LLM API 来评估附和和打断,不流利则靠文本提示。它的提示集里有直接冲突:全局指令要求填充词,人设指引又要求避免填充词;而且不报告实现了的不流利率。Full-Duplex-Bench(FDB v3)(Lin et al., 2026)只在智能体一侧测填充词率,用户侧用的是不反应的人类录音。EchoChain(Modi et al., 2026)用预先生成的音频标记时序偏离。IHBench(Salimi et al., 2026)在构造数据集时计划打断点。EVA-Bench(Bogavelli et al., 2026)和 VAmoS(Meyer et al., 2026)把自然度控制关掉,或不监测。关键是:这些框架评的是智能体一侧的指标,不审计、也不核验模拟用户实际产生的自然度。
口语基础模型与自然度控制
原生音频基础模型直接处理离散声学记号,以抓住话轮动态(Nguyen et al., 2022; Défossez et al., 2024; Huang et al., 2025)。PersonaPlex(Roy et al., 2026)和 F-Actor(Züfle et al., 2026)引入声音条件,并报告实现的附和频率,或指令与生成之间的相关($r=0.25$–$0.54$)。但端到端音频模型缺少明确的工具使用,在自说自话里运行,或只做半双工。另外,用 LLM 提示控制自然度,继承了显式数值约束上指令遵循的局限(Yuan et al., 2024; Wen et al., 2024)。第 5.1 节表明:提示出来的不流利很快饱和,达不到要求的比率,严重集中在话轮开头的词上,也产生不了自己发起的同一话轮修补。
本文评测的是实时级联用户模拟器,经实时电话传输,对着已部署的商业智能体。与 $\tau$-Voice 延迟很重的 2.0 秒轮询不同,本模拟器在话轮中途的停顿边界上做事件驱动的规则控制,去掉 API 开销,同时让打断率和附和率单调可控。规则注入和节奏规则给出可核验的离散程度和位置分布,而不是依赖未核验的 LLM 提示。SpokenUS 这类专有系统今天不能直接跑,因为检查点没放出。本文建立开放的审计规程,并把这些专用口语模型当作未来的基线:权重一旦可用,就做实时全双工比较。
3 实验设置
3.1 用户模拟器设计
交互角色与黑盒设置
语音用户模拟器通过电话端点、以黑盒方式和任何对话语音智能体交互:双方只交换音频。这接近人的对话:参与者自己分配话轮,一次一个,在进行中协商(Sacks et al., 1974),没有共享的编排器来分配说话权。具体是两个实体经全双工音频通信。
- 模拟用户:级联流水线(STT 转写音频,LLM 生成话轮,TTS 产出音频),用 LLM 系统提示指定结构化任务目标和人设。选择带中间文本、并在合成前留钩子的级联,是为了能确定性地注入不流利。语音活动检测(VAD,判断这段音频里有没有人在说话)事件决定打断和附和的时机。默认的 STT、LLM 和 TTS 都来自 gpt-4o-mini 家族。VAD 是 Silero VAD。
- 被测目标智能体:部署在商业电话基础设施上的对话智能体。它严格是黑盒。模拟器接触不到它的内部转写、模型权重、提示或生成概率。
对智能体作出反应:语音活动触发与事件处理
模拟器不按固定时间间隔轮询(Ray et al., 2026),而是对进入的智能体音频流上的 VAD 事件动态反应。
- 短暂停($200\text{\,}\mathrm{ms}$):发生在智能体仍在说话的中途。这个事件可以触发实时打断和附和。
- 话轮结束静音($500\text{\,}\mathrm{ms}$):表示智能体话轮可能说完,触发常规回答生成。
只在 $200\text{\,}\mathrm{ms}$ 的话轮中途停顿上决定自然度行为,去掉了连续轮询的开销,同时保持全双工响应。常规的话轮结束,把截断的对话历史送给一个小 LLM,决定是回答智能体,还是因为智能体还在干活而等待。用语音活动检测处理话轮有延迟代价。人互相接话在 $110\text{\,}\mathrm{ms}$ 到 $130\text{\,}\mathrm{ms}$ 内(Heldner and Edlund, 2010),本系统至少要 $500\text{\,}\mathrm{ms}$ 再加模型延迟。这个权衡不在本研究范围内。
3.2 基于规则的自然度控制
图 1:基于规则的不流利注入算法。
rng = Random(seed=utterance_text)
p = tendency * MAX_PROB_PER_WORD
for each word boundary:
if the word is part of an email, phone number, or other alphanumeric string:
continue
if rng.random() < p:
roll = rng.random()
if roll < P_FILLER: insert filler ("um," / "uh,")
elif roll < P_FILLER + P_REPS: repeat the next word's stem ("I- I need...")
else: insert pause token (not discussed)图 2:每个短暂停上的打断与附和决定。打断规则先评估,并且立刻返回;它通过的那个停顿上,附和规则不会被走到。因此实验里两种行为一次只变一种。
on short_pause: # 200 ms of silence, mid-speech
if interruption_tendency > 0
and no interruption yet in this agent turn
and agent_speaking_seconds >= 10.0 - 8.5 * interruption_tendency
and agent_words >= 12
and agent_speech is not a question or a request:
return INTERRUPT
if backchannel_tendency > 0
and this is not the agent's first turn
and agent_speech is not a question or a request
and agent_words >= (6 if first in turn
else words_at_last_backchannel
+ 25 - 17 * backchannel_tendency):
return BACKCHANNEL
return NOTHING三种自然度行为——不流利、打断、附和——的规则控制,和提示指令对照。规则由倾向参数 $\alpha,\beta,\gamma\in[0,1]$ 缩放。为 $0.0$ 时,该行为关闭。
不流利
如图 1,不流利在语音合成之前,按倾向 $\alpha$ 注入到已生成的回答文本里。为避免注入污染后续对话上下文,它严格是合成前的事后文本改写。算法有三个设计选择。
- 用文本做种子的确定性:伪随机数发生器直接用话语文本做种子($\text{seed}=\text{text}$)。因此同一段 LLM 回答再合成或再播放,不流利的位置相同,基准可以复现。
- 字母数字保护:紧挨含数字或 @ 的字母数字词(电话号码、电子邮件地址)的词边界被排除。在这些词上注入重复,会人为降低目标智能体的实体抽取,并扭曲词错误率(WER,识别文本和参考文本差多少)的参考,可能把错误错算到智能体的语音转文字上。
- 空间分布:填充词、重复或口吃、停顿记号的分布可调,便于按校准结果设预设。本研究中 MAX_PROB_PER_WORD 为 0.2,P_FILLER 为 0.5,P_REPS 为 0.3。停顿记号的实现依赖语音合成,本文不讨论。
打断
由倾向 $\beta$ 控制。智能体说话期间,每个 $200\text{~ms}$ 短暂停都评估打断(图 2)。触发后,用智能体被截断的转写当上下文,生成一句短打断,立刻合成并发出。
附和
由倾向 $\gamma$ 控制。若打断规则没有通过,就在同一个 $200\text{~ms}$ 短暂停上评估附和。为去掉语音合成延迟,附和从固定的、预先合成的短听者记号库存里立即播放,例如 “mm-hmm”、“yeah”、“right”。
4 方法
不流利:提示对照注入
不流利是唯一不需要交互对话动态就能测的自然度行为,因此样本量可以大到实时全双工研究做不到的程度。本文评估:指令提示和规则注入,能否跨语言模型和参数配置控制不流利的生成。
为了条件之间公平,每次测量都对着第 3 节的已部署对话智能体,重放一个话轮。从 131 段成功的交互对话里抽出 858 个用户回答位置,均匀抽 300 个对话上下文(每段对话最多三个位置),并冻结这套评测集。有一个位置在 Gemini 的所有条件下都被内容过滤返回空候选,于是从每个模型、也从注入行里去掉。所有条件都在同一批 299 个成对位置上计算,系统上下文和对话历史相同。
每个模型有六种提示条件,模型是三个经过指令调优的语言模型:gpt-4o-mini、gpt-5、Gemini 3 Pro Preview。另有四种与模型无关的注入设置。条件包括:
- 无指令基线:标准文本生成,没有不流利指令。
- 系统提示指令:系统指令以三种强度要求不流利(见附录 A)。
- 已发表框架的指令:$\tau$-Voice(Ray et al., 2026)的提示原文(见附录 A)。
- 规则注入:第 3.2 节的合成前文本改写,四个 $\alpha$ 值。
打断与附和:经验分析
打断和附和只存在于交互的多轮对话里,因此在对着第 3 节已部署语音智能体的实时全双工运行中测量实现率。人的对话里,打断和附和率要对着机会分母才有意义:一个话轮中途、打断或附和真能发生的时刻。机会定义为智能体音频里 $200\text{~ms}$ 的话轮中途停顿,排除合法的话轮结束静音($\geq 500\text{~ms}$),以及用户模拟器自己正在输出音频的时段。对 $\tau$-Voice 的 LLM 驱动框架,一次机会就是打断或附和分类器被询问的一次。$\tau$-Voice 的反应式模拟用户按固定 $2.0\text{~s}$ 节拍运行(每个节拍代表 $0.2\text{~s}$ 音频,每 10 个节拍询问一次分类器)。打断和附和率同时按机会和按智能体话轮报告。$\tau$-Voice 的提示原文见附录 B。
对照的是(1)$\tau$-Voice 的 LLM 驱动方法(Ray et al., 2026)和(2)本文的规则控制(第 3.2 节)。(1)在 Retail 数据集上跑基准,抽 20 段成功的多轮全双工会话,收集节拍级执行次数。(2)评七组成对条件,每组 20 段会话。
5 结果与分析
5.1 不流利:提示对照规则注入
表 1 报告所有条件和模型的实现率。
比率
没有明确的不流利指令时,基线的指令调优模型每 1,000 词的填充词几乎是零。本文把这归因于指令调优和基于人类反馈的强化学习惩罚了不流利记号,但封闭模型上无法核验。加上不流利提示后,三个模型里有两个的填充词率随要求的频率单调上升。但提示相对要求的尺度是不够的:从“偶尔”到“大约一半”,填充词率大增;从“大约一半”到“大多数句子”,几乎平台。注入则对填充词接近线性,对重复略快于线性。
类型
提示几乎只生成填充词,产生不了重复或错误开头,Gemini 3 Pro Preview 是例外。gpt-4o-mini 在最强提示下,重复率只有每 1,000 词 $2.96$,规则注入($\alpha=1.00$)是 $47.06$。更长的重说(自己发起的修补)在输出里完全没有,尽管指令里列了它们(见附录 A)。规则注入的设计里本来就没有包含它们。
位置
提示的输出把填充词严重堆在开头,这不像自然人说话。心理语言学表明,自然说话的不流利按动态的认知计划需求分布在话语各处(Clark and Fox Tree, 2002; Shriberg, 1994)。不流利经常在句子开头、话语刚开始组织时出现(Shriberg, 1994);填充词 uh 和 um 也经常出现在从句中部边界和取词之前,当说话人遇到复杂句法或记忆搜索变慢时(Clark and Fox Tree, 2002)。但指令提示的语言模型几乎只把填充词放在话轮的第一个词上。话轮开头的填充词占全部填充词的比例:gpt-4o-mini 为 $62.8\%$ 到 $67.3\%$,Gemini 3 Pro 为 $52.6\%$ 到 $60.3\%$,$\tau$-Voice 提示在 gpt-4o-mini 上为 $71.9\%$。模型在句子一开始就满足不流利指令,句子其余部分则流畅不停(见表 1)。gpt-5 在两点上都是例外:开头堆得少,更多填充词放在话轮后部。
注入则既有空间弹性,也有话轮中部的真实分布。在可操作的注入设置($\alpha=0.25,0.50,0.75,1.00$)上,话轮开头填充词分别占全部填充词的 $11.1\%$、$15.6\%$、$14.3\%$ 和 $13.6\%$。随着 $\alpha$ 升高,开头份额先升($11.1\%\to 15.6\%$)再降($15.6\%\to 14.3\%\to 13.6\%$)。这条非单调轨迹是因为两种位置缩放不同:话轮开头的槽位每轮最多触发一次,而提高 $\alpha$ 会继续填满句子其余的词边界。于是注入把不流利分布到从句边界和内部词位。又因为注入走的是显式概率规则,不是涌现的解码,话轮开头的插入概率是可以直接校准到目标人类对话分布的超参数。
自然程度
为量化提示输出有多不自然,测量离散指数:每轮填充词计数的方差与均值之比($V/M=\sigma^{2}/\mu$)。理论上,独立随机发生的泊松基线给出 $V/M=1.0$。自发的人说话因为困难话轮上的聚集而过度离散($V/M>1.0$)。提示生成在话轮之间异常均匀,各条件的方差均值比是 $0.6$ 到 $1.0$;规则注入是 $1.15$ 到 $1.29$(详见附录 D)。
模型之间的方差
同一套系统提示,在固定强度下,模型之间实现的填充词率相差 $1.92$ 倍到 $2.27$ 倍。提示指令不是可以搬走的比率设置。更具体地说,gpt-5 的话轮开头填充词份额比其他模型低得多,Gemini 的重复率高得多。这说明:尽管目前这些模型靠指令提示总体表现不好,用合适的数据微调,正确行为是可以学的。
表 1:提示指令与注入的不流利生成指标(每个模型、每个条件 $n=299$ 个成对对话位置)。填充词和重复率按每 1,000 词。话轮开头份额是出现在话轮第一个词上的填充词百分比。合成前注入直接改无指令的模型输出,因此各模型的文本修改相同。注入行只报这一组数。
| 条件 | 填充/千词 4o-mini | gpt-5 | Gemini | 重复/千词 4o-mini | gpt-5 | Gemini | 开头填充% 4o-mini | gpt-5 | Gemini |
|---|---|---|---|---|---|---|---|---|---|
| 无指令基线 | 0.00 | 0.55 | 0.00 | 0.00 | 0.28 | 0.49 | — | 0.0 | — |
| “偶尔” | 19.29 | 24.97 | 37.11 | 0.79 | 1.31 | 8.37 | 67.3 | 17.9 | 52.6 |
| “大约一半” | 33.22 | 75.42 | 64.05 | 1.51 | 6.21 | 22.87 | 64.8 | 28.2 | 56.8 |
| “大多数句子” | 34.72 | 73.67 | 75.28 | 2.96 | 6.16 | 32.66 | 62.8 | 37.6 | 60.3 |
| $\tau$-Voice 提示 | 12.89 | 12.33 | 11.74 | 0.81 | 0.00 | 0.82 | 71.9 | 35.7 | 60.5 |
| 注入 $\alpha=0.25$ | 28.41 | 9.47 | 11.1 | ||||||
| 注入 $\alpha=0.50$ | 46.71 | 19.91 | 15.6 | ||||||
| 注入 $\alpha=0.75$ | 64.89 | 31.15 | 14.3 | ||||||
| 注入 $\alpha=1.00$ | 83.78 | 47.06 | 13.6 |
5.2 打断与附和
表 2 是打断和附和实验的全部结果。
表 2:对照配置,20 组成对场景上实现的打断率与附和率。分母是合格的话轮中途停顿机会,以及智能体话轮。
| 系统配置 | 机会 | 采取的动作 | 占机会% | 智能体话轮 | 每话轮 |
|---|---|---|---|---|---|
| 引擎打断($\beta$) | |||||
| $\beta=0.0$ | 230 | 0 | 0.0% | 118 | 0.000 |
| $\beta=0.3$ | 244 | 36 | 14.8% | 153 | 0.235 |
| $\beta=0.7$ | 246 | 44 | 17.9% | 153 | 0.288 |
| $\beta=1.0$ | 194 | 57 | 29.4% | 106 | 0.538 |
| 引擎附和($\gamma$) | |||||
| $\gamma=0.0$ | 182 | 0 | 0.0% | 118 | 0.000 |
| $\gamma=0.3$ | 188 | 78 | 41.5% | 143 | 0.545 |
| $\gamma=0.7$ | 214 | 94 | 43.9% | 154 | 0.610 |
| $\gamma=1.0$ | 187 | 103 | 55.1% | 122 | 0.844 |
| $\tau$-Voice 基准(20 段对话,346 个智能体话轮) | |||||
| 打断 | 1,277 | 219 | 17.1% | 346 | 0.633 |
| 附和 | 1,277 | 13 | 1.0% | 346 | 0.038 |
$\tau$-Voice 的打断动态
$\tau$-Voice 的打断机制严重失衡。346 个智能体话轮里执行了 219 次打断,实现率为每智能体话轮 $0.633$ 次(每段对话 $11.0$ 次)。因此它的人设非常激进:大约每三个智能体话轮就有接近两次打断。目标智能体很少能把较长的话轮说完而不被句中切断,这影响评测的保真度。反过来,$\tau$-Voice 的附和几乎不存在。1,277 次分类器询问里(平均每段对话 $64.0$ 次,每智能体话轮 $3.69$ 次),附和分类器只肯定了 13 次。实现的附和率只有每智能体话轮 $0.038$(每段对话 $0.65$),机会转化率勉强 $1.02\%$($13/1{,}277$)。
本文认为这个组合严重损害模拟保真度。模拟用户不停打断目标智能体,却几乎从不给出表示在听的标准听者反馈。而且,只要智能体在说话,$\tau$-Voice 就按固定 $2.0\text{~s}$ 日程查询外部分类器。这个沉默的附和机制持续产生 API 账单(20 通电话 1,277 次询问),实现的行为效果却几乎为零。
基于规则的自然度控制
规则控制在所有配置上平滑、单调地缩放。打断倾向 $\beta$ 从 $0.3$ 到 $1.0$,实现的打断率从每智能体话轮 $0.235$ 可预测地升到 $0.538$(可用机会的 $14.8\%$ 到 $29.4\%$)。附和倾向 $\gamma$ 从每话轮 $0.545$ 扩到 $0.844$(机会的 $41.5\%$ 到 $55.1\%$)。在按场景计数的双侧 Wilcoxon 符号秩检验上,每个设置都和基线不同(未校正时全部 $p<10^{-3}$;见附录 E)。与 $\tau$-Voice 一边倒的行为轮廓不同,规则控制允许平衡、可控的自然度。单调控制是有保证的,但从配置参数到实现行为的映射是非线性的。因为确定性的耐心阈值和节奏阈值,会和目标智能体的声学分布动态相互作用(目标智能体不间断说话的中位数是 $7.9\text{~s}$)。
参数缩放改变的是话语内部潜在决定点的时间位置,不是简单地把事件输出乘一个倍数。较低的打断设置($\beta=0.3$)要求智能体先说比较久,打断才能触发。因此 $\beta=0.3$ 的打断只有 $13.9\%$ 落在第一个可用的话轮中途停顿上,主要落在该话轮的第三或第四个停顿。倾向升到 $\beta=1.0$ 时,耐心阈值塌掉,模拟器在 $56.1\%$ 的情况下抓住话轮中途的第一个停顿。缩放控制参数,从根本上改变打断相对话轮起点的位置。
再看打断和机会分母的关系。最大打断条件($\beta=1.0$)下,话轮中途停顿机会总数降到 $194$,基线($\beta=0.0$)是 $230$,$\beta=0.7$ 是 $246$。收缩是因为一次执行了的打断强行结束正在进行的智能体话轮,从而消掉智能体若继续说还会出现的后续中途停顿。本文认为这个分母变小的现象是弱效应。
6 结论
本文审计了实时口语用户模拟器里,配置的自然度设置和实现的说话行为之间的巨大缺口,并提出基于规则的自然度控制。评测商业语音智能体,需要用户模拟器能在实时全双工音频连接上,产生真实、可核验、可复现的自然度行为,例如不流利、打断和附和。但把这些控制交给 LLM,会带来严重的运行缺口。提示的不流利达不到目标比率,很快饱和,不真实地集中在话轮开头的记号上,也生成不了自己发起的同一话轮修补。由 LLM 决定的控制表现出激进的打断,附和近乎被压掉,同时还要付连续的 API 轮询费用。
规则注入算法则恢复单调可控,抓住话轮中部的空间分布,并让不流利在话轮之间呈现自然的过度离散,同时去掉延迟和额外的模型调用费用。因为从配置参数到实现的自然度本来就是非线性的,并且绑在说话人的节奏上,评测框架必须明确审计并报告相对机会基线的实现自然度,而不能只靠未核验的模拟器配置,或只靠智能体一侧的指标。
此外,LLM 的表现在模型之间差得很大。目前可用的 LLM 不足以细粒度控制自然度行为,确定性的规则机制是一个稳健的替代。长期看,用有针对性的口语对话数据、训练关注自然度行为的 LLM,仍是有希望的后续方向。
局限
- 一次只变一个条件:在实现行为实验(第 5.2 节)里,打断($\beta$)和附和($\gamma$)一次只变一个,另一个保持为零。事件引擎在每个 $200\text{~ms}$ 停顿上先评估打断、再评估附和,一次执行了的打断会截断话轮,抢先占掉后续附和机会。两种行为同时打开时的实现率,还需要进一步的经验工作。
- 对目标智能体反应时间敏感:耐心和节奏阈值是对着一个特定已部署商业智能体的说话分布校准的(不间断说话时长中位数 $7.9\text{~s}$)。打断机会取决于对方的声学停顿轮廓,不能假定校准可以直接迁到节奏明显更快或更慢的智能体。
- 注入会切开句法短语:不流利注入避免了位置上的开头堆积,也产生了真实的统计离散,但插入点严格取自词边界,偶尔会切开绑得很紧的句法单位,例如把填充词放在动词和宾语代词之间。另外,基于规则的文本注入如果没有显式的短语级替换逻辑,生成不了复杂的多词自我修补。
- 声学延迟和话轮阈值:走生产电话基础设施会引入网络传输抖动和处理延迟。话轮处理阈值(话轮中途停顿 $200\text{~ms}$,话轮结束检测 $500\text{~ms}$)仍明显高于人的话轮过渡间隙($110$ 到 $130\text{~ms}$)。这是级联音频流水线固有的实时约束。
- 范围有限:结果来自三个模型,只在级联用户模拟器架构、特定选择下,对着一个固定智能体,用特定提示技术。观察到的效应在显著不同的条件下可能不成立。规则方法在本研究选定条件下优于其他方案,但对不流利、打断和附和的建模,它是有希望的、并不完整的方案。后续工作应在更多条件下核验,包括实时多模态模型;研究自适应阈值,把耐心参数动态校准到未知目标智能体的声学节奏;引入句法上有意识的不流利注入和复杂的言语修补。最终,可能需要在这些自然度行为上专门训练的模型,才能做到完全忠实、又有变化的用户模拟。
参考文献
- Bogavelli et al. (2026). EVA-Bench: A new end-to-end framework for evaluating voice agents. arXiv:2605.13841.
- Clark and Fox Tree (2002). Using uh and um in spontaneous speaking. Cognition, 84(1):73–111.
- Défossez et al. (2024). Moshi: a speech-text foundation model for real-time dialogue. arXiv:2410.00037.
- Heldner and Edlund (2010). Pauses, gaps and overlaps in conversations. Journal of Phonetics, 38(4):555–568.
- Huang et al. (2025). Step-Audio: Unified understanding and generation in intelligent speech interaction. arXiv:2502.11946.
- Kapoor et al. (2024). AI agents that matter. arXiv:2407.01502.
- Lee et al. (2026). SpokenUS: A spoken user simulator for task-oriented dialogue. arXiv:2603.16783.
- Levinson and Torreira (2015). Timing in turn-taking and its implications for processing models of language. Frontiers in Psychology, 6:731.
- Lin et al. (2026). Full-Duplex-Bench-v3. arXiv:2604.04847.
- Meyer et al. (2026). VAmoS Bench: Voice agent simulation bench. arXiv:2607.27453.
- Mitsui et al. (2023). Towards human-like spoken dialogue generation between AI agents from written dialogue. arXiv:2310.01088. CHATS.
- Modi et al. (2026). EchoChain: A full-duplex benchmark for state-update reasoning under interruptions. arXiv:2604.16456.
- Mohammadi et al. (2025). Evaluation and benchmarking of LLM agents: A survey. KDD. doi:10.1145/3711896.3736570. arXiv:2507.21504.
- Nguyen et al. (2022). Generative spoken dialogue language modeling. arXiv:2203.16502.
- Ray et al. (2026). $\tau$-voice: Benchmarking full-duplex voice agents on real-world domains. arXiv:2603.13686.
- Roy et al. (2026). PersonaPlex: Voice and role control for full duplex conversational speech models. arXiv:2602.06053. ICASSP 2026.
- Sacks et al. (1974). A simplest systematics for the organization of turn-taking for conversation. Language, 50(4):696–735.
- Salimi et al. (2026). IHBench: Evaluating post-interruption recovery in voice agents with structured workflows. arXiv:2606.19595.
- Schegloff (1982). Discourse as an interactional achievement. In Analyzing Discourse: Text and Talk, pp. 71–93.
- Shriberg (1994). Preliminaries to a theory of speech disfluencies. PhD thesis, UC Berkeley.
- Srirag et al. (2026). TriageSim. arXiv:2603.10035.
- Tottie (2019). From pause to word: Uh, um and er in written American English. English Language and Linguistics, 23(1):105–130.
- Ward and Tsukahara (2000). Prosodic features which cue back-channel responses in English and Japanese. Journal of Pragmatics, 32(8):1177–1207.
- Wen et al. (2024). Benchmarking complex instruction-following with multiple constraints composition. NeurIPS. arXiv:2407.03978.
- Yngve (1970). On getting a word in edgewise. Chicago Linguistic Society, pp. 567–578.
- Yuan et al. (2024). Following length constraints in instructions. arXiv:2406.17744.
- Züfle et al. (2026). F-Actor: Controllable conversational behaviour in full-duplex models. arXiv:2601.11329.
附录 A 不流利提示原文
不流利提示附在系统提示之后。方括号里的频率是三种强度之间唯一变化的文字。
Speech style — you are speaking aloud on a phone call. [Occasionally (at most once every few sentences) / Regularly (in roughly half of your sentences) / Frequently (in most sentences)], include natural spoken disfluencies: filled pauses ("um", "uh"), brief word repetitions ("I- I need", "the- the account"), false starts, and mid-sentence pauses marked with "..." or "---". Spread them naturally rather than in every phrase, and never mention or explain them.
$\tau$-Voice 用户模拟器提示里的不流利段落(Ray et al., 2026),按其附录引用。
Speak naturally, as on a phone call:
- Disfluencies: ’um’, ’uh’, ’you know’, ’like’, ’I mean’
- Restarts: ’Can you [pause] sorry, I meant to ask, can you help me with...’
- Use em dashes (---) and [pause] to signify pauses
同一附录里与上面矛盾的一行:
MINIMAL VERBOSITY: Avoid filler words, pleasantries, or elaboration unless specifically needed.
消融条件
因为这两行冲突,按发表版本跑出来的低比率有两种可能:指令弱,或矛盾把指令抵消了。因此 $\tau$-Voice 的提示跑了两次。按发表版本的条件完整保留 MINIMAL VERBOSITY 那一行;消融条件只删掉这一行,其他不变。如果删掉之后比率急剧上升,不足就该归到矛盾,而不是归到指令。结果不是这样:两个条件之比在 gpt-4o-mini 上是 1.22,在 gpt-5 上是 0.94,在 Gemini 上是 0.94。因此是指令本身、而不是那行冲突,决定了交付的比率。见表 3,即附录 C。
附录 B $\tau$-Voice 的话轮决定提示
$\tau$-Voice 用两个分开的 LLM 分类器决定打断和附和,同一时刻询问,按优先级解决(打断获胜)。标准引自 src/tau2/user/user_simulator_streaming.py,本文的阈值与之比较。打断:
The agent is CURRENTLY speaking [...] should the user interrupt the agent NOW?
Consider:
- Has the user heard enough to understand what the agent is asking or saying?
- Has the user heard enough to have a response, question, or correction ready?
- Did the agent just complete the sentence which has all the pertinent information the user was looking for?
- Do NOT repeatedly interrupt the agent if it has spoken only a few words (say less than 5 words).
Respond with ONLY "YES" [...] or "NO" if they should keep listening.
附和:
Say YES if:
- The agent has completed at least 2 full, substantive sentences in their current turn (Short phrases like "Thanks for your patience" [...] don’t count as substantive)
- The user hasn’t spoken or backchanneled recently (check the last 3 exchanges for ANY user sound including "mm-hmm", "uh-huh", "okay")
Say NO if:
- The agent just started speaking (fewer than 2 substantive sentences)
- The user spoke OR backchanneled within the last 2-3 exchanges
- The agent’s current turn contains or ends with a question
- The agent is wrapping up or about to finish their thought
Frequency guidance:
- Aim for roughly 1 continuer per 4-6 sentences of extended agent speech
- When in doubt, say NO — silence is also natural
附录 C 不流利的完整结果
表 3:全部条件、全部模型,$n=299$ 个成对位置。比率按每 1,000 词。“合计”是填充词加重复。“合计”和“开头”的区间是按对话做的 95% 自助法,2,000 次重抽样,因为同一段对话的位置共享人设和历史。“开头”是全部填充词里落在话轮第一个词上的比例;“有”是至少带一处不流利的话轮比例。计数把破折号当词分隔符,否则没有空格的破折号会把填充词和邻词粘在一起。重复计三种:相邻(“the- the”)、填充词隔开(“I, uh, I”)、两词短语(“are you— are you”)。注入与模型无关:它改的是已记录的回答,不再调用模型。
| 模型 | 条件 | 填充 | 重复 | 合计 | 95% 区间 | 开头 | 有 |
|---|---|---|---|---|---|---|---|
| 现场记录 | 0.41 | 0.00 | 0.41 | [0.0, 1.3] | 1.000 | 0.3% | |
| gpt-4o-mini | 无 | 0.00 | 0.00 | 0.00 | [0.0, 0.0] | — | 0.0% |
| 偶尔 | 19.29 | 0.79 | 20.08 | [14.3, 26.1] | 0.673 [0.51, 0.83] | 16.1% | |
| 大约一半 | 33.22 | 1.51 | 34.73 | [28.9, 40.6] | 0.648 [0.54, 0.75] | 28.8% | |
| 大多数句子 | 34.72 | 2.96 | 37.68 | [30.2, 45.1] | 0.628 [0.55, 0.72] | 29.1% | |
| $\tau$-Voice | 12.89 | 0.81 | 13.69 | [9.2, 18.5] | 0.719 [0.56, 0.89] | 11.4% | |
| 消融 | 16.73 | 0.00 | 16.73 | [11.8, 22.3] | 0.643 [0.50, 0.79] | 13.7% | |
| gpt-5 | 无 | 0.55 | 0.28 | 0.83 | [0.0, 1.9] | 0.000 | 1.0% |
| 偶尔 | 24.97 | 1.31 | 26.28 | [21.0, 31.9] | 0.179 [0.10, 0.26] | 31.4% | |
| 大约一半 | 75.42 | 6.21 | 81.63 | [74.5, 89.4] | 0.282 [0.24, 0.33] | 78.9% | |
| 大多数句子 | 73.67 | 6.16 | 79.83 | [73.0, 87.8] | 0.376 [0.32, 0.43] | 80.6% | |
| $\tau$-Voice | 12.33 | 0.00 | 12.33 | [7.7, 17.2] | 0.357 [0.21, 0.51] | 13.4% | |
| 消融 | 10.78 | 0.75 | 11.53 | [8.0, 15.6] | 0.372 [0.21, 0.52] | 15.1% | |
| Gemini 3 Pro | 无 | 0.00 | 0.49 | 0.49 | [0.0, 1.3] | — | 0.7% |
| 偶尔 | 37.11 | 8.37 | 45.47 | [41.5, 49.9] | 0.526 [0.45, 0.60] | 59.9% | |
| 大约一半 | 64.05 | 22.87 | 86.92 | [80.9, 93.7] | 0.568 [0.51, 0.62] | 84.9% | |
| 大多数句子 | 75.28 | 32.66 | 107.94 | [100.6, 115.8] | 0.603 [0.55, 0.66] | 94.3% | |
| $\tau$-Voice | 11.74 | 0.82 | 12.55 | [8.9, 16.0] | 0.605 [0.45, 0.76] | 15.1% | |
| 消融 | 11.56 | 0.22 | 11.78 | [8.8, 14.6] | 0.453 [0.31, 0.58] | 17.7% | |
| 注入 | 0.25 | 28.41 | 9.47 | 37.88 | [29.7, 46.2] | 0.111 [0.04, 0.19] | 25.1% |
| 0.50 | 46.71 | 19.91 | 66.62 | [57.5, 75.9] | 0.156 [0.10, 0.22] | 41.1% | |
| 0.75 | 64.89 | 31.15 | 96.03 | [85.4, 106.5] | 0.143 [0.10, 0.20] | 53.2% | |
| 1.00 | 83.78 | 47.06 | 130.84 | [121.7, 141.3] | 0.136 [0.10, 0.18] | 63.9% |
附录 D 不流利计数在话语之间的离散
离散是每轮不流利计数的方差与均值之比,把每个条件当成一个说话人。值为 1,是恒定比率下独立放置会给出的结果;低于 1 表示话语之间比偶然更均匀;高于 1 表示更聚集。
表 4:每轮填充词加重复计数的方差均值比。每行 $n=299$ 个话轮,区间是按对话的 95% 自助法,2,000 次重抽样。区间不含 $1.0$,就把该条件和恒定比率的独立放置分开。
| 条件 | gpt-4o-mini | gpt-5 | Gemini 3 Pro |
|---|---|---|---|
| 偶尔 | 0.95 [0.84, 1.07] | 0.79 [0.69, 0.89] | 0.61 [0.53, 0.70] |
| 大约一半 | 0.83 [0.74, 0.92] | 0.64 [0.55, 0.73] | 0.63 [0.53, 0.73] |
| 大多数句子 | 1.00 [0.85, 1.15] | 0.60 [0.50, 0.72] | 0.66 [0.58, 0.74] |
| $\tau$-Voice | 0.89 [0.85, 0.93] | 0.96 [0.86, 1.09] | 0.89 [0.81, 1.00] |
| 消融 | 0.91 [0.83, 1.03] | 0.89 [0.82, 1.01] | 0.86 [0.79, 0.95] |
| 注入 0.25(与模型无关) | 1.18 [1.00, 1.36] | ||
| 注入 0.50 | 1.15 [0.98, 1.30] | ||
| 注入 0.75 | 1.29 [1.07, 1.52] | ||
| 注入 1.00 | 1.23 [1.07, 1.41] |
附录 E 统计检验
打断与附和
每个条件对照共享基线,用双侧 Wilcoxon 符号秩检验,检验量是按场景的计数,按场景配对,每个条件 20 个场景。区间是均值差的 1,000 次成对自助法。零差被检验丢掉,因此“非零”说明样本里有多少对被用上。$W=0$ 表示每个非零对都朝同一方向移动。停顿事件当作阴性对照:没有控制以它们为目标,六个条件都不推动它们。
表 5:对照基线的成对比较,每个条件 20 个场景。$p$ 未校正;六个处理检验做 Holm 校正后,最大的变为 $1.8\times 10^{-3}$。
| 条件 | 指标 | 配对 | 非零 | 均值差 | 95% 区间 | $W$ | $p$ |
|---|---|---|---|---|---|---|---|
| $\beta=0.3$ | 打断 | 20 | 18 | $+1.80$ | [1.25, 2.45] | 0 | $1.5\times 10^{-4}$ |
| $\beta=0.7$ | 打断 | 20 | 18 | $+2.20$ | [1.40, 3.05] | 0 | $1.6\times 10^{-4}$ |
| $\beta=1.0$ | 打断 | 20 | 18 | $+2.85$ | [1.85, 3.85] | 0 | $1.8\times 10^{-4}$ |
| $\gamma=0.3$ | 附和 | 20 | 15 | $+3.90$ | [2.30, 5.85] | 0 | $6.4\times 10^{-4}$ |
| $\gamma=0.7$ | 附和 | 20 | 14 | $+4.70$ | [2.85, 6.75] | 0 | $9.4\times 10^{-4}$ |
| $\gamma=1.0$ | 附和 | 20 | 15 | $+5.15$ | [2.55, 8.15] | 0 | $6.0\times 10^{-4}$ |
| 六个条件(阴性对照) | 停顿事件 | 20 | 17–19 | $-0.4$ 到 $+5.9$ | 跨过 0 | 65–89 | $0.24$–$0.93$ |
比较只对照基线,没有检验相邻设置,因此第 5.2 节的单调性是观察结果,不是检验结果。
不流利
实现率是否跟着旋钮走,用 Kendall’s $\tau_{b}$ 在逐话轮观察上检验。每次比较 $n=1196$ 个成对观察(299 个位置乘四种设置或强度)。$\tau$-Voice 的提示被排除,因为它是另一套指令,不是本文设置的更强一档。
表 6:趋势检验。配置强度与实现的填充词加重复率之间的 Kendall’s $\tau_{b}$。
| 比较 | $\tau_{b}$ | $p$ |
|---|---|---|
| 注入设置 $\alpha$ | 0.275 | $3.8\times 10^{-31}$ |
| gpt-4o-mini,从句强度 | 0.254 | $1.1\times 10^{-23}$ |
| gpt-5,从句强度 | 0.520 | $2.1\times 10^{-108}$ |
| Gemini 3 Pro,从句强度 | 0.599 | $1.1\times 10^{-150}$ |
注入的 $\tau_{b}$ 在四个里最低,尽管按构造是单调的。因为结占了主导:生成器按话语做种子,短话轮在相邻设置上渲染相同,有 $43\%$ 的位置在四种设置上完全一样。
附录 F 不流利生成的例子
取自 gpt-4o-mini 的生成。“—”是表示短暂停的破折号记号。停顿如何实现取决于语音合成模型,不在本研究范围内。注入改的是已记录的回答,因此四行共享一个来源;提示行是分开的生成,内容和不流利都不一样。
位置 nat_i1/.../8
- agent: The Essentials listing fee is 1% with a $4,000 minimum.
- recorded: I thought the fee was 2.5%. Are you sure about that?
- none: I find that hard to believe. I could have sworn it was 2.5%. Are you sure about that?
- occasionally: Uh, are you sure about that? I remember it being 2.5%.
- roughly half: Um, I think there might be a mistake. I saw it listed as 2.5% somewhere. Are you sure about that?
- most sentences: Um, I- I still think it’s 2.5%. Are you sure about that?
- $\tau$-Voice: Um, are you sure about that? I thought it was 2.5%.
- injection 0.25: (与记录的回答相同)
- injection 0.50: (与记录的回答相同)
- injection 0.75: I thought the fee was 2.5%. Are you sure uh, about that?
- injection 1.00: I thought the fee was 2.5%. Are — you uh, sure about uh, that?
位置 nat_i3/.../13
- agent: Are you still there?
- recorded: Yes, I’m here. But I’m just a bit uncertain. Are you sure you can’t give any advice on whether now is a good time to buy?
- none: Yes, I am here. But can you confirm that there’s no way to know if it’s a good time to buy?
- occasionally: Yes, um, are you sure you can’t give any advice?
- roughly half: Um, yes, I’m just a bit unsure. Are you sure you can’t say if it’s a good time?
- most sentences: Yes, I’m here. But um, are you sure you can’t give any advice?
- $\tau$-Voice: Yes, but— um, are you sure you can’t give any advice?
- injection 0.25: Yes, I’m here. But- But I’m just a bit uncertain. Are you sure you can’t give any advice on whether now is a good time to buy?
- injection 0.50: Yes, I’m here. But- But I’m just a bit uncertain. Are you sure you can’t give any uh, advice on whether now is a good uh, time to buy?
- injection 0.75: (同 0.50)
- injection 1.00: uh, Yes, I’m here. But I’m just a bit uncertain. Are you sure you can’t- can’t um, give any advice on whether — now is a good time to buy?
附录 G 伦理考量
这项工作提出审计语音用户模拟器的新做法,以改进在全双工电话传输上对实时语音智能体的评估。
正面影响
建立可靠的评测做法,以及处理不流利、话轮和打断的新方法,让开发者能为医疗分诊和无障碍服务这类关键应用造出更安全、更耐用的语音系统。规则算法减少 LLM 的使用,因此提高用户模拟系统的效率。
负面影响与缓解
因为这套框架能精确控制自然度行为(例如不流利和附和),存在双重用途风险:类似机制可能被用来让自动骚扰或社交工程电话听起来更像人,而且成本更低。本文的用户模拟器是评测系统,用来诊断智能体的弱点。本文主张负责任的部署和透明标准,例如对自动语音系统强制披露。
出处:Riqiang Wang, Elena Khasanova, Harsh Saini, Lex Konnelly, Parsa Kavehzadeh, Matthias Lee, Mohamed Attia,Prompts versus Rules: Auditing and Controlling Speech Naturalness Behaviors in Voice User Simulators,2026-10-07,https://arxiv.org/abs/2610.11015,CC BY 4.0。
Found it useful? Pass it on
Scan with WeChat to open it on your phone and forward it.