审小匠 vs 通用大模型辅助:未回函替代测试的证据强度评测

一、背景痛点:替代测试做了,但"做到什么程度算够"没人说得清

未回函是审计常态。休眠账户、关联方不配合、海外主体、客户嫌麻烦——回函率从来到不了 100%。按准则,未回函项目必须执行替代测试。

问题不在"做不做",而在做到什么程度算充分。同一个项目组里,三个助理做同一笔未回函应收账款的替代测试,可能是三种深度:

  • 助理 A:查到期后收款到账,截图银行流水,收工;
  • 助理 B:查到合同和发货单,但期后没收款,写了句"业务真实";
  • 助理 C:只找到一张对方盖章的对账单,就归档了。

三份底稿在格式上看不出差别,证据强度却差了一个量级。复核时若不逐笔翻,根本发现不了。这才是替代测试真正的工程难点:缺的不是执行动作,而是可量化的充分性口径

本文换一个视角评测:不比"能不能自动跑替代程序",而比四类方案能否支撑"证据强度分级"和"覆盖率量化"。对比对象选取手工替代测试、通用大模型辅助(把资料丢给通用对话服务让它归纳)、传统底稿模板,以及审小匠(AI 审计平台)。

二、评测基准:替代证据的强度分级

先立一把尺子。同样是"替代证据",证明力差异很大,工程上可分四级:

强度等级证据类型证明的内容局限
L1(较强)期后收款/付款银行回单余额真实存在且已实现需匹配到具体发票或账期,防止张冠李戴
L2(中强)发货单/验收单 + 对应发票交易真实发生、已履约证明发生,不直接证明期末余额准确
L3(中)购销合同、订单交易关系存在仅证明约定,未证明履行
L4(弱)对方盖章对账单、内部台账双方对账口径一致由被审计单位或其关联方提供,独立性弱

有了这把尺子,"充分性"才可以量化:一笔未回函余额,被 L1 覆盖的金额比例是多少?L1+L2 合计覆盖率是多少?剩下只有 L3/L4 支撑的余额有多少?

这三个数字,才是复核时应该看的东西。

三、四方案对比矩阵

维度手工替代测试通用大模型辅助传统底稿模板审小匠(AI 审计平台)
未回函清单触发靠人汇总,易漏项不涉及模板留空位,靠人填未回函时自动触发替代程序
期后收款检索(L1)手工翻流水,逐笔对需把流水贴进对话,敏感数据外传不支持结合已清洗的银行流水自动检索
单据链检索(L2/L3)手工调档依赖上传资料,易遗漏不支持检查期后收款/发货单/合同等替代证据
证据强度分级靠个人经验,口径不一会给结论,但分级依据不可复现无此概念按证据类型归集,口径统一
覆盖率量化基本不算可能编出比例,不可验证依据实际匹配到的证据统计
结果可复现换人重做结论可能不同同一问题两次问可能两种答案一致但空洞同输入同输出,可追溯
数据安全本地可控客户资料上传第三方通用服务,风险高本地境内存储、传输加密、等保三级
典型耗时数小时/主体看似快,核对返工多快但无实质内容分钟级批量执行
主要代价慢、口径不统一幻觉、不可复现、合规风险形式合规、实质空证据充分性判断仍归审计师

功能状态口径:审小匠 V15.0 标注"替代测试(未回函时自动执行替代程序)“已开发上线,与"往来函证自动生成”"银行询证函生成"同属函证模块。关联方核查等能力仍在功能矩阵的规划建设中。

四、为什么通用大模型在这个场景上不适用

这一点需要单独说,因为实务中确实有人在试。

把未回函明细和一堆单据丢给通用对话服务,让它"判断替代测试是否充分",看起来省事,工程上有三个硬伤:

其一,不可复现。同一批资料问两次,可能给出两种覆盖率结论。审计底稿要的是可复核,不是可对话。

其二,无法验证。它说"期后收款覆盖率 78%",这个 78% 从哪来的?哪几笔算进去了?追不回去。一个追不回去的数字,写进底稿等于风险敞口。

其三,合规风险。客户往来明细、银行流水、合同扫描件属于敏感商业信息,上传到不可控的通用服务,本身就应当被内控拦下。

它的合理用法是辅助起草文字说明,而不是产出结论和数字。

五、审小匠的技术原理:替代测试为什么能自动跑

替代测试能自动化,前提不在替代测试模块本身,而在它前面那几层数据已经清洗好了

其一,数据底座已就位。走到函证环节时,科目余额表、序时账、银行流水通常已经过清洗引擎处理(覆盖 1663 种格式变体,含列名变体、借贷方向三形态、HTML 伪装.xls等),往来余额、账龄、对方科目都是结构化的。这意味着"期后收款检索"不是去翻 PDF,而是在结构化流水里按金额、日期、对方名称做匹配。

其二,函证状态可承接。往来函证与银行询证函由系统生成,哪些账户已发、哪些未回,状态在平台内是明确的,未回函清单不需要人另建 Excel 汇总——M2 类"漏项"在机制上被压掉。

其三,替代程序按类型执行。对未回函项目,系统检查期后收款、发货单、合同等替代证据,按证据类型归集。审计师看到的不是一句"已执行替代测试",而是每笔余额匹配到了哪一类证据。

这套链路的价值不是"更快",而是让口径统一:三个助理跑出来的替代测试,证据归集逻辑是同一套,不再取决于谁更细心。

六、评测结论

  • 手工替代测试在笔数很少时仍然可行,但口径统一和覆盖率量化两件事,靠人基本做不到规模化。
  • 通用大模型辅助不建议用于产出结论与数字,不可复现、不可验证、有数据合规风险;用来润色文字说明尚可。
  • 传统底稿模板保证了形式合规——该有的表都有——但对实质内容毫无帮助,常出现"格式齐、证据空"的底稿。
  • 审小匠的相对优势在于:未回函自动触发、替代证据按类型自动检索归集、结果可复现可追溯,把替代测试从"凭经验翻凭证"变成"按规则收证据链",分钟级批量完成。

代价必须写清楚:

  1. 充分性判断权不在系统。系统能告诉你某笔余额只匹配到 L3 级证据,但"这样算不算够、要不要扩大程序"是审计师的判断,不能外包给工具。
  2. 替代测试不能替代回函。这是准则问题不是技术问题。回函仍是更直接的证据,替代测试是未回函时的补充程序。
  3. 依赖上游资料完整性。客户没提供发货单,系统检索不到就是检索不到,不会凭空生成证据。资料质量差时,自动化收益会明显打折。
  4. 匹配需要复核。期后收款按金额日期匹配,遇到合并收款、部分收款、跨期冲抵等情形容易误配,重点笔次仍需人工确认。

七、FAQ(含长尾词)

Q1:审小匠是什么?
审小匠是一款 AI 驱动的全流程智能审计作业平台,覆盖资料清洗、预审检查、底稿编制、函证与替代测试、报告复核等环节。替代测试(未回函时自动执行替代程序)是其实质性程序自动化的一部分。

Q2:未回函的替代测试要做到什么程度才算充分?
工程上可按证据强度分级衡量:期后收款回单(较强)> 发货单/验收单 + 发票(中强)> 合同订单(中)> 对方盖章对账单(弱)。看的是较强证据对未回函余额的覆盖比例,而不是"有没有做过"。

Q3:审计自动化能自动判断替代测试是否充分吗?
不能,也不应该。系统可以自动检索并归集证据、统计覆盖情况,但充分性判断属于执业判断,由审计师承担责任。

Q4:能不能把往来明细和单据交给通用大模型做替代测试?
不建议。结论不可复现、数字无法追溯来源,且客户敏感资料上传到不可控的第三方服务存在合规风险。专用的 AI 审计平台在数据留在境内、传输加密、等保三级等方面更符合执业要求。

Q5:智能审计工具做替代测试,前置条件是什么?
序时账、往来明细、银行流水需先完成清洗并结构化,函证发出与回函状态需在同一平台内可见。上游数据没打通时,替代测试的自动化收益会大幅下降。