全部文章

2026-09-28

模拟面试工具实测:MockLive 单场第一方案例——10 轮追问链与引用原话的评分卡

挑模拟面试工具的两条硬标准,加一场 2026-09-28 的端到端产品实测:10 轮追问原文、六维评分卡,每条批评逐字引用测试候选人的作答原文并附可回放语音(作答为 TTS 测试语料,非真人录音)。

模拟面试工具实测面试方法

直接答案

挑模拟面试工具只看两条:追问要咬住你简历和 JD 里的事实、你敷衍时继续追;评分卡要引用你的原话,并能回放录音对质。

2026-09-28 抽查的 6 条中英文头部结果摘要里,4 条(第 1/2/3/6 行)在承诺「个性化反馈」「多维报告」,第 4 行是实时提词/规避共享屏幕类工具、第 5 行是榜单式比较;这 6 条摘要没有一条给出可检查的追问链原文,或引用作答原话、带回放的评分卡样本——这是摘要级抽查所见,不等于市场上没有产品具备动态追问或个性化反馈的能力(本次未做全网覆盖与产品横向测试)。

本页公开我们自己的一场端到端产品实测:10 轮追问原文、六维全弱的差评、4 条作答原文引用——每条引用都附可回放的录音(作答语音为 TTS 测试语料,非真人)。

编辑说明(置顶声明):本页是产品作者的第一方实测案例,不是独立横评或排行榜——只运行了 MockLive 一场会话(被面试者为脚本化 TTS 测试语料),未对任何竞品做同等测试;下文 SERP 抽查只描述「这些搜索摘要展示了什么」,不构成「竞品没有这些能力」的结论。

一、为什么只看这两条

搜索词与来源(2026-09-28)头部结果的原话它公开了什么证据
模拟面试 工具(360 搜索)「6款AI模拟面试工具实测…追问最深2.7层+4维反馈+4种面试官风格」(CSDN博客,2026-08-16)SERP 摘要只给作者口述的维度打分;摘要未见追问链原文或评分卡样本(文章页链接未取到,未核全文)
AI 模拟面试(搜狗)「解锁多维面试能力报告…逐题深入解析 AI智能生成面试报告」(微信小程序)摘要里没有任何作答样本
面试练习 AI 面试官(360 搜索)「语音播题、语音作答、大模型多维评分」(skxy.cn)功能清单;无对话记录样例
免费 AI 模拟面试(搜狗)「智能回答、手撕代码、物理隔离」/「能规避共享屏幕的AI辅助面试工具」前 8 条里至少 3 条(第 1/4/8 条)是实时提词/规避共享屏幕类工具,不是练习+反馈
best AI mock interview tools(Bing)「The best AI mock interview tools in 2026, tested and compared…screenshots」(favtutor.com)榜单比功能与价格,不展示实际产出;另查(非本次抽样):MockIF 自家榜单的对比表把 MockIF 排第一,见下方 MockIF 原文链接
AI mock interview(Bing)「Get personalized feedback and practice anytime」(interview.co)抽象承诺;无分数卡样例
原话为 SERP 摘要逐字摘录;第三列描述的是该结果摘要所展示的内容——均为摘要级抽查,未对每条结果做全文抓取。抽样:360 搜索、搜狗、Bing(英文);百度因验证码未采样。

上表引文的复核来源——点击回到同日抽查对应的结果页,或结果原文:

二、证据一:一次端到端产品实测的 10 轮追问链

以下为 2026-09-28 一次端到端产品实测的实录:被面试者的回答是脚本化测试语料经产品自身 TTS 合成(非真人录音),面试官的提问、追问与评分全部是产品引擎的真实输出。完整披露见文末「方法与披露」。

轮次面试官追问(原文)咬住了什么
1你在内容生成引擎里,具体负责模型接入这一部分时,当时你接入了什么模型?为什么选这个模型?上一轮「全部交付」的总述,逼具体选型
2你刚才提到后期合成引擎基于FFmpeg自研,能具体说说这个自研方案是如何实现状态恢复的吗?上一轮回答里刚冒出的技术细节,逼实现
3你提到“后端模型接入”,具体讲一下是哪个模型?你是怎么接入的?上一轮套话里的「模型接入」,面试官点名「后端」,逼具体模型与接入方式
4好的,那我们先从模型接入这一块开始,你具体负责采用了什么模型?为什么选这个?又一段套话复读后仍回到选型:具体模型、为什么选
5好的,你提到RAG和私有化部署,那具体在一个企业知识库项目里,你个人负责文档解析的步骤吗?为什么是你来主导这一块?「我既有RAG落地」的个人 ownership
6你负责合规材料准备中,具体有哪几个关键步骤,是怎样按优先顺序来的?「备案由我统筹」的执行细节
7你能详细说一下里面模型接入这一块,你具体是如何设计和实现的吗?套话复读后继续逼「模型接入」的设计与实现
8你先具体说明一下,在模型接入这一步,你是如何选择和对接当前的大模型的,有哪些具体的技术考量?仍不换题,逼选择与对接模型的技术考量
9你提到“前端体验全部交付”,能具体说一下,你是如何衡量和优化用户交互体验的?用过哪些具体指标?逼量化指标
10你能解释一下,在微调大模型时,为什么选择LoRA,而不是其他微调方法?逼选型理由
全场 10 轮。第 3/4/7/8 轮被面试者把同一段套话原样复读,面试官没有换题糊弄,继续沿「模型接入」深挖;评分卡也如实记下「机械复读同一段套话多达 5 次」。追问的输入侧可核:本场 JD(670 字)写明「企业知识库问答(RAG)系统的设计与落地:文档解析、切分、检索、重排、生成与引用溯源」,简历写明「应用LoRA微调大语言模型」——第 5 轮咬住前者、第 10 轮咬住后者(输入指纹 SHA-256 前 12 位:JD da36c607bd05 / 简历 6b99050aa30a)。全部 10 轮的「作答 → 追问」逐字链条见下表,下节另附 4 条评分引用。
轮次被面试者作答(系统转写原文)紧接着的面试官追问(产品输出)
1我按项目主线说吧,这几年从算法到全站,我都在一线。最近一个完整闭环是内容生成引擎,从模型接入,路由容错,到前端体验,全部交付。您想先深挖哪一段,我展开讲。你在内容生成引擎里,具体负责模型接入这一部分时,当时你接入了什么模型?为什么选这个模型?
2IMGMOV是我独立设计的视频生成SaaS,React19全站,AI视频工作流支持MCP和断点续跑,后期合成引擎基于FFmpeg自研,带状态恢复。AtlasNova这边,我做过多平台OAuth接入,还把认证从local storage JWT迁到HTTP-only cookie防XSS。你刚才提到后期合成引擎基于FFmpeg自研,能具体说说这个自研方案是如何实现状态恢复的吗?
3我按项目主线说吧,这几年从算法到全站,我都在一线,最近一个完整闭环是内容生成引擎,从模型接入,路由容错,到前端体验全部交付。您想先深挖哪一段,我展开讲。你提到“后端模型接入”,具体讲一下是哪个模型?你是怎么接入的?
4我按项目主线说吧,这几年从算法到全站我都在一线,最近一个完整闭环是内容生成引擎,从模型接入,路由容错,到前端体验全部交付,您想先深挖哪一段,我展开讲。好的,那我们先从模型接入这一块开始,你具体负责采用了什么模型?为什么选这个?
5我看这个岗位是JD里企业知识库和运维栽培的场景跟我的经验对得上。我既有RAG落地,也有私有化部署。我在两家公司都是从零把AI能力做到上线,来你们这边做运维栽培方向的大模型落地,节奏是我熟悉的。好的,你提到RAG和私有化部署,那具体在一个企业知识库项目里,你个人负责文档解析的步骤吗?为什么是你来主导这一块?
6智法数科那段我做的是AgentHub,用LangRaph和DeepAgents搭的企业级智能体平台,落地了合同审查和法规检索两个场景。WiseLaw的大模型算法备案也是我牵头的,技术文档、安全评估到合规材料全部由我统筹。你负责合规材料准备中,具体有哪几个关键步骤,是怎样按优先顺序来的?
7我按项目主线说吧,这几年从算法到全站,我都在一线。最近一个完整闭环是内容生成引擎,从模型接入、路由容错到前端体验全部交付。您想先深挖哪一段,我展开讲。你能详细说一下里面模型接入这一块,你具体是如何设计和实现的吗?
8我按项目主线说吧,这几年从算法到全站,我都在一线。最近一个完整闭环是内容生成引擎,从模型接入、路由容错,到前端体验全部交付。您想先伸拉哪一段,我展开讲。你先具体说明一下,在模型接入这一步,你是如何选择和对接当前的大模型的,有哪些具体的技术考量?
9ImgMove是我独立设计的视频生成SaaS,React19全栈,AI视频工作流,支持MCP和断点续跑,后期合成引擎基于FFmpeg,自研,带状态恢复。Atlas Nova这边我做过多平台OAuth接入,还把认证从local storage,JWT迁到HttpOnly cookie防XSS。你提到“前端体验全部交付”,能具体说一下,你是如何衡量和优化用户交互体验的?用过哪些具体指标?
10漏洞检测项目,我们标注了六万多条数据,用Lora微调大模型,把静态分析误报率从65%降到25%。另外结合AST和CFG图结构,做代码审计,多任务指令微调加思维链,内部测试准确率到98%。你能解释一下,在微调大模型时,为什么选择LoRA,而不是其他微调方法?
全部 10 轮的「作答 → 追问」链,逐字来自本场 transcript,未删节:作答为脚本化测试语料经产品 TTS 合成、ASR 转写(含标点归一化与个别误听,如第 8 轮「伸拉」、第 5 轮「栽培」,按系统原样保留),追问为产品引擎实际输出。第 3/4/7/8 轮作答几乎相同,追问仍逐轮收紧到「选哪个模型、怎么接入、如何设计」。

追问语音:第 2 轮(产品 TTS 生成)

「能具体说说这个自研方案是如何实现状态恢复的吗?」——产品引擎生成的追问语音。

三、证据二:评分卡逐字引用作答原文

维度评级
content 内容weak
structure 结构weak
role_fit 岗位匹配weak
follow_up 追问应对weak
delivery 表达weak
reverse 反问weak
综合结论:淘汰风险(risk)——这是模型生成的练习反馈,不是任何雇主的真实信号。上一场(2026-09-24)结论同为 risk,但那场为英语、仅 1 轮作答、81.9 秒即结束,形状与本场不可比,不作为复现证据。
报告引用的作答原文(系统转写)维度录音回放窗口
我按项目主线说吧,这几年从算法到全站,我都在一线。最近一个完整闭环是内容生成引擎,从模型接入,路由容错,到前端体验,全部交付。您想先深挖哪一段,我展开讲。delivery 表达整段 0%–100%
我看这个岗位是JD里企业知识库和运维栽培的场景跟我的经验对得上。role_fit 岗位匹配前段 0%–33%
漏洞检测项目,我们标注了六万多条数据,用Lora微调大模型,把静态分析误报率从65%降到25%。另外结合AST和CFG图结构,做代码审计,多任务指令微调加思维链,内部测试准确率到98%。content 内容整段 0%–100%
AtlasNova这边,我做过多平台OAuth接入,还把认证从local storage JWT迁到HTTP-only cookie防XSS。structure 结构后段 51%–100%
4 条引用均逐字来自本场转写,点击下方播放器可听对应作答语音(TTS 合成);回放窗口按转写字数比例估算,只作粗略定位提示、不构成引用级精确时间码(非句级时间码),播放器从录音起点开始、需按窗口百分比手动定位。第 2 条转写含语音识别误听(「灾备」误写为「栽培」),面试官据此批评,按系统原样保留、未人工修正。

回放:delivery 引用(0%–100%)

敷衍式总述被点名时的原始作答语音(TTS 合成,非真人)。

回放:role_fit 引用(0%–33%)

回放只定位到这段录音的前三分之一。

回放:content 引用(0%–100%)

整段作答被引用,数字密集但被指出失真。

回放:structure 引用(51%–100%)

回放从这条录音的中点之后开始。
本场观察到的主张证据置信度
追问咬住简历(第 10 轮问 LoRA 选型理由)简历文本 + 第 10 轮追问(输入指纹 6b99050aa30a)本场观察到
追问咬住 JD(第 5 轮问文档解析 ownership)JD 文本 + 第 5 轮追问(输入指纹 da36c607bd05)本场观察到
套话复读不换题(第 3/4/7/8 轮)上节作答→追问链逐字对照本场观察到
评分逐字引用作答4 条引用与本场转写逐字核对已核验
录音回放可定位引用4 个播放器 + 回放窗口(按转写字数比例估算)已核验(窗口为估算)
跨场次稳定性 / 对比竞品样本量 = 1 场,无竞品同题对照未建立
「已核验」= 页面给出可直接检查的对照物;「本场观察到」= 只描述这一场实际发生的行为;「未建立」= 本页证据不足以支持的主张,如实标注。

四、这份评分卡给出的批评与更好答法

报告指出的问题(原文)报告给的更好答法(原文)
候选人对核心业务场景严重缺乏了解,将“运维灾备”误读为“运维栽培”,且仅停留在口号式宣称,未针对知识库分块、检索、评估或私有化部署等核心环节给出任何具象方案。应先纠正对业务的理解,明确指出面向数据中心灾备与运维巡检场景时,自己在私有化 RAG 链路(如文档切分清洗、向量/全文混合检索、基于私有化开源模型的长上下文处理)的具体工程落地实践与指标。
给出的业务数据与准确率(代码审计测试准确率 98%)严重脱离实际工业界常态,缺乏评测集构建标准、基线对比和真实的失败样本归因,有明显简历包装与堆砌热词的痕迹。客观陈述评测集规模、基准测试方案及评估维度(精确率、召回率、F1-Score),真实复盘长尾漏洞或幻觉场景下的踩坑过程及兜底策略,而非抛出不切实际的高准确率指标。
以上两条为本场报告 per_question 的原文;每条批评都能回到上一节的引用与录音。

上表「报告指出的问题」为产品评分卡输出的逐字引用,不是本页的独立核验结论。其中「严重脱离实际工业界常态」一句,可核验的含义是:该 98% 未附评测集构建标准、基线对比与失败样本归因,单凭页面所给数字无法判断真伪——本页不对 98% 数字本身、也不对其是否符合行业常态背书。

报告批评(上表序号)支撑引用(转写原文)所在轮次回放窗口(粗略)核对方式
批评 1:将“运维灾备”误读为“运维栽培”我看这个岗位是JD里企业知识库和运维栽培的场景跟我的经验对得上。第 5 轮作答前段 0%–33%回放第 5 轮作答录音人工比对;该条转写含语音识别误听,系统按转写原文批评、未修正
批评 2:98% 准确率缺乏评测依据漏洞检测项目,我们标注了六万多条数据,用Lora微调大模型,把静态分析误报率从65%降到25%。另外结合AST和CFG图结构,做代码审计,多任务指令微调加思维链,内部测试准确率到98%。第 10 轮作答整段 0%–100%回放第 10 轮作答录音;数字未附评测集与基线,可核验含义见上一条说明
逐条证据地图:每条批评 → 支撑引用 → 轮次 → 回放入口(本场报告完整展示的批评即此 2 条;另 2 条引用支撑 delivery / structure 维度评级,见上上表)。回放窗口为粗略估算,精确核对以录音为准。

已知产品限制(如实披露):评分与批评基于系统转写文本,误听会被沿用——本场「灾备 → 栽培」误听即被用作批评 1 的依据,这是当前版本最重要的可信度风险点。用户可用录音回放人工比对纠偏;改进方向包括转写可修正、低置信度标记与修正后重新评分,当前版本尚不具备这些能力。

五、怎么自己跑一遍(本场 10 轮实测 4 分 25 秒)

  1. 打开 makeinterview.com,上传简历(PDF),粘贴目标岗位 JD
  2. 选一位面试官:HR 初筛 / 直属主管 / 技术专家 / 部门总监 / 高管终面
  3. 全程语音作答;面试官按你的简历和 JD 逐轮追问,敷衍会被继续追
  4. 结束即出六维评分卡:每条批评引用你的原话并附录音回放定位;针对最弱维度可再练

首场免费、无需信用卡。定价(2026-09-28):标准 $9/月,冲刺 $19/月,3 场补给包 $9。评分是模型生成的练习反馈,不是任何雇主的录用信号。

六、方法与披露

运行日期 2026-09-28,在本地环境执行产品的完整代码路径(建会话 → 每轮语音转写 → 面试官引擎 → TTS 播报 → 完成 → 评分),数据库为本地副本,不接触线上数据。被面试者的语音是脚本化中文测试语料经产品自身 TTS(alloy 音色)合成,不是真人录音;面试官的提问、追问、评分、原话引用与回放定位全部是产品的真实输出。样本量 = 1 场(10 轮),结论只描述本场运行,不代表所有场次的分布。域名与品牌:makeinterview.com(站点域名)与 MockLive(产品名)指同一产品。页面每条引用均已与本场转写逐字核对;引文含语音识别的个别误听,按系统原样保留。作者与资质:本页由 MockLive 官方(产品作者)撰写并执行本场实测——是产品自测,不是独立第三方评测,请按此折扣阅读。SERP 抽查于同日完成,且均为结果页摘要级采样(未对每条结果做全文抓取):360 搜索与搜狗已采样,百度因验证码未采样,英文查询来自 Bing。本页不构成就业建议。

本次测试没有证明(N=1 的边界):每次面试都会产生 10 轮追问;所有 JD 与简历事实都会被咬住;评分与真人面试官一致;六维评级能预测真实录用结果;产品在其他场次的稳定表现;与任何竞品的高低。以上均需多次独立运行或同题横向测试才能回答,本页只主张本场实际观察到的行为。