AI 面试题备忘录(20min)
AI 面试题备忘录(20min)
- 用法:引子开场 → 一条主线问下去 → 按候选人表现选支线深挖,哪层答不上就停在哪层
- 核心判断:回答里是否自然出现「我先…→让AI…→我检查/判断…」的驾驶员节奏
- 观众:「模型慢了?换个快的。」驾驶员:「慢在 prefill 还是 decode?该关推理关推理、该精简上下文精简、该换小模型换小模型。」
- 时间:引子 2-3min → 主线 8min → 支线一 4min → 支线二 4min → 支线三 4min
引子:AI 关注度(2-3min)
目的:开场暖场 + 判断他对 AI 感不感兴趣、关不关注。只考兴趣面,不考行业深度(核心在应用层)。
出口:听他提到什么模型/工具 → 自然接主线「你平时用它写代码是什么流程?」
⚠️ 定位:加分项不是门槛。主线/支线答得好但引子答不上 → 不淘汰;引子头头是道但主线讲不出真实例子 → 才是问题(知道很多但没用过)。认知能否转化为行动,执行力优先于好奇心。
不要直接问「你知道XX吗」——会变成知识考试。用事件做追问素材。候选人说不出任何事件 → 主动给一个(如 Fable 5 管制18天),考应变和工程思维,而不是考他记没记住新闻。
问题(全级):最近一两年,AI领域有没有什么事让你觉得「原来还能这样」,或者让你对AI的理解发生了变化?
- 🟢 说出一个具体事件 + 一句话为什么重要;更好:能联系到自己的使用(所以我换了模型/开始用Agent/开始本地部署)
- 🔴 「没关注过」「我就用,不看新闻」→ 减分不致命,追问「平时怎么获取AI信息的?」「现在用什么模型?为什么选它?」
- 判断落点:结论落在「AI好厉害」=观众;落在「所以我应该怎么做」=驾驶员
- 深挖策略:1-2y 入口+1追问(有关注有体感即可)|3-5y 入口+2-3追问(能推导到自己使用方式变化)|5y+ 入口+3-4追问+至少1个「如果你是架构师」视角题
按他的回答选方向深挖(1-2y 选2问 / 3-5y 选3问 / 5y+ 全展开):
| 方向 | 层级 | 追问 |
|---|---|---|
| A DeepSeek时刻 | 1-2y | DeepSeek出来后你用AI的方式有变化吗?换模型了吗?为什么换/不换? |
| 3-5y | DeepSeek最核心的冲击是什么?是「便宜」,还是别的? | |
| 5y+ | 「智能不一定需要堆算力」对应用层意味着什么?基模越强,应用层越不重要还是反过来? | |
| B 多Agent时刻 | 1-2y | 用过Agent类功能吗(自动搜索/写文件/跑代码)?跟普通对话有什么区别? |
| 3-5y | 多Agent和单个大模型对话,本质区别是什么?为什么不能一个模型全搞定? | |
| 5y+ | 设计一个风控场景的多Agent系统:怎么拆?各自负责什么?怎么协调? | |
| C 上下文/记忆/压缩 | 1-2y | 跟AI聊久了它会「忘事」吗?给太多信息反而答得更差吗?你怎么处理的? |
| 3-5y | 怎么理解「上下文窗口」?为什么不能简单地「越大越好」? | |
| 5y+ | KV Cache压缩、可生长记忆这些突破,是不是以后就不用管上下文管理了? | |
| D 基模原理 | 全级 | 大模型为什么会「一本正经地胡说八道」?它的「聪明」和人的「聪明」本质区别在哪? |
好答案锚点:
- A DeepSeek:
- 1-2y:有实际切换体验、「分场景选模型」的判断,不是无脑吹 🔴「中国AI站起来了」「就是便宜了」——纯情绪/表面
- 3-5y:核心不是便宜,是打破「AI是大公司才能玩的游戏」→ 开源→本地部署→数据不出内网,联系到自己业务(如设备指纹不能传外部API)
- 5y+:瓶颈从「模型行不行」转移到「能不能把问题描述清、把流程编排好」;人人都能调模型 → 差异化在编排和领域知识,应用层反而更重要
- B 多Agent:
- 1-2y:普通对话=你问我答,Agent=说目标它自己规划执行;有「跑偏」体验和应对(给更明确约束)
- 3-5y:本质是关注点分离——单模型上下文装不下、注意力分散;多Agent各管一件事、上下文更聚焦,类比全栈工程师vs团队
- 5y+:具体拆法(Planner/Data/Coder/Reviewer/Reporter)+ 协调机制(结构化输出才接得住)+ 承认局限(Agent间传话丢信息如电话游戏,关键决策人confirm)🔴「多个AI一起干活」——无深度
- C 上下文/记忆:
- 1-2y:有「忘事」真实体验+「精简传递」策略,类比跟同事交接(只说进展和下一步注意什么)
- 3-5y:不能越大越好两原因——注意力分散(10个监控屏不如3个看得细)+成本线性增长;关键是「塞对的」不是「塞多的」,联系RAG/代码索引
- 5y+:突破的意义是降成本不是「不用管了」;「该记什么该忘什么」的判断不消失,类比OS内存4G→64G仍要内存管理
- D 基模原理:
- 🟢 本质是「下一个token的概率预测」——在生成最像事实的文本,不是查数据库;优化目标是「像」不是「对」,所以数据覆盖不够就「编一个看起来合理的」
- 🟢 更深:大模型=模式匹配穷举,人=有因果模型的推理(知道为什么、知道何时失效);所以AI擅长模糊问题快速给方向,弱于有明确标准的精确判断
- 🟡 「训练数据有截止日期」——对但浅,只讲了知识过时没讲生成机制
- 🔴 「还不够智能」「算力不够」——无信息量/错误归因
面试官速查·关键事件时间线(⭐=面试价值):
| 时间 | 事件 | 一句话意义 | 价值 |
|---|---|---|---|
| 2022.11 | ChatGPT 发布 | 普通人第一次「摸到」大模型 | ⭐ |
| 2024.9 | OpenAI o1 | 模型学会「慢思考」,推理链显式化 | ⭐⭐⭐ |
| 2025.1 | DeepSeek-R1 开源 | 打破「堆算力=堆智能」,英伟达蒸发5520亿 | ⭐⭐⭐⭐ |
| 2025.4 | o3 / o4-mini | 图像思考+工具自主调用,推理成本砍80% | ⭐⭐⭐ |
| 2025.5-7 | Kimi OK Computer / K2 开源 | Agent 从概念到产品,MoE 工具调用登顶 | ⭐⭐ |
| 2026.1 | Kimi K2.5:100 Agent 并行 | 多Agent集群时代 | ⭐⭐⭐ |
| 2026.2 | MiniMax Expert 2.0 | 「提示词工程」→「自然语言定义SOP」 | ⭐⭐ |
| 2026.3 | DeepSeek V4 | 多模态+100万Token上下文 | ⭐⭐⭐ |
| 2026.3 | 谷歌 TurboQuant | KV Cache压缩6倍,推理提速8倍 | ⭐⭐⭐ |
| 2026.3 | 中国AI调用量首超美国 | 开源铺管道,闭源卖门票 | ⭐⭐⭐ |
| 2026.4 | GPT-5.5 | Agent全链路闭环,「少给指引,多做事情」 | ⭐⭐⭐⭐ |
| 2026.4 | 谷歌 RNN 可生长记忆 | 突破Transformer内存瓶颈 | ⭐⭐⭐ |
| 2026.5 | OpenAI 攻克80年数学猜想 | AI首次数学核心领域自主突破(125页证明) | ⭐⭐⭐⭐ |
| 2026.6.12→7.2 | Anthropic Fable 5 出口管制18天 | AI地缘政治化,「科技无国界」终结 | ⭐⭐⭐⭐ |
| 2026.6.17 | GLM-5.2 开源 | 中国模型首次 Code Arena 登顶(管制后5天发布) | ⭐⭐⭐⭐ |
| 2026.7.16 | Kimi K3:2.8万亿参数开源 | 全球最大开源模型,100万上下文 | ⭐⭐⭐⭐ |
| 2026.7 | OpenRouter 前六全是中国模型 | 开源生态彻底翻转格局 | ⭐⭐⭐ |
| 2026.7 | WAIC:世界模型元年 | AI从「生成内容」到「理解世界」 | ⭐⭐⭐ |
重点事件追问精华:
- GLM-5.2 登顶:3-5y「换模型要考虑什么」→ 能力匹配(不是最强就最好)/成本/数据安全/API稳定性;5y+「管制后5天发布这个时间窗口怎么看」→ 技术储备是提前做的 + AI供应链安全已是工程问题 → 模型抽象层/多模型热备/本地部署兜底
- Fable 5 管制:3-5y「最大的教训」→ 不要把鸡蛋放在别人的篮子里,API背后是地缘政治;本地部署从锦上添花变必须做;5y+「怎么设计不怕被管制的工具链」→ 统一Model Interface/分级策略(核心业务走本地)/降级预案/数据不出域,本质=微服务熔断降级思路
- Kimi K3 2.8T:3-5y「参数大和好用之间还差什么」→ 推理成本/上下文管理/领域适配/工程集成;开源价值=可部署可微调数据不出内网,但2.8T的GPU门槛→实际用API或蒸馏版
- GPT-5.5 少给指引:3-5y「什么场景可以少给、什么必须给清」→ 判断标准=出错代价+能否回滚;探索性任务放手,生产性任务给清约束;5y+「开发者角色变成什么」→ 定义问题+验证结果;人在loop机制=人工checkpoint/写操作必须确认/blast radius限制/可审计可回滚
- 数学猜想:「跟AI写代码是一回事吗」→ 证明有唯一正确标准可验证,AI擅长;写代码的「对」是多维的(功能/性能/可维护/规范/安全),AI只能保证功能对;证明=明确规则内找路径,写代码=模糊需求中做取舍
- OpenRouter 霸榜:3-5y「开源为何超闭源」→ 部署自由+数据安全+不被管制+不被定价绑架;选模型不是选最强,是选最适合+最可控
总评分锚点:
| 层级 | 表现 |
|---|---|
| L0 | 「没关注过」「我就用,不看新闻」→ 减分不致命 |
| L1 | 1个事件+一句话概括 → 1-2y合格 |
| L2 | 事件+对自己使用方式的影响(所以我换了模型/开始本地部署)→ 1-2y优秀/3-5y合格 |
| L3 | 事件+技术意义+行业影响(开源铺管道闭源卖门票)→ 3-5y优秀 |
| L4 | 事件→架构决策(所以我要做模型抽象层+多模型热备)→ 5y+合格 |
| L5 | 多事件→趋势判断(对话→Agent→多Agent→闭环,瓶颈从模型转移到编排)→ 5y+优秀 |
与核心判断对齐(每个事件都可验证候选人是不是「驾驶员」):
| 核心判断 | 对应事件 | 好答案体现 |
|---|---|---|
| 瓶颈不在基模,在应用层 | GPT-5.5/Agent | 模型够用了,关键在编排和领域知识 |
| AI价值=让试错变快变便宜 | o4-mini砍80%/DeepSeek开源 | 成本低→试错多→迭代快 |
| 人出判断,AI出速度 | 数学猜想/Agent闭环 | AI能证明,但「证明什么」是人定的 |
| 私有知识是AI天然缺位 | GLM-5.2/开源微调 | 通用模型不懂我的业务,要自己补 |
终极一问:候选人讲完事件后,结论落在「AI好厉害」还是「所以我应该怎么做」?前者是观众,后者是驾驶员。
主线:AI Coding 全流程(8min)
从一个真实例子切入,顺着他讲的流程一路挖到底。这是主菜,必须问透。
| 层级 | 问题 |
|---|---|
| 1-2y | 拿到需求到代码提交,中间怎么用AI的?讲个最近的真实例子 |
| 追问 | AI到底帮你省了哪一步? |
| 全级 | AI生成的代码,你怎么判断它是对的?被坑过吗? |
| 3-5y | 哪一步AI帮不了你、或者帮倒忙?后来怎么处理的? |
| 3-5y | token消耗大吗?你怎么控制给AI的上下文?给多给少分别会怎样? |
| 5y+ | 上下文装不下的复杂任务,怎么让AI跟你跑完全程? |
| 5y+ 加分 | 团队要做到偏AI Coding,需要建设哪些能力?哪些环节人不可替代? |
好答案锚点:
- 流程:有「先自己想→让AI跑→自己验证」节奏,有细节(贴了什么、AI哪里写错、改了什么)
- 🔴 「丢给AI生成,看看没问题就提交」——无细节、无验证
- 验证:分层——看逻辑边界 → 查引用的类/方法是否真实存在 → 跑测试;有被坑实例(幻觉API、正则贪婪、并发默认值)
- 🔴 「跑一下没报错就行」
- 卡点:归因到「AI缺私有知识/内部规范」,解法是主动补约束(如线程池规范写进prompt)
- 🔴 「跑不通就自己改改」——归因模糊
- Token:「刚好够」原则——只贴相关方法、贴接口签名不贴实现、贴一个已有样例代替描述、对话长了总结后开新对话;知道多了会「注意力分散」、少了会开始「编」
- 长任务:拆阶段+带结论——每个对话只做一件事,做完总结带进下一对话;不指望一个对话跑到尾
- 🔴 「一直聊,忘了就重新说一遍」——无编排策略
- 全链路:四层——需求层(语音/会议→PRD)、知识层(代码索引+知识库降token)、方案层(PRD+索引→穷举方案)、编码层(方案→代码)
- 人不可替代:定义需求边界、方案取舍、CR兜底、上线决策与定责
支线一:答不对时怎么办——归因能力(4min)
从主线中他提到的卡点自然过渡:「你刚才说AI会写错,那有没有它明明该答对但就是答不对的情况?」
| 层级 | 问题 |
|---|---|
| 1-2y | 有没有AI「明明该答对但就是答不对」的情况?讲个具体例子,当时卡在哪? |
| 3-5y | 是模型能力不够,还是你给的信息不够?你怎么判断的? |
| 5y+ | 团队怎么系统性减少这类「答不对」?prompt规范/知识库/RAG怎么选?怎么衡量「答对了」? |
好答案锚点:
- 能分类归因并给对应解法:
- 缺领域知识 → 补DSL语法+贴已有样例
- 上下文溢出 → 精简到入口类+目标方法+接口定义
- 指令模糊 → 明确边界,说清楚「不要什么」
- 幻觉 → 引用的类名先在IDE搜一遍再用
- 🔴 「多问几遍」「换个更强的模型」——只会升级装备,不会调整驾驶方式
支线二:AI 替代的边界(4min)
从「AI帮不了你」继续往下挖:「那再往大了说,你觉得AI替代不了什么?」
| 层级 | 问题 |
|---|---|
| 1-2y | AI替代不了什么?你工作中有什么事是AI肯定干不了的? |
| 3-5y | 如果给AI足够的数据和规则,它是不是就能做了?边界到底在哪? |
| 5y+ | 怎么跟老板解释「用了AI但还是要这么多人」?AI会怎么改变团队分工? |
好答案锚点:
- 防背诵:至少讲到两条,且有自己的推导和例子
- 责任归属:AI不能背锅,「这条规则上不上」必须人拍板
- 私有知识:散落人脑里的经验/直觉/历史背景,没法结构化喂给AI
- 取舍是价值判断:选误杀低还是漏放低,取决于业务阶段,AI给不了
- 定义问题 > 解决问题:「这是不是真需求」由人提出
- 🔴 背套话:「创造力、情感、共情」「AI没有意识」——无推导无例子
支线三:模型响应速度——工程实践(4min)
融合实战版:一题覆盖上下文窗口 + 工具挂载 + 模型选择 + 推理策略 + 输出控制。比问「MCP是什么」更自然、更难背——背答案的人只会说「换个快的模型」,驾驶员会拆解慢在哪个环节。
基模认知(推理模式/MoE/参数量)在这里浅问,能落到「所以你怎么用」即可,不深挖原理。
| 层级 | 问题 |
|---|---|
| 全级 | 用AI工具时有没有觉得响应太慢?你一般怎么让它快一点? |
| 3-5y | 响应快慢跟哪些因素有关?能列一下吗?哪个影响最大? |
| 3-5y | 什么时候开推理模式、什么时候不开?怎么判断的? |
| 5y+ | 快和好怎么平衡?你是不是一直用最快/最强的模型? |
好答案锚点:
- 因素层(3-5y,能列4个以上为🟢):
- 输入长度:上下文越大 prefill 越慢;含历史消息 + MCP/SKILL 挂载底噪——MCP 把工具 schema 全量注入常驻上下文,挂越多每次请求越慢(SKILL 懒加载只挂描述,正是为此而生)
- 推理模式:开了深度思考(o1/DeepSeek-R1 类),先「想」一大段再答,生成量翻 5-10 倍
- 参数量+架构:参数越大越慢;MoE(总参数大但每次只激活一小部分)比同规模 Dense 快很多
- 输出长度:让它写 500 行代码肯定比答一个是/否慢——最直接可控的变量
- 🟡 只列「上下文+模型大小+网络」——方向对但不全;🔴「换个快的模型」——无拆解能力
- 解法层(先定位慢在哪,再针对性优化):
- 读得慢(prefill):精简上下文只给当前需要的 / 不用的工具不挂载 / 不变的内容放前面吃前缀缓存
- 想得慢(推理):简单问题关推理 / 复杂问题限思考 token / 拆步问
- 写得慢(decode):限输出长度 / 只要关键方法不要整个类 / 流式输出改善体感
- 模型本身慢:分场景路由——简单任务走小模型,不是一直用最贵的
- 取舍层(5y+):分场景分级——探索阶段(想方案)用推理模型质量优先;执行阶段(写代码改bug)用快模型速度优先、质量靠自己 review;验证阶段不靠模型靠单测。不是一直最快、也不是一直最强,是当前这一步需要什么选什么
评分:L1 知道精简上下文/换小模型(1-2y合格)|L2 列4+因素、能区分读慢/想慢/写慢(3-5y合格)|L3 有分场景选模型策略、讲清快与好的 trade-off(3-5y优秀)|L4 取舍背后有一致的方法论:出错代价+可回滚性决定放手程度(5y+)
终极判断
| 差答案(被AI用) | 好答案(用AI) | |
|---|---|---|
| 节奏 | 先问AI,等AI告诉我怎么办 | 我先想 → 让AI跑 → 我检查 |
| 归因 | 换个模型再试试 | AI缺的是XX信息,我来补 |
| 验证 | 跑一下没报错就行 | 这一步AI做不了,因为… |
| 特征 | 背概念、无细节、无归因 | 有细节、有归因、有取舍 |
