模型类问题:
transfomer,bert,与llm
gpt与llama
encoder decoder glm早期模型
多头注意力
线形注意力
滑动上下文窗口
tokenizer,分词技术,词表从何而来
预训练、微调、对齐(SFT、RLHF)
llama3开源最强模型,数学和代码能力勉强追逐gpt4(中文微调版),模型结构
cot 思维链的推理力量
追逐gpt-o1的 deepseek moment 强化学习(同期模型,qwen,草稿模型)
vit transformer如何统一视觉模态
rag与记忆相关:
embeding向量化
rerank重排
bm25关键词检索 混合
graph rag 图谱关系、实体解析
k-means 大规模向量点检索聚类速度优化(分层聚类)
长短时记忆
自洽闭环的遗忘策略(频率、时间、用进废退)
突破短上下文窗口限制
模型部署相关:
软:
模型部署资源估计(模型参数量、量化精度和格式、moe/dense、dp/tp、上下文长度、kv cache精度)
chat模版 输出采样(温度、topk、topp等)
api分发,负载均衡
开源部署方式(vllm、lmdeploy、sglang、llama.cpp)
模型调用压力估算,泊松分布,单请求速度、并发速度、预填充速度、推理速度
api聚合 one-api 日志采集改造
硬:
硬件资源采购、cpu、内存、gpu基础配置要求
cuda torch等基础环节配置 conda docker...
智能体类问题:
智能体与工作流的区别
ReAct、ReWoo、Compiler等Agent框架
常用产品平台或编程库 fastgpt,dify,langchain
结构化解析、工具调用、指令遵循对齐(模型算法相关)