AI八股结合项目经历(待整理)

模型类问题:

transfomer,bert,与llm

gpt与llama

encoder decoder glm早期模型

多头注意力

线形注意力

滑动上下文窗口

tokenizer,分词技术,词表从何而来

预训练、微调、对齐(SFT、RLHF)

llama3开源最强模型,数学和代码能力勉强追逐gpt4(中文微调版),模型结构

cot 思维链的推理力量

追逐gpt-o1的 deepseek moment 强化学习(同期模型,qwen,草稿模型)

vit transformer如何统一视觉模态

rag与记忆相关:

embeding向量化

rerank重排

bm25关键词检索 混合

graph rag 图谱关系、实体解析

k-means 大规模向量点检索聚类速度优化(分层聚类)

长短时记忆

自洽闭环的遗忘策略(频率、时间、用进废退)

突破短上下文窗口限制

模型部署相关:

软:

模型部署资源估计(模型参数量、量化精度和格式、moe/dense、dp/tp、上下文长度、kv cache精度)

chat模版 输出采样(温度、topk、topp等)

api分发,负载均衡

开源部署方式(vllm、lmdeploy、sglang、llama.cpp)

模型调用压力估算,泊松分布,单请求速度、并发速度、预填充速度、推理速度

api聚合 one-api 日志采集改造

硬:

硬件资源采购、cpu、内存、gpu基础配置要求

cuda torch等基础环节配置 conda docker...

智能体类问题:

智能体与工作流的区别

ReAct、ReWoo、Compiler等Agent框架

常用产品平台或编程库 fastgpt,dify,langchain

结构化解析、工具调用、指令遵循对齐(模型算法相关)