大模型是什么
大语言模型(LLM)是用海量文本预训练的参数化概率模型,逐词生成文本。
为什么重要
理解它在算概率而不是在查答案,才能解释输出波动、幻觉,以及为什么对话历史要自己传。
核心原理
预训练把语言统计规律压进参数(模型里的数值权重);推理时对输入计算下一个词的概率分布,采样一个词接回输入再重复。模型无状态:每次调用互相独立,它只知道你这次发给它的内容。
工程实现
- 记忆靠应用层传历史,模型自己不存
- 同一输入可能给出不同输出,用评估集兜底
- 把模型当无状态函数设计系统
展开说明
让它续写“巴黎是法国的”,它倾向生成“首都”,因为训练文本中这个位置该词概率最高,而不是它查了一张事实表。
常见误区
- 以为模型记得上一次对话
- 把输出当数据库查询结果,期待永远一致
面试怎么说
LLM 是预训练得到的参数化概率模型,逐词采样生成;工程上按无状态服务对待,记忆、稳定性和正确性都在应用层补。