Jixue AI学习库
返回知识库
LLM入门

大模型是什么

大语言模型(LLM)是用海量文本预训练的参数化概率模型,逐词生成文本。

01

为什么重要

理解它在算概率而不是在查答案,才能解释输出波动、幻觉,以及为什么对话历史要自己传。

02

核心原理

预训练把语言统计规律压进参数(模型里的数值权重);推理时对输入计算下一个词的概率分布,采样一个词接回输入再重复。模型无状态:每次调用互相独立,它只知道你这次发给它的内容。

03

工程实现

  • 记忆靠应用层传历史,模型自己不存
  • 同一输入可能给出不同输出,用评估集兜底
  • 把模型当无状态函数设计系统
04

展开说明

让它续写“巴黎是法国的”,它倾向生成“首都”,因为训练文本中这个位置该词概率最高,而不是它查了一张事实表。

05

常见误区

  • 以为模型记得上一次对话
  • 把输出当数据库查询结果,期待永远一致
06

面试怎么说

LLM 是预训练得到的参数化概率模型,逐词采样生成;工程上按无状态服务对待,记忆、稳定性和正确性都在应用层补。