什么是大语言模型?它是怎么生成文本的?
大语言模型是用海量文本预训练的参数化概率模型:对输入计算下一个词的概率分布,采样一个词接回输入,循环生成完整文本。
完整回答
两个工程推论更重要。第一,模型无状态,每次调用独立,记忆来自你传给它的消息历史;第二,输出是概率采样而不是查表,同一输入可能得到不同输出,稳定性要靠采样参数、结构化输出和评估集在应用层保证。
加分信息
- 主动指出无状态意味着记忆要在应用层实现
- 能用概率采样解释输出波动而不是玄学化
常见问题
- 把模型当成会记忆、会思考的数据库
- 只会背“预测下一个词”,讲不出任何工程推论
面试官可能追问
- 既然模型无状态,多轮对话的记忆是怎么实现的?
- 为什么同一句话问两次,答案可能不一样?
暂无直接项目关联;可在 Prompt 调试与回归台(/labs/prompt-regression)观察同一输入多次运行的通过率差异。