要理解大模型,只需要抓住三个词:Token、上下文、概率。
Token:模型的基本单位
模型不能直接读文字,读的是 Token——把文本切开后的最小单位。一个英文单词大约是 1 到 2 个 Token,中文一个字大约 1 到 2 个 Token。你调用模型 API 是按 Token 收费的,上下文长度也是按 Token 算的,所以这个词是理解后面所有成本和限制的钥匙。
上下文窗口:模型的「工作记忆」
模型单次能「看到」的内容量就是上下文窗口,从早期的几千 Token 到如今的几十万甚至上百万 Token。窗口越大,能一次塞进去的文档越长,但费用也越高——因为每一轮对话,历史内容都要重新算一遍。
概率:为什么会「一本正经地胡说八道」
大模型的本质是预测「下一个 Token 的概率分布」。它不是在数据库里查答案,而是在生成统计上最像答案的文字。所以它会自信地编造不存在的文献和 API 参数——这就是幻觉(Hallucination)。缓解幻觉靠的是给它喂真实资料(RAG,后面专篇讲),而不是反复重试。
常见模型一览
国际线有 GPT、Claude、Gemini;国内线有通义千问(Qwen)、DeepSeek、文心、混元等。选型逻辑很简单:能力强的贵,便宜的反应快,开源的(如 Qwen、DeepSeek)可以私有化部署。对多数企业场景,先从「API 调用旗舰模型的轻量版」开始,是最稳妥的路径——具体怎么接,下一篇展开。
系列导航
AI 通识(0):系列总纲与目录 · AI 通识(1):大模型是什么——从 Token 说起 · AI 通识(2):企业接入大模型的三种方式——API、RAG 与微调 · AI 通识(3):大模型成本账单怎么看——Token 计价与省钱策略 · AI 通识(4):前世今生·上——图灵、达特茅斯与两次寒冬 · AI 通识(5):前世今生·中——深度学习革命,从深蓝到 AlphaGo · AI 通识(6):前世今生·下——大模型时代与今天的竞赛
📄 本文累计阅读 7 次;备考中卡在哪个知识点?欢迎在评论区留言,下一篇优先讲大家问得最多的。
手机相机或微信「扫一扫」打开文章