主题定位:大模型从底层规律 → 分布式训练 → 推理缓存 → Prompt 工程 → 服务化的逻辑链路。


# 底层规律 Scaling Law

AI 模型的性能,与计算量(算力)、数据量和模型参数量呈可预测的幂律关系。

最近业界确实发现,单纯靠 “堆料” 越来越吃力了,原因有三:

  1. 数据耗尽(Data Wall):人类互联网上高质量的文本数据(书籍、论文、新闻)快被 AI “吃光” 了。如果没有高质量的新数据,拿 AI 生成的垃圾数据去继续训练 AI,会导致模型 “崩溃” 或变笨。
  2. 算力与能源墙:训练下一代超级大模型需要几万甚至几十万张顶级显卡,耗电量堪比一个中型城市。连电网都快承受不住了,成本高到连科技巨头都肉痛。
  3. 边际收益递减:以前投入 10 倍的算力,AI 能变聪明一倍;现在投入 10 倍的算力,可能只换来 10% 的性能提升。而且,单纯靠 “死记硬背” 海量数据,很难让 AI 在复杂的逻辑推理(比如解未知的数学大题)上产生质的飞跃。

这与摩尔定律遭遇的物理墙、经济墙在逻辑上相互呼应

# 分布式训练并行

  • 张量并行 & 数据并行:都需要 all-reduce(梯度全拼全处理)。
  • 流水线并行(按 transformer 层切分):只需 send / receive

# 推理缓存机制:KV Cache vs Context Cache

一句话区分:KV Cache 是为了让模型当下算得快;Context Cache 是为了把算好的 KV Cache 存起来,让模型下次不用重算。

核心误区:为什么连续对话不能自动 100% 命中缓存?

答:因为显存太贵,服务器等不起你。你发完一句话,服务器生成回答后,为了把显存让给其他用户,会立刻清空你的缓存。当你发下一句时,前端其实是把 "历史记录 + 新问题" 打包重发,服务器只能从头重算一遍。

KV Cache(底层机制:算草纸)

  • 通俗比喻:做数学题的算草纸
  • 是什么:模型为了不每次都重算前面的字,把中间计算结果临时存下来。
  • 作用范围:仅限当前这一次点击发送。生命周期极短(用完即扔),本次回答一生成完立刻销毁。

Context Cache / Prompt Cache(高级功能:档案柜)

  • 通俗比喻:厚书的精华笔记
  • 是什么:为了不每次都重读长文档 / 长对话,系统把算好的 KV Cache 单独存到硬盘或内存里,贴上标签。
  • 作用范围:跨请求 / 跨用户共享。只要发来的文本开头一模一样(比如同一本 PDF),直接调出笔记瞬间理解;生命周期较长(按需保留),可存活几分钟到几天。

# 上下文(context)管理策略

不同的 context 管理方式:

  1. 透明缓存:自动的、默认开启的缓存机制,系统自动识别。
  2. 前缀缓存(显式缓存):手动设置,主动标记。
  3. Session 缓存:会话级别的缓存,专门为多轮对话设计,自动管理整个对话历史。

# Prompt Engineering

优化路径:指令优化 → Few-shot → COT → Few-shot & COT

  • 指令优化时需要针对客户提供收集的 case:
    • 最好 goodcase + badcase 数量多于 50;
    • 两者都要有,good 的占比在 4-6 成;
    • goodcase 多样随机化;每种 badcase 有两条及以上。
  • 有时 COT 和 Few-shot 会存在不可兼得的指令冲突,所以得测试一下。
  • 将复杂任务拆解为多个简单任务。

# 高级推理框架 TOT

TOT(Tree of Thoughts) 是由普林斯顿大学与 Google DeepMind 研究人员共同提出的 LLM 推理框架。

  • Chain of Thought(CoT) 方法不同,TOT 在推理的每一步都会生成多个 "思考路径"(thoughts),并评估每条路径解决问题的可能性。
  • 该框架支持在必要时进行剪枝和回溯,可应用广度优先搜索(BFS)或深度优先搜索(DFS)等策略。

# 大模型服务化

  • MaaS(Model as a Service):模型即服务,本知识库的整体主题背景(大模型 MaaS 学习记录)。
  • AML(Applied Machine Learning,应用机器学习):也即 "机器学习中台"。
总访问量:加载中...更新于

谢谢你请我喝[茶]!(๑OvO๑)♪

柳小寒寒子 微信支付

微信支付