Base / Instruct / Thinking
Base 更接近原始续写能力;Instruct 针对指令跟随;Thinking 通常增加显式推理路径或推理时计算。三者不是简单的性能等级,复现实验必须匹配 checkpoint 类型。
从研究问题出发,逐步形成有证据、可复核的模型决策。
先选择研究模式:严格复现、方法复现、现代化重跑或全新实验。
明确论文、角色、训练方式、资源、开放性和复现约束。
阅读候选模型的进入理由、风险和待核验项,再加入候选或对比。
导出决策记录,保留任务、候选、比较和证据上下文。
从概念进入真实模型与研究任务。
Base 更接近原始续写能力;Instruct 针对指令跟随;Thinking 通常增加显式推理路径或推理时计算。三者不是简单的性能等级,复现实验必须匹配 checkpoint 类型。
Checkpoint 是某个训练阶段保存的权重快照;同一个家族可能同时有 Base、Instruct、Thinking、Coder 等不同 checkpoint。复现时要固定具体 checkpoint 和 revision,而不是只写家族名。
能下载权重不代表训练代码、数据、许可证和完整模型实现都开放。研究决策要分别检查权重、基础 checkpoint、许可证和衍生分发条件。
API 访问降低了部署门槛,但会引入版本固定、服务可用性和数据边界;本地权重增加硬件与许可证责任。不要把“可调用”写成“可复现”。
LoRA 通常只更新适配器,SFT 需要监督样本与训练配方,RL 还需要在线环境、奖励或评估回路。候选模型适合推理,不代表适合所有更新方式。
verified 表示当前记录有足够来源支持;partial 表示部分字段有证据;not_reported、not_disclosed 和 not_verified 不能被当成 false。先看来源与核验日期,再决定是否进入严格复现。
严格复现控制模型与环境;方法复现控制方法变量并允许可比替代;现代化重跑关注方法迁移到当前代模型后是否仍成立。三条路径的成功标准不同。
Dense 模型每个 token 使用同一组参数;MoE 只激活部分专家。total parameters 和 active parameters 不是同一个数字,Landscape 与模型详情会分别保留它们;缺失值显示为待核验。
LoRA 更新适配器,SFT 更新监督训练得到的权重,RL 依赖环境、奖励和评估回路。外部记忆或 prompt 自进化不等于更新模型权重;只有真的训练并保存新 checkpoint,才可称为更新权重的自进化。
论文案例可以提供三层引导:无 GPU 学习路径用于建立机制图;缩小规模的方法验证只检查代码和因果链;严格复现才要求对齐论文版本、模型 revision、数据、基线、超参数和计算资源。三层结论不能混写。
复现不只看模型名称:要固定 checkpoint、model revision、tokenizer、config、chat template、API 版本和硬件条件。论文没有报告时,页面必须保留 not_reported 或 not_verified,而不是补一个看似完整的值。
模型在某个训练阶段保存的权重快照;Base、Instruct 和 Thinking 可能是不同 checkpoint。
解释来源能支持什么、不能支持什么,以及为什么仍然保留未知状态。
固定模型版本、commit 或 API 版本,避免复现实验随服务更新漂移。
硬件档位是粗粒度研究元数据,不是精确显存计算器。