2026年9月15日从 ELIZA 到 Kimi K3:大模型 60 年,真正跨过的是四道门槛一张 AI 时间线把 ELIZA、感知机、反向传播、Word2Vec、Transformer 和前沿模型串在一起。真正值得带走的不是年份,而是表示、学习、路由与规模四道瓶颈如何依次被解除。AILLMTransformer零基础学习笔记
2026年9月15日X 上值得长期关注的 20 个大模型与 Agent 英文账号从 Avi Chawla 出发,实看 25 个 X 账号后留下 20 个英文一手信息源,按教程、Agent 工程、研究与行业反方四层整理;附只关注 6 人的精简版和四张可直接照抄的 X Lists。AILLMAgentAgent 工程学习笔记
2026年8月24日手把手把 5 节点流程编译进 0.5B 权重——Subterranean Agent 实操陪读篇主篇给了 arXiv 2605.22502 的整套数字(128–462× 便宜、8B 打过 Claude 4.5 + LangGraph),但真正在 A100 上复现 8B 版本对读者门槛太高。这篇把管线缩到 8GB 消费级显存能跑的版本:5 节点日报归档流程 → 用 Claude Sonnet 4.5 合成 200 条对话(约 $1.70)→ Qwen2.5-0.5B 全量微调(bfloat16,~7GB 显存,M2 Pro 15 分钟)→ 对照 Claude API in-context。每一步给完整可跑代码、显存/时间/成本手算数字、以及一份 12 项自检清单。诚实标注:我没有实机跑完全流程,给出的数字是官方规格+手算估计,读者跑通请回来纠正。AILLMAgentAgent 工程学习笔记
2026年7月28日nanoGPT config 不是参数表:一张 LLM 训练配方地图从 LLM 训练的大背景出发,系统讲解 nanoGPT config 目录里的训练、微调、评估配置,以及 batch、context、模型大小、AdamW、学习率、DDP、dtype 等参数如何在源码中生效。AIAI InfraLLMTransformer模型训练源码阅读学习笔记
2026年7月28日从 65 个字符开始:nanoGPT 的 Shakespeare 字符级语言模型数据准备用 nanoGPT 的 shakespeare_char prepare.py 串起字符到整数 id、train.bin/val.bin、meta.pkl、next-token 训练样本,以及它和 BPE/GPT-2 路线的差别。AIAI InfraLLM源码阅读学习笔记
2026年7月28日读懂训练曲线:从一张 val/loss 图判断模型有没有真的变好用一张验证损失曲线拆解训练图的读法:先看坐标和指标方向,再看趋势、噪声、对照和决策,最后用 train loss、val loss、数据切分和优化过程串起因果链。AILLM学习笔记
2026年7月22日Lilian Weng 新文深读:Scaling Law 不是物理定律,是一次高杠杆的赌注《Scaling Laws, Carefully》深度消化:为什么深度学习最著名的"定律",两篇奠基论文能得出相反的结论(Kaplan 的 0.73 vs Chinchilla 的 0.5);为什么 Chinchilla 自己也有一个求和写成平均的拟合 bug;以及当"数据无限"假设过期之后,scaling law 正在被改写成什么形状。LLM学习笔记
2026年7月21日Loop 还是 Graph?这是个假问题——Agent 架构之争的真正变量,是控制流的真相放在哪里Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。AILLMAgentAI Infra论文深读学习笔记
2026年7月20日Agent 工程七问:如何把一个随机内核,包装成能托付长任务的可靠系统状态记录、失败恢复、沙箱隔离、多轮评测、test-time compute 分配、上下文组织、速度/成本/成功率联合优化——七个问题共享同一个答案结构:把真相移到模型外面。AILLMAgentAI Infra上下文工程学习笔记
2026年7月20日为什么生成一个 token,要把权重从内存搬到计算单元旁边?从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。AIAI InfraLLMTransformer学习笔记
2026年7月20日Lilian Weng 新文深读:当 Harness 本身成为被优化的对象《Harness Engineering for Self-Improvement》深度消化:递归自我改进不会从模型改写自己的权重开始,而是从部署层开始。被优化对象的爬升路径(prompt → context → workflow → harness 代码 → 优化器代码),以及为什么评估器必须留在循环之外。Agent学习笔记
2026年7月17日Agent 的内存管理:Claude Code 与 Codex 如何决定"忘掉什么"深度拆解 Claude Code / Codex 的上下文淘汰策略:分层压缩管道、compaction 幸存规则、KV cache 淘汰的同构问题,以及 arXiv 论文给出的反直觉证据——简单丢弃常常不输昂贵的摘要。AILLM上下文工程Codex学习笔记
2026年7月17日Claude Code 和 Codex 还在用 RAG 吗?——代码检索为什么回到了 grep拆解 Claude Code / Codex 的代码检索机制:为什么两家都放弃了向量索引式 RAG,改用 agentic search(grep + 模型闭环);Fetch 工具到底是干什么的;以及 arXiv 论文链条给出的证据与边界。AILLMRAG搜索Codex学习笔记
2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingTransformer学习笔记
2026年7月15日vLLM 0.25.0 解读:PagedAttention 退场,MRv2 接管从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。AIAI InfravLLMLLM Serving学习笔记
2026年7月14日任务能力怎样写进 LLM 权重:从一次梯度更新到预训练与对齐沿着一条训练信号的旅程,解释 loss、gradient、AdamW 怎样改变权重,并串起预训练、SFT、RLHF、DPO、LoRA 与上下文学习。AILLM模型训练学习笔记
2026年7月10日Agent 能力会被内化吗:外部系统、模型训练与研发护城河深读 Externalization、Toolformer、TInR、RISE、Agent Skills 等论文:哪些 Agent 外部系统会被模型内化,哪些不会,未来研发竞争力会迁移到哪里。AILLMAgent工具调用学习笔记
2026年7月10日Agent 长记忆不是向量库:从记忆流到内存管理消化 Generative Agents、Reflexion、MemGPT、Mem0 和 A-Mem:为什么 Agent 长记忆不是简单存聊天记录,而是一套写入、整理、检索、更新和评估系统。AILLMAgent记忆学习笔记
2026年7月10日Agent 做长任务为什么会崩:从时间跨度到失败归因消化 Voyager、METR long tasks、TheAgentCompany、SWE-Bench Pro、Odysseys、WildClawBench 和 HORIZON:长任务能力为什么不能只看成功率。AILLMAgent评测学习笔记
2026年7月8日AgentBench 学习笔记:评测 Agent,不能只看它怎么回答消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。AILLMAgent评测学习笔记
2026年7月8日Evoflux 学习笔记:小模型不会稳定用工具时,先别急着微调消化 Evoflux 论文:为什么紧凑模型在 MCP 风格工具调用里容易失败,Evoflux 如何把工具调用看成可执行工作流的推理时演化修复,以及它对 Agent 系统设计的启发。AILLMAgent工具调用MCP学习笔记
2026年7月8日HELM 学习笔记:模型评测不是跑榜,而是建立一张能力地图消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。AILLM评测AI Infra学习笔记
2026年7月8日IFEval 学习笔记:别只问模型聪不聪明,先测它是否真的听话消化 IFEval 论文:为什么指令遵循需要可验证评测,IFEval 如何用 25 类可检查约束构造约 500 条样本,以及它对 prompt 和模型发布门禁的启发。AILLM评测学习笔记
2026年7月8日LLM-as-a-Judge 学习笔记:让模型当裁判,到底靠不靠谱消化 MT-Bench 与 Chatbot Arena 论文:为什么开放式回答难以自动评测,LLM-as-a-Judge 如何近似人类偏好,以及 position、verbosity、self-enhancement 等偏差该如何处理。AILLM评测学习笔记