2026年7月16日上下文窗口里的干预权重:为什么模型更听开头、最近和当前任务基于长上下文与多轮对话论文,拆解上下文里哪些信息最能干预模型输出、哪些信息会被有效淘汰,以及如何安排系统提示、历史、摘要和当前任务。learning-logLLMPrompt 工程Agent
2026年7月16日提示词之后:上下文工程如何接管 LLM 应用质量从系统提示词、用户提示词、会话上下文、检索上下文、Token 窗口、幻觉抑制和提示词模板库出发,结合 arXiv 论文解释为什么 LLM 应用的核心工程对象正在从 prompt 变成 context。AILLMPrompt 工程上下文工程RAGAI Infra
2026年7月15日AI 数学全景拆解:从研究前沿一路拆到小学算术,不跳步(完整节点版)把 AI 用到的全部数学,从最高层一层层往下拆,每个概念只连它真正的直接前置,中间绝不跳步,一直拆到小学的加减乘除。六大主干(线性代数/微积分/概率统计/优化/信息论/离散)各附主脊图与完整节点表,顶层覆盖 AI 各子领域用到的数学——并解释为什么"听不懂"几乎总是某个下层前置没补上,而不是你不行。AI 数学LLM
2026年7月15日从提示词到工作制度:Superpowers Skill 的结构上下文哲学结合 Superpowers 的 brainstorming、TDD、worktree、writing-skills 设计,以及 Agent Skills、Externalization、SkillsBench、Parametric Skills、HASP 等论文,解释为什么 skill 的本质不是更多 prompt,而是把 Agent 的工作上下文做成可触发、可验证、可复盘的结构。AILLMAgent上下文工程AI Infra
2026年7月14日站在 AI 的山巅:一句话 + 12 条原理,读懂从符号主义到大模型的所有设计与其把每篇论文当孤立的知识点去背,不如握住一副望远镜。这篇把整部 AI 史压成一句话,再展开成 12 条跨时代的顶级原理——每条都配一个从"老 AI"到今天的例子和一个透镜问题。读到发懵的论文,往这 12 条上一映射,雾气就散了。LLM
2026年7月14日把智能体当人用:Claude Agent SDK 的架构设计哲学不是功能罗列,而是深读 Claude Agent SDK 的设计思想——为什么"给智能体一台电脑"、agent loop 为什么是控制循环、上下文窗口如何成为一切设计的隐形主线、以及为什么可靠性工程发生在 harness 而不是模型里。AI InfraAgentLLM
2026年7月14日不教,只给激励:DeepSeek-R1 如何让大模型自己"长"出推理能力深读发表于 Nature 的 DeepSeek-R1 论文——它证明了一件反直觉的事:复杂推理不必靠人类标注的思维链一步步教,而是用对了奖励,让模型在强化学习里自己长出来。从 GRPO、规则奖励、"aha moment"到四段式流水线与蒸馏,一条主线讲透当前推理模型这一代范式。LLM
2026年7月14日任务能力怎样写进 LLM 权重:从一次梯度更新到预训练与对齐沿着一条训练信号的旅程,解释 loss、gradient、AdamW 怎样改变权重,并串起预训练、SFT、RLHF、DPO、LoRA 与上下文学习。AILLM模型训练学习笔记
2026年7月14日一组权重,为什么能学会许多任务:条件化计算、梯度冲突与多任务收敛从一个根本无解的双标签训练集出发,解释任务条件、不同激活、梯度夹角、Pareto 折中,以及怎样让一个模型可靠地同时学会 A、B 和更多任务。AILLM模型训练
2026年7月13日Graphify 源码深潜:从 AST 构图到 LLM 任务的上下文装配从语法树构图、跨文件消歧和图遍历查询,到 Skill、AGENTS.md、CLI 与 MCP 接入,讲清 Graphify 如何在构图期与任务运行期分配 LLM 职责。AIAgentLLMMCP源码阅读
2026年7月13日从 Attention 到 PagedAttention:用 llama.cpp 跑通 Qwen2.5-7B 后,我终于看懂了 LLM 推理主线用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。AIAI InfraLLMTransformerllama.cppvLLM
2026年7月13日Decode 为什么跑不到理论带宽:KV cache、activation、反量化和调度开销系统拆解 decode 实测速度低于理论带宽上限的原因:权重读取、KV cache、activation、反量化 metadata、kernel 调度和 cache miss。AIAI InfraLLM评测llama.cpp
2026年7月13日采样不是玄学:从 logits 到 temperature、top-k、top-p用一次 llama-cli 采样实验讲清 logits、softmax、temperature、top-k 和 top-p 的真实作用。AIAI InfraLLMllama.cpp数学
2026年7月10日Agent 能力会被内化吗:外部系统、模型训练与研发护城河深读 Externalization、Toolformer、TInR、RISE、Agent Skills 等论文:哪些 Agent 外部系统会被模型内化,哪些不会,未来研发竞争力会迁移到哪里。AILLMAgent工具调用学习笔记
2026年7月10日Agent 长记忆不是向量库:从记忆流到内存管理消化 Generative Agents、Reflexion、MemGPT、Mem0 和 A-Mem:为什么 Agent 长记忆不是简单存聊天记录,而是一套写入、整理、检索、更新和评估系统。AILLMAgent记忆学习笔记
2026年7月10日Agent 做长任务为什么会崩:从时间跨度到失败归因消化 Voyager、METR long tasks、TheAgentCompany、SWE-Bench Pro、Odysseys、WildClawBench 和 HORIZON:长任务能力为什么不能只看成功率。AILLMAgent评测学习笔记
2026年7月10日换空间是一种数学肌肉记忆:从 LLM 到顶级数学家的思考方式从交叉熵、embedding、RoPE、量化和 LoRA 出发,讲清为什么数学家和工程师总是在换空间,以及如何把这种提问方式练成日常肌肉记忆。AIAI InfraLLM数学
2026年7月10日攻克数学恐惧:从顶级数学家的脑回路,到一条可训练的数学探索路径从 Euclid、Euler、Gauss、Riemann、Noether、Poincare、Hilbert、Grothendieck、von Neumann、Ramanujan 和 Tao 的思维动作里,提炼一条适合 AI Infra 学习者的数学探索路径。AIAI InfraLLM数学
2026年7月10日PPL 是什么:把模型困惑度理解成平均岔路数用 Qwen2.5-7B 的 llama-perplexity 实测结果,讲清 PPL、交叉熵和量化质量评估之间的关系。AIAI InfraLLM评测llama.cpp数学
2026年7月10日本机实操一次最小大模型蒸馏:用 GGUF Qwen 当 teacher用本机 GGUF Qwen teacher、llama-server top-k logprobs 和 NumPy tiny student,讲清大模型蒸馏里的 soft labels、KL loss、训练流程和最小实现。learning-logAILLMAI Infrallama.cpp
2026年7月10日为什么交叉熵偏偏要用 log:从模型开发者脑回路理解 PPL从模型开发者会遇到的概率连乘、数值下溢和训练优化问题出发,还原 log、ln、exp、交叉熵与 PPL 之间的动机链条。AIAI InfraLLM评测数学
2026年7月9日Decode 速度上限公式:为什么 4.677GB 模型、16.99 tok/s 反推约 79.5GB/s用 Qwen2.5-7B llama-bench 的真实数据,讲清 decode 为什么常被内存带宽卡住、bandwidth / model_size 怎么估理论上限,以及 79.5GB/s 这个反推数字到底代表什么。AIAI InfraLLM评测llama.cpp数学
2026年7月9日KV cache 那笔账:为什么 Qwen2.5-7B 在 2048 长度下大约是 117MB从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。AIAI InfraLLMTransformerllama.cpp数学
2026年7月8日AgentBench 学习笔记:评测 Agent,不能只看它怎么回答消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。AILLMAgent评测学习笔记