2026年8月3日Agent 如何控制浏览器:从 HTTP、DOM、CDP 到视觉与混合自动化系统拆解 Browser Agent 的控制通道与页面表示:比较 HTTP/API、WebDriver、Playwright、DOM、Accessibility Tree、CDP、浏览器扩展、视觉坐标和 Agent-aware browser runtime,并结合论文讨论评测、安全与选型。AILLMAgent论文深读
2026年8月3日大模型为什么要用 osascript 操作桌面:从可访问性树到视觉 GUI Agent从一条 macOS UI 探测命令出发,解释大模型如何观察、定位、操作并验证桌面软件,比较 Accessibility Tree、视觉坐标、DOM、API/CLI 与混合控制的取舍和局限。AILLMAgent论文深读
2026年8月3日按场景看提示词工程与上下文工程:一个优化问题的两端提示词工程和上下文工程不是两门手艺,而是同一个优化问题在不同场景下的解。用 Mei et al. 2025 综述的形式化定义 C = A(c_instr, c_know, c_tools, c_mem, c_state, c_query) 做骨架,沿"单轮闭卷 → 开卷问答 → 长对话 → 动手 agent → 多智能体"五级场景阶梯,讲清每登一级、上下文里多了哪个成分、工程问题怎么变形——以及为什么提示词工程没有死,只是降级成了子模块。AILLMPrompt 工程上下文工程Agent论文深读
2026年8月2日上下文不是平的:位置与结构如何决定一条信息对输出的干预力同一条信息放在上下文的开头、中间、结尾,对最强模型输出的影响力可以差出几十个百分点——而且这个"位置地形"会随上下文填充率动态变形:塞满一半之后,经典的 U 形曲线塌掉,只剩结尾优势。从注意力机制的三个根本约束出发,讲清位置偏差的成因、衰减的动态过程,以及"结构"为什么本质上是在地形上打人工锚点。AILLM上下文工程
2026年8月2日投机解码的第二本账:长上下文把瓶颈从权重搬到了 KV Cache从 SparseSpec-L(arXiv 2607.27735)的加速公式 S=(αk+1)/(kγ+1) 出发,算清投机解码的三变量账本:为什么 Eagle-3 这样的短上下文冠军在 60K 上下文会跌破 1×,为什么"效率反转"的判据是 α 与 γ 的赛跑,以及"可召回的淘汰"如何把 γ、α、k 三个变量同时做对。接续 Medusa 深读与 vLLM KV cache 系列。AIAI InfraLLM Serving论文深读
2026年7月30日当写代码不再是瓶颈:20 个术语读懂 AI 时代的软件验证用 scrapling 抓取并深读 Shiplight 的 AI 测试术语表:验证为什么取代编码成为新瓶颈,AI-augmented / AI-native / agentic / agent-native 四个词怎么分,"定位器是缓存"这个值得偷走的心智模型,以及怎么带着防伪眼镜读一份厂商定义的词汇表。AIAgent上下文工程
2026年7月29日遗忘是一种能力:五篇论文看懂长程 Agent 的记忆管理,正在重演操作系统内存史精读 AgentFold、IterResearch、AgentSwing、ContextBudget、Self-GC 五篇 2025.10–2026.07 的论文:为什么"记住一切"的 agent 反而答得更差?用 Pass@1 = η×ρ 这个分解式看懂 context rot 的本质,以及上下文管理如何从启发式规则一步步演化成垃圾回收、预算分配和运行时调度——操作系统内存管理史的完整重演。AILLMAgent上下文工程论文深读
2026年7月29日一个 search 工具能挖多深:解剖 Agent 工具箱里最不起眼的函数search(query) -> results,看起来是 agent 工具箱里最简单的函数。结合 SWE-agent、SLIM(Lost in the Maze)、ParallelSearch、Search-R1、ZeroSearch 五篇论文,逐层解剖它的设计空间:返回什么、问什么、怎么学会用、搜索引擎本身要不要是真的——每一层都藏着能让性能翻倍或减半的决定。AILLMAgent搜索RAG论文深读
2026年7月29日删掉 80% 系统提示词之后:Claude 5 时代的上下文工程新规则Anthropic 为 Claude 5 代模型删掉了 Claude Code 超过 80% 的系统提示词,编码评测没有任何可测的下降。深读这篇官方博客:为什么"给模型写规则"是有保质期的负债,五个 Then vs Now 的转变背后是苦涩的教训在提示词层重演,以及怎么把这套经验用到你自己的 agent 上。AILLMAgent上下文工程
2026年7月29日什么才是好的 Harness:判断归模型,物理归代码同一个模型,换个 harness 性能能差 6 倍。结合 SWE-agent(ACI 开山之作)、How Much Heavy Lifting、Inside the Scaffold、Code as Agent Harness、Fork-Explore-Commit 等论文,深度拆解好 harness 的三件本职工作:把世界翻译成模型好用的接口、把确定性工作从模型手里拿走、让错误变便宜——以及为什么"提示词里的规则是恳求,harness 里的规则是物理法则"。AILLMAgent上下文工程论文深读
2026年7月29日模型为什么会伸手:工具使用不是被教会的,是目标函数的影子一个只会预测下一个 token 的模型,凭什么会去调用计算器和搜索引擎?从 Toolformer 的自监督起源(一次调用能留下的唯一理由是降低未来 token 的 loss),到 RLVR 时代的工具滥用幻觉(无成本时任何 ΔP>0 都值得调用),再到 knowing-doing gap(知道该用和真的去用在残差流里是两个方向)——结合五篇论文回答:模型为什么会用工具、为什么会滥用、以及为什么"知道"不等于"做到"。AILLMAgent论文深读
2026年7月28日场景控制包:把 Agent 经验从提示词推进到可执行契约结合 AI Chains、PromptChainer、ReAct、RAG、Self-RAG、DSPy、AutoGen、MetaGPT、Reflexion、Voyager、AgentBench 和 SWE-agent,判断 AIHub 场景控制包有没有同类论文思想:没有找到完整同款,但能看到清晰的相邻研究脉络。AIAgentAI InfraRAG系统设计
2026年7月28日Agent 平台正在重新发明操作系统:美团 CatPaw 架构深读逐段拆解美团 CatPaw Managed Agents 的"脑手分离"架构,把每个组件映射回它的操作系统祖先:Session 恢复是进程切换,上下文压缩是虚拟内存,Sandbox Gateway 是调度器,模型路由网关是硬件抽象层。结合 ReAct、MemGPT、AIOS、Firecracker、CaMeL 等论文,解释为什么相同的资源约束必然长出相同的架构形状——以及这个类比在哪里失效。AIAgentLLM论文深读
2026年7月28日Codebase Memory MCP 源码深读:把代码库编译成 Agent 的结构化记忆从 MCP 入口、Tree-sitter 抽取、Hybrid LSP、graph buffer、SQLite/FTS5 和增量索引读懂 codebase-memory-mcp 的实现原理。AIAgentMCP源码阅读
2026年7月28日nanoGPT config 不是参数表:一张 LLM 训练配方地图从 LLM 训练的大背景出发,系统讲解 nanoGPT config 目录里的训练、微调、评估配置,以及 batch、context、模型大小、AdamW、学习率、DDP、dtype 等参数如何在源码中生效。AIAI InfraLLMTransformer模型训练源码阅读学习笔记
2026年7月28日从 65 个字符开始:nanoGPT 的 Shakespeare 字符级语言模型数据准备用 nanoGPT 的 shakespeare_char prepare.py 串起字符到整数 id、train.bin/val.bin、meta.pkl、next-token 训练样本,以及它和 BPE/GPT-2 路线的差别。AIAI InfraLLM源码阅读学习笔记
2026年7月28日读懂训练曲线:从一张 val/loss 图判断模型有没有真的变好用一张验证损失曲线拆解训练图的读法:先看坐标和指标方向,再看趋势、噪声、对照和决策,最后用 train loss、val loss、数据切分和优化过程串起因果链。AILLM学习笔记
2026年7月28日Tree-sitter 源码深读:增量解析器是怎样从 grammar.js 变成语法树的从 grammar DSL、parse table 生成、C runtime、GLR stack、增量重解析和 query VM 读懂 tree-sitter 的实现原理。AIAgent源码阅读
2026年7月27日Ego Lite 的关键不是会点网页,而是把浏览器变成 Agent 的共享运行时从 ego-lite 的 README、官网文档和 ego-browser 源码看它的真正原理:浏览器保存登录态和任务空间,agent 只提交 JavaScript 片段,helper runtime 通过 globalThis.ego、CDP、Snapshot 和 Task Spaces 把网页变成可编程环境。AIAgentAI Infra源码阅读
2026年7月27日主模型明明是 Fable 5,账单里为什么冒出 Haiku 4.5?这不是投机解码。从 Claude Code 官方文档找到 Haiku 后台调用的直接证据,再借 RouteLLM、FrugalGPT 与 Leviathan/Chen 的投机采样论文,把"小模型替大模型干活"拆成应用层分派、服务层路由、解码层投机三层,并给出一条判别原则:看它会不会以自己的名义出现在你的账单里。AIAI InfraLLM Serving
2026年7月27日别再问谁第一:大模型 Benchmark 榜单的正确打开方式梳理 2026 年仍值得看的大模型榜单和数据源:LMArena、HELM、LiveBench、Artificial Analysis、SEAL/HLE、SWE-bench、BFCL、OpenCompass 与 Hugging Face Open LLM Leaderboard,并给出一套按场景读榜的方法。AILLM评测
2026年7月27日涌现是真是幻?大模型"突然开窍"的本质——一场跨越四年的论文辩论为什么三位数加法这种能力会在模型变大时"突然出现"?沿着 Wei 2022 定名、Schaeffer 2023 质疑(海市蜃楼)、Du 2024 反转(损失阈值)、Michaud 量子模型、grokking 显微镜、Arora & Goyal 技能组合的论文接力,把涌现拆成一个可复用的心智模型:底层的进步几乎总是连续的,"涌现"是连续进步穿过非线性读出面时投下的阶跃阴影。AILLM论文深读
2026年7月27日最近的大模型论文,值得读的不是排行榜从 DeepSeek-R1、s1、LIMO、Qwen3、Gemini 2.5、Kimi K2、GLM-4.5 到 Kimi Linear 和 Conditional Memory,整理一条 2025-2026 年大模型论文的品读路线:能力、算力、验证器和 Agent 化如何连成一条主线。AILLMAgent
2026年7月27日一文讲透大模型格式化输出:从预训练先验到约束解码的五层保障为什么"请只输出 JSON"的哀求会失灵,而 response_format 一开就稳?沿训练到推理的完整链路拆解格式保障的五层机制:预训练给先验、后训练给服从、提示接口表达意图、约束解码给硬保证、系统校验兜底。结合 PICARD、Outlines、XGrammar、SGLang 与 Let Me Speak Freely 等论文,讲清 FSM 掩码的原理、tokenizer 错位难题、约束解码的分布扭曲代价,以及生产系统为什么五层全都要。AILLMAI InfraLLM Serving论文深读