2026年9月18日SLSA 和 in-toto 是两栈叠加,不是二选一SLSA 和 in-toto 都在回答'这件软件是不是按声称的流程走出来的',但切在不同关节——in-toto 是可以在图上跑的验证算法,SLSA 是对签发方的等级承诺。手算 MATCH 规则看清算法本体。工程实践系统设计论文深读
2026年9月15日五种 embedding 压缩,我把它们跑了一遍:96 字节能打赢 1024 字节1000 条真实 embedding、18 组配置、recall@10 全部本机实测。int8 几乎免费(4× 压缩,0.9950);二值化单独用只有 0.4673,加一次 float 重排就跳到 0.9524;而占 10 倍存储的 MRL 截断到 256 维只有 0.6832,打不过 96 字节的 PQ。AILLMRAG工程实践源码阅读
2026年9月14日11 种 LLM 评估方法,其实只在回答一个问题:参照物从哪来三句话喂给三代指标:真实排序 A>C>B,ROUGE-L 给 C>B>A,BERTScore 给 B>A>C,没一个排对。附本地 Qwen2.5-7B 的分数 token 概率分布、30 次采样的裁判方差,以及 DeepEval DAG 源码究竟把什么变确定了。AILLM评测论文深读工程实践
2026年9月14日12 种微调技术不是 12 个选项,是三张账单的折扣券图上写 BitFit「约占全部参数的 0.08%」。我按真模型的张量表数了一遍:129,024 个 bias,占 0.001694%,差 47 倍——而且它已经不是最省的那个。顺着这条线把 12 种技术钉进显存、标注、数据位置三张账单。AILLM模型训练工程实践
2026年9月11日小模型的「小」在 2026 年裂成了两半:一台 24GB Mac 上的三笔账把 2026 年的 SLM 趋势放到一台 24GB Mac 上验一遍:Qwen3.5-4B 默认配置下 20 件抽取活可用率 0/20,关掉思考后 20/20;35B-A3B 的 Q4 权重 20.50 GiB 装不进 17.76 GiB 的 GPU 工作集。参数量这个坐标失效了。LLMAI Infrallama.cppLLM Serving工程实践
2026年9月10日LLM 评测的 25 个坑:一张五层管线地图与论文索引上一篇从一次 finish_reason=length 翻车讲了静默失败。这篇把视野拉满:按评测管线把 LLM 评测的坑切成数据、生成、评分、统计、链路五层共 25 个,每个坑给症状、论文证据(带具体数字)和防线;末尾收三条跨层主线和一份评测前中后防坑清单。AILLM评测论文深读工程实践
2026年9月10日一次 finish_reason=length 翻车:LLM 评测的静默失败分几层Veral 跑 Kimi K2 多选评测翻车:reasoning 吃光 4096 token、content 为空、finish_reason=length,评分器抓不到答案。以这次为锚点,把 LLM 评测里的静默失败排成五层——生成层、评分层、统计层、数据层、链路层——每层给症状、根因、探测方法与 arXiv 出处。AILLM评测Agent论文深读工程实践
2026年9月9日图像识别做得更好,卡点不在「看清」而在「定位」——三因子拆解与 2026 年的三记反手把图像识别拆成采样、定位、表征三道闸门:我亲手跑的脚本量出 resize 在模型看到图之前就丢掉 99% 像素的物理边界,再用 NaViT 到 FAVE 十余篇论文定位每条路线在修哪一道;重点是 2026 年的三篇论文如何反手拆掉「用图思考」的一半叙事——承重的是坐标文本,不是回传的像素。AILLM论文深读Transformer工程实践
2026年9月8日先测判据,再测 Agent:业务评测样本的构造方法与一次作弊下界实测我按六轴坐标亲手造了 12 条电商售后样本和三代判据,让 5 个不理解业务的确定性作弊脚本去跑:第一版判据被拿到 9/12(75%),12 条样本全部被攻破,加固后降到 1/12。剩下那条是任务效度问题——题面漏了答案,改判据无解。附可复跑代码与判据体检清单。AILLMAgent评测Agent 工程工程实践
2026年9月8日CrewAI、LangGraph、AutoGen 怎么选:从角色分工到可恢复执行深读 Pickaxe 的框架对比,结合 ReAct、AutoGen、MetaGPT 与 MAST 论文,重新理解角色、状态图和对话协议。附 LangGraph 真实进程崩溃实验与上下文成本手算,解释检查点为什么不能单独保证外部动作只执行一次。AIAgent论文深读工程实践
2026年9月8日369 个 skill 上架,0 次调用:我拉出调用日志后重画的「盘活」三道闸装了一个 286 skill 的 marketplace,开 6 天、每会话往上下文注入 30 KB 货架,hub skill 调用 0 次。用本机 27 个会话的日志拆出「盘活」三道闸:描述预算在字母 b 处用尽、写了中文触发语的只有 1/286、通用能力零增量。附可复现度量脚本。AgentSkills工程实践
2026年9月7日把"判断"从模型手里再拿走一次:2026 年前沿在 Harness 上玩出的三条物理化战线从 Anthropic 用 Dynamic Workflows 把 Bun 从 53 万行 Zig 重写成 75 万行 Rust(11 天、64 个 Agent 并行、$165,000)说起,拆解 2026 年下半年前沿 harness 玩法收敛到的三条战线:控制流从模型决定变成脚本决定(Claude Code Dynamic Workflows / LangGraph / CrewAI)、隔离从约定变成文件系统原语(Cursor、Codex 生态的 worktrunk/oh-my-codex、Zed、Grok Build 各自的取舍)、验证从自评变成角色对立的对抗式复核(Bun 的三角色分工、Qodo 与 Greptile 的多 Agent 复核产品化)。每条战线都附一张可核实的代表产品表。这是《什么才是好的 Harness》一文半年后的实践坐实。AILLMAgentAgent 工程工程实践
2026年9月7日Ruflo 源码深读:它不是一群 Agent,而是套在 Agent 外面的控制面沿 Ruflo 3.38.21 的真实执行链,拆解配置注入、MCP 工具面、Swarm 控制状态、执行后端与记忆学习闭环,并区分已接线能力和产品叙事。AILLMAgent源码阅读工程实践MCP
2026年9月3日temperature=0 不等于 deterministic:亲手让它翻车 30 次同一个 prompt、temperature=0,跑 30 次拿到 12 种不同答案——分叉点在 char 227 和 323。旧解释「fp 非结合律」不够用,2025 年的新解释是「batch invariance」,值得每个用 LLM 做评测/回归/合规的工程师重读一遍。AILLMLLM Serving工程实践评测
2026年8月31日pi 的系统提示词有一半以上在教模型改造 pi 自己:一次极简 harness 的开箱实测把 pi.dev 的发布包(0.84.4)拆开量了三个数字:默认系统提示词约两千字符、其中 53%–59% 是「pi 自己的文档在哪」、官方声称「没做」的权限弹窗在示例目录里是一个 34 行的扩展。极简不是审美,是预算腾挪——腾出的位置用来让 harness 变成 agent 可读可改的对象。AILLMAgentAgent 工程工程实践
2026年8月27日我把 Claude Code 的模型换成了扩散模型:28 次运行全过,但它的卖点花不出去把 Claude Code 的模型后端换成 Inception 的 Mercury 2 扩散模型,跑 9 个带隐藏测试的编码任务、共 28 次运行全过。真正的发现是一笔账:agent 负载的输入输出比是 82:1,输出侧只占总成本 4.2%——扩散优化的那一侧,在这里花不出去。AIAgentLLM工程实践
2026年8月25日会用 Coding Agent,不等于会做 AI Engineering:四项差距能力与训练法用一个订单 CSV 导出案例,具体定义需求规格、Agent 操作、Eval 回归与部署观测四项能力,并结合 SWE-bench、SWE-agent、MAST、AgentOps 等论文给出可练习、可验收的进阶路径。AIAgent 工程评测工程实践系统设计
2026年8月25日在 AI 时代胜人一筹:杠杆不在模型多强,而在你和模型之间那道界面2005 年一对业余棋手加三台普通电脑,打败了大师加超算——卡斯帕罗夫由此提炼出"弱人类+机器+更好的流程"能赢。结合 Kasparov 定律、Bainbridge《自动化的反讽》、METR 实测 -19% 的 RCT,用一个能手算的 Amdahl 式杠杆公式说清:人机协作的胜负不在谁强,而在两者之间那道界面的质量。AIAgent 工程上下文工程工程实践自动化
2026年8月25日从 Pending 到 Ready:一套可迁移的 Kubernetes 部署排障方法用控制器、调度与存储、容器启动、健康探针和发布收敛五层心智模型,系统判断 Pending、ImagePullBackOff、CrashLoopBackOff 与 rollout 卡住,并选择 Deployment、StatefulSet、Job 及共享基础设施隔离策略。工程实践系统设计自动化
2026年8月24日顶级模型"卖不动"是误读:Ramp 数据里同厂之间的信任积攒深读 Simon Willison 2026-08-23 那篇转引 FT 报导 + Ramp AI index 的短博客。表面结论是"Anthropic 最贵的 Opus 5 只占同厂花费 3.5%,Opus 4.8 占 28%",但把家族聚合起来看,Opus 系仍占 40.8%——只是集中在上一代旗舰上。真正的信号不是"贵的没人要",是**用户在给"累积过工程投入的模型"投票**:老模型有 SDK、prompt 库、评测、KV 缓存、组织 runbook,新模型这一切都是 0。这是昨天那篇《合成前沿》里"10% 更差、100x 便宜"在市场端的第二个投影:同厂内也在验证同一条经济逻辑。AILLM评测工程实践
2026年8月17日最优解长在一张会动的地图上:把开发者的自我革新当成非平稳搜索问题MCTS 系列续作。上一篇把"学会一个领域"建模成搜索预算分配,这一篇处理更难的题:"成为 AI 时代的佼佼者"是在一张会动的地图上搜索——奖励分布在漂移(METR 的实验结论七个月后被作者自己标为历史快照)、你只有一条不可重置的轨迹、能观测到的全是代理指标。四个搜索领域的现成升级件——折扣战绩(D-UCB/SW-UCB)、受控降温(模拟退火)、生态位精英(MAP-Elites)、防奖励作弊——各修复一个失效假设,最后装回一个每周可跑的操作循环。AI工程实践
2026年8月8日大模型行业工种全景图:十个岗位的能力矩阵、细化技能与透明学习路径——从公开 JD 反推把 2026 年大模型行业公开招聘的工种摊开成一张可选择的技能树:按「造模型→跑模型→用模型→管模型」四条产线拆出十个工种,每个工种给出能力矩阵(维度×细化技能×代表技术×学习挂靠点)和一个 2–4 周的最小验证项目。数据来自 OpenAI/Anthropic 官方招聘页、国内猎聘/智联/校招 JD 与多份行业招聘报告,观点与矩阵是我的整理。目标:让每个工种的学习路径对你完全透明,选哪条分支、怎么 rollout,一张图定。AILLM工程实践
2026年8月5日深度解读 Agent Swarm:第三条 scaling 轴,和它要交的协调税从蚁群算法到 OpenAI Swarm 的 handoffs、Anthropic 的 orchestrator-worker、Claude Code 的 agent teams,再到 Kimi K2.5 用 RL 把编排策略训练出来——agent swarm 的本质是把推理算力从『纵向想更久』扩展成『横向同时想』。这篇按第一性原理拆:为什么稀缺资源是上下文窗口、协调税记在账本哪一行、以及『何时并行』这件事如何正在从人写规则变成数据学出来。Agent工程实践LLM
2026年8月5日执行塌价,判断涨价:"做什么"为什么越来越难代码越写越顺,方向反而越来越糊——这不是心态问题,是价格信号。用四组可核实的实验(Copilot RCT、METR、锯齿边界、构想—执行落差)和互补品经济学拆解这个困境的三个机制,然后给出一套重新定位自己的框架:拥有问题、拥有验证回路、盘点没被降价的隐性上下文,用便宜的执行去买昂贵的信息。工程实践