X 上值得长期关注的 20 个大模型与 Agent 英文账号

从 Avi Chawla 出发,实看 25 个 X 账号后留下 20 个英文一手信息源,按教程、Agent 工程、研究与行业反方四层整理;附只关注 6 人的精简版和四张可直接照抄的 X Lists。

关注谁,本质上是在给自己搭一条信息管道。全关注“讲得好懂的人”,会离一手研究越来越远;全关注研究者,又容易错过模型落到产品后真正会坏在哪里。

前几天有人问我:为什么推荐列表里好多华人,有没有像 Avi Chawla 这样的外国候选人?

当然有。但真要整理成一份能长期用的名单,按国籍或族裔分组其实没什么帮助。一个人的出生地、任教地或姓名语言,跟他的信息质量没有必然关系。更实用的筛法是:他是否持续用英文发布一手内容;他的强项位于研究、解释、工程还是批评;放进你的时间线后,补的是哪个缺口。

所以这不是一份“全球 AI 名人榜”,而是一套有意分散风险的信息组合。我逐一打开了 25 个候选人的公开主页,看简介、置顶内容和最近可见动态,最后留下 20 个,分成四组。

如果只关注 6 个,先从这里开始

账号最值得拿走的东西阅读方式
Avi Chawla @_avichawla图解、教程、项目入口,降低新概念的启动成本高频扫标题,感兴趣的再亲手复现
Simon Willison @simonw模型发布、Agent 工具与安全事故的独立工程记录当作每日工程雷达
Hamel Husain @HamelHusainEvals、错误分析、真实团队如何把 AI 做进生产项目进入评测阶段时集中读
Sebastian Raschka @rasbt从架构、训练到推理的机制解释和可运行代码新模型出现时用来拆原理
Andrej Karpathy @karpathy对模型、编程与人机协作方式的原创心智模型低频精读,不追求日更
Arvind Narayanan @random_walker对 AI 宣传、测量和社会影响的证据型质疑专门用来反驳前五个人带来的兴奋

六个人看起来不多,却已经覆盖了“看见新东西 → 弄懂机制 → 做进系统 → 设计评测 → 检查自己是否被宣传带跑”这一整条链。

如果某一个账号能同时提供前沿论文、一手实验、生产故障和独立批评,总榜或许就够了。现实是,这四类作者优化的是不同的证据距离和更新速度。因此名单必须分层,不能只按粉丝数排一条长队。

我怎么筛这 25 个账号

这次不是把记忆里的名字列出来。我做了三步:

  1. 打开每个账号的公开主页,确认账号仍存在、简介与当前关注方向没有明显错位;
  2. 查看置顶内容和最近可见动态,判断原创内容、转发、公司宣传与非技术话题的大致比例;
  3. 回查本站文章,看看我过去实际引用谁,避免“嘴上说值得关注,写作时从没用过”。

本地回查的原始结果是:

profiles_opened=25
shortlisted=20
visible_activity_within_60d=20
reserve=5
site_posts_mentioning_simon=43
site_mentions_of_simon=71
site_posts_mentioning_avi=1
site_mentions_of_avi=11

这里有一个限制要提前说:X 未登录状态只展示有限的公开动态,置顶帖还会打乱时间顺序。因此本文是 2026-09-15 的近期主页审计,不是完整历史数据的量化评分。发布频率与内容比例都是阅读建议,不是假装精确的小数。

本站 43 篇文章提到 Simon Willison,这既证明他的记录很好用,也暴露了单一来源依赖。如果时间线里全是 Simon 的同类账号,我看到的就会主要是独立开发者、工具发布与安全事件;开源模型训练、Agent 评测、具身智能和反方证据都会变暗。

一、教程与解释:先把门槛降下来

1. Avi Chawla @_avichawla

Avi 的优势是把分散的 DS、ML、LLM、RAG 与 Agent 资料压成图解、短教程和可运行项目。更新频率高,特别适合发现“这个概念值得补一下”。代价也很明确:信息密度高不等于证据完备,合集和图表需要回到论文、代码与自己的机器复核。

我此前照着他整理的 KV cache 技术做过一次实测:在 M5 Pro 上,cache quantization 的实测节省是 47%,不是图表里整齐的 50%,差异来自 scale metadata。完整过程在《KV cache 的 12 种省法》。这正是我对 Avi 的定位:很好的入口,不是最后一跳。

2. Sebastian Raschka @rasbt

Raschka 擅长把模型结构、训练技巧、RLVR 和推理优化拆到公式与代码层,且会持续更新自己的解释。适合愿意从“这东西有效”再往下追问“为什么”的读者。内容往往很长、很密,最好把他的帖子当小型教材,而不是通勤碎片。

3. Chip Huyen @chipro

Chip 的强项是系统边界:Agent 到底是什么、评测为什么难、模型能力如何变成可靠产品。她写的不是某个框架的 API 教程,而是工程和产品之间的中层模型。更新不算高频,但长文值得反复查;如果你只想复制一段代码,反馈会比 Avi 慢。

4. Andrew Ng @AndrewYNg

Andrew Ng 仍然是很稳的学习路线设计者,能把 coding agents、AI engineering 和行业变化讲给更广的开发者。他适合建立地图和学习顺序。需要自己过滤课程、活动与公司内容,不要把“适合教学”误当成“这是唯一工程路径”。

5. Elvis Saravia @omarsar0

Elvis 经营 DAIR.AI,论文、提示工程、开源工具和 Agent 项目的覆盖面很大。最近公开动态里仍能看到从零搭 Agent harness、开源模型与开发工具等内容。它更像高吞吐雷达:发现关键词很强,但链接量和合作内容也多,关键结论要继续点进原始资料。

二、Agent 工程:看系统怎样成功,也看它怎样坏掉

6. Simon Willison @simonw

Simon 几乎每天都在亲手试模型、CLI、local app 与 coding agent,并把安全边界和失败案例写清楚。他最大的价值不是“消息快”,而是能给消息附一段可检查的实验记录。更新很勤,主题也很广;把他的博客或 X List 当索引,比试图读完更现实。

7. Hamel Husain @HamelHusain

Hamel 长期盯着 evals、错误分析、数据与团队工作流。他会直接指出通用评测工具、Agent harness 和漂亮 demo 在真实项目里哪里不够用。观点鲜明,偶尔故意带刺,但这是好事:当团队只讨论模型和框架时,他会把问题拉回“你究竟怎样知道它变好了”。

8. Harrison Chase @hwchase17

作为 LangChain / LangGraph 的核心人物,Harrison 对 long-running agents、harness、记忆、computer use 与可观测性的变化非常敏感。这里的一手性很强,但视角不可避免地靠近 LangChain 产品边界。适合看生态往哪走,不适合单独拿来做框架选型。

9. Eugene Yan @eugeneyan

Eugene 的内容横跨推荐系统、LLM 应用、评测和 AI 安全,擅长把论文结论翻译成生产决策。他不是日更型账号,却经常补上“什么样的证据才足以部署”这一层。注意他的工作机构会影响选题,但文章通常把假设和实验交代得很清楚。

10. swyx @swyx

swyx 把自己放在“AI Engineer”这个新职业的交叉口:模型发布、开发者工具、访谈、会议与行业叙事都会覆盖。他是很好的趋势探测器,尤其适合发现新词和新团队。相应地,音量、速度和兴奋度都高;先拿线索,再去找独立验证。

三、研究与心智模型:离一手问题更近

11. Andrej Karpathy @karpathy

Karpathy 很少只复述发布稿,更多是在给新现象起名字、造解释框架,或者展示自己如何与模型协作。内容频率不稳定,单篇寿命却很长。适合建立直觉,但“非常会解释”也容易形成权威光环;涉及性能和因果时仍应回到实验。

12. Lilian Weng @lilianweng

Lilian 的 Lil’Log 是少数能把论文谱系梳理得既深又清楚的长期资料。她近年的公开内容覆盖 Agent、自我改进、harness engineering 与 scaling laws。更新低频,而且一篇很长;这不是新闻流,而是遇到主题后应该优先检索的参考书。

13. Shunyu Yao @ShunyuYao12

Shunyu 的研究一直靠近 language agents、推理与工具使用,是观察 Agent 问题如何在学术界被定义的一手窗口。发布不多,但比二手“Agent 论文速递”更接近问题原点。适合研究和框架设计者,不负责帮你补全工程脚手架。

14. Nathan Lambert @natolambert

Nathan 聚焦开放模型、post-training、RLHF 与政策,常把训练资源、产业格局和技术细节放在一起解释。想理解“开放模型为何追上、差距又在哪里”,他很难替代。政策和行业判断占比不低,读者要区分实验事实与趋势推断。

15. Sasha Rush @srush_nlp

Sasha 的视角更靠近 ML systems:GPU、通信、并行计算、编译和训练效率。对只做 API 应用的人可能偏底层,但 Agent 能力最终仍受延迟、吞吐和模型训练约束。低频、技术密度高,适合补上应用开发者时间线里最容易缺的一块。

四、边界、行业与反方:防止时间线只会加速

16. François Chollet @fchollet

Chollet 围绕抽象、泛化、ARC-AGI 和“智能到底该怎样测”持续提出不同于 scaling 主流的观点。他能逼你区分记忆、技能和新问题上的适应能力。讨论有时很锋利,也会滑向哲学争辩;最好的读法是拿他的定义检查指标,而不是站队。

17. Ethan Mollick @emollick

Mollick 关注普通人在工作、教育和组织里怎样真实使用 AI。他的实验贴能快速显示“能力发布”与“人类采纳”之间的距离。更新高频、可读性强,但实现细节有限;适合产品和管理视角,不替代工程验证。

18. Arvind Narayanan @random_walker

Arvind 与 AI Snake Oil 团队擅长追问:这个演示代表普遍能力吗,基准测到了什么,部署成本由谁承担?当整个时间线都在庆祝 Agent 再次突破时,这个账号是必要的制动器。它提供的是证据审查,不是教你搭 Agent。

19. Jack Clark @jackclarkSF

Jack 长期写 Import AI,能把研究进展、算力、国家政策和产业竞争连成一张图。对理解一家实验室之外的方向很有帮助。因为他身处 Anthropic,读公司与政策判断时应保留利益相关者意识;把它与开源和独立研究者交叉阅读。

20. Jim Fan @DrJimFan

Jim Fan 把视野从网页和代码 Agent 扩到机器人、world model、computer use 与 physical AGI。即便你现在只做软件 Agent,也值得观察“行动”在有物理成本时会多出哪些约束。他的主场不是企业 RAG 或工作流自动化,而是这份名单向现实世界伸出去的一根天线。

五个候补:值得看,但暂时没放进主名单

账号没进主名单的原因
Jason Liu @jxnlcoInstructor、结构化输出和 evals 的历史内容很有价值;近期公开动态更偏产品与个人更新,可按主题检索。
Jeremy Howard @jeremyphoward开源与应用 ML 教学很强,但近期样本与 LLM / Agent 主线的重合度低于入选者。
Jerry Liu @jerryjliu0文档 Agent 与 RAG 很有用,不过 LlamaIndex 的产品视角较重;实际采用该生态时再加入。
Yann LeCun @ylecun研究影响力无需证明,但他的置顶说明明确表示不在 X 写长文,近期公开流也以非技术讨论居多。关注研究不等于一定要关注 X。
Omar Sanseviero @osanseviero开源模型生态背景扎实;在这次近期样本里,原创技术密度略低于主名单,可作为 Hugging Face 生态补充。

候补不是质量判决,而是提醒一件事:“这个人很厉害”与“这个账号目前适合进入我的日常信息流”是两个问题。 后者还要考虑媒介、频率、主题漂移和你已有的来源。

共同祖先:好时间线更像编辑部,不像排行榜

四组账号其实对应一个小型科技编辑部的四张桌子:

桌子负责的问题缺了会怎样
教程与解释新东西是什么,怎样快速上手?入口太陡,收藏很多却迟迟不开工
Agent 工程它进生产后会在哪里坏?demo 被误当成可靠系统
研究与机制结论从哪里来,边界是什么?永远活在二手摘要里
行业与反方谁在夸大,谁在付成本,还有什么没被测?时间线只会制造兴奋,不能校准判断

这也是它和投资组合相似的地方:高频账号会被算法自动加权,低频研究者和反方声音则容易消失。你不主动分组,X 就替你按互动率配置资产,而互动率偏爱的往往是确定语气、争议和新鲜感,不是证据质量。

15 分钟,把 20 人变成四张 X Lists

不要一次关注 20 人后继续刷 For You。新建四张私密 List,每张放五人:

  1. Learn LLMs:Avi Chawla、Sebastian Raschka、Chip Huyen、Andrew Ng、Elvis Saravia;
  2. Build Agents:Simon Willison、Hamel Husain、Harrison Chase、Eugene Yan、swyx;
  3. Research Signals:Andrej Karpathy、Lilian Weng、Shunyu Yao、Nathan Lambert、Sasha Rush;
  4. Reality Checks:François Chollet、Ethan Mollick、Arvind Narayanan、Jack Clark、Jim Fan。

然后只做一个小动作:每天打开其中一张 List,而不是首页;看到观点先收藏原始链接,周末只复现一件事。 四天轮一圈,第五天留空。这样 Avi 的高频教程不会淹没 Lilian 的低频长文,行业新闻也不会挤掉真正改变工程决策的失败报告。

一个月后再删一次:如果某个账号没有让你读到原始资料、改变一次实现,或推翻一个判断,就把它移出日常流。关注名单不是荣誉墙,而是一套需要维护的输入系统。

账号入口

教程与解释

Agent 工程

研究与机制

行业、边界与反方

本站延伸阅读