打开 parasma.com 只看到两行字:“Biological compute with living neurons.” 底下一小段 news 说他们用人脑细胞做了 next-token prediction,binary 任务 90% 正确率,非线性任务单次跑 78.1%,「超过了硅基线性解码器 75% 的天花板」。看起来是一个「反直觉的 AI 硬件公司」,但把它当硬件公司读会读糊——他们不做芯片,他们做的是「让活神经元学习」这件事的算法层。这一层背后压着一条从 1961 年 Landauer、2002 年 Maass、2010 年 Friston 到 2022 年 Kagan 的技术链。这篇把这条链拆开来读。
名词速查
第一次看到湿件(wetware)计算这套词汇,下面这张表先垫一下——正文里每一个都会展开讲,这里只给一句话人话定义。
| 术语 | 一句话解释 |
|---|---|
| 湿件 / 生物计算 | 用活细胞(通常是培养皿里的神经元)代替硅电路做计算,“wet” 相对于 “hard/soft-ware” |
| MEA(多电极阵列) | 培养皿底部密集排布的微电极,同时给神经元发电刺激(写)+ 读神经元电活动(读) |
| DishBrain | Cortical Labs 2022 年的系统:把神经元培养在 MEA 上,让它们通过闭环反馈学会玩 Pong |
| Free Energy Principle(FEP) | Karl Friston 的理论:任何自组织系统都在最小化「预测误差」这个量,学习和感知是它的两个面 |
| Active inference | FEP 的行动版本——智能体通过行动去减少预测误差,等价于一种没有显式奖励函数的强化学习 |
| Reservoir computing / 液态状态机 | 用一个固定的、随机连接的动力系统做高维投影,只训练最后的读出层——正好匹配「不可微的活神经元」 |
| Next-token prediction | 语言模型的核心任务:给一段 tokens,预测下一个 token 的概率分布 |
一句话主线
Parasma 的存在,本质上是一个赌注:闭环反馈是塑造活神经元行为的唯一可扩展算法,而这个算法的理论内核(Friston 的自由能原理)已经在 2022 年被 DishBrain 用一款 Pong 游戏证明可行。他们做的事情不是「造更快的 AI 芯片」,是把 DishBrain 那套证明工程化、把游戏换成 tokens、然后卖给需要「连续学习 + 极低能耗」的下游客户(大概率是 edge robotics,不是 GPU 替换)。这条主线拆成四个决策点。
决策点 1:基质——silicon vs cortical neurons
先给一个数字对照,把「用活神经元计算」的诱惑量化出来。
手算一笔账(三档证据里的 C 类:一次性脚本 python3 -c 验算通过):
- H100 GPU 满载 700W,batched inference(batch=32)大约 0.44 J/token
- H100 unbatched(单用户)大约 14 J/token
- 人脑总功耗 20W,语言相关皮层假设占 10W,人说话/阅读约 5 tokens/秒 → 约 2 J/token
- Parasma / Cortical Labs 级别的培养皿:10⁵ 个神经元,按大脑 20W / 10¹¹ 神经元估算,生物学计算本身只吃 20μW
- 但培养皿的支撑硬件(培养箱、灌流泵、MEA 放大器、控温、CO₂)今天需要 50–500W —— 比生物计算本身高 6–7 个数量级
这一笔账拆开就看清 Parasma 到底在赌什么:不是赌神经元比 GPU 快,是赌支撑硬件的开销可以工程化地降下来(就像 GPU 从数据中心搬到手机耗时 25 年),而 20μW 的生物学计算是终点方向。
这个方向不是他们独有的。它挂在共同祖先——Landauer 1961 那篇 Irreversibility and Heat Generation in the Computing Process——上:任何不可逆的比特运算都必然耗散 J 的能量作为热。今天的 GPU 距离这个物理下界还有 10⁷ 倍以上。神经元是自然选择磨了几十亿年的、天然工作在低电压尖峰式的、接近 Landauer 极限的计算元件。这条决策链的根本约束是热力学,不是想法新颖。
反事实崩点(反模式二说「符号化伪精确」,这里就把话说满一点):如果 Parasma 用硅基做同样的事,你会先在哪里崩?在功率密度——数据中心一个机架 30kW,每平方米大约 5–10 kW;活神经元培养皿一皿功耗以毫瓦计。要在同一个机柜体积里做「连续学习 + 长时间不断电」,硅基先撞墙的是散热,不是算力。
决策点 2:训练算法——Backprop 用不了,怎么办
这一条是整个赌注的关键,也是 Parasma 和一堆「组培育神经元做计算」的学术组区分开的地方。
根本约束的一句话(本质门槛):“Parasma 之所以做算法层而不做硬件,是因为活神经元的动力学不可微,backprop 用不了。” 反事实检验:如果这个约束不存在(比如你能拿到培养皿的可微分模型),Parasma 的公司就没有必要——你可以直接用 PyTorch 训练一个「培养皿-like」的替代物,用梯度下降。所以他们的赌注等价于「主动推断 / 自由能原理是唯一能塑造活神经元行为的可扩展算法」。
这条赌注不是他们发明的,是 2022 年 Cortical Labs 那篇论文的正面证明:
Kagan, Kitchen, Tran, et al. + Friston 2022,In vitro neurons learn and exhibit sentience when embodied in a simulated game-world, Neuron 110(23):3952-3969。注意:这篇论文的第 15 位作者就是 Karl Friston 本人——这不是一篇引用了 FEP 的实验论文,是FEP 的一次实体化实验。摘要原话(论文摘要节选,我读过原文):“Applying a previously untestable theory of active inference via the Free Energy Principle, learning was apparent within five minutes of real-time gameplay, not observed in control conditions.” 五分钟内出现学习、控制组没有,这个证明是 Parasma 所有商业假设的地基。
理论支柱:Friston 2010,The free-energy principle: a unified brain theory?, Nature Reviews Neuroscience 11(2):127-138。它把「感知、学习、行动」统一成一个数学量的最小化——变分自由能(variational free energy,可理解为「预测误差 + 模型复杂度」的上界)。有 6600+ 引用,是当代神经科学最有影响力的综述之一。工程读法:任何自组织系统只要给它一个闭环反馈,它就会朝着「让下一次感觉更可预测」的方向自我调整,这是它的物理必然,不是它的选择。
Parasma 的 next-token prediction 装置就是这一原理的复用:
输入 tokens → 编码为 MEA 电刺激 pattern → 神经元自组织响应 → MEA 读回电信号 → 解码为 token 概率
↓
是否正确?→ 闭环反馈(可预测的刺激 / 不可预测的噪声)
共同祖先(AI 12 面镜里的第 ⑪ 条「反馈闭环:从交互中学习」):AlphaGo 自我对弈、RLHF、DishBrain 玩 Pong、Parasma 做 tokens——都是同一条祖先线的实例化。区别只在于闭环里跑的是什么:AlphaGo 里跑的是围棋规则,RLHF 里跑的是人类偏好模型,DishBrain 里跑的是”球拍击中球”这个物理规则,Parasma 里跑的是”下一个 token 是这个”这个语言规则。“什么是奖励”的定义换了,闭环的形状没换。
决策点 3:读出——把动力系统的响应变成 token
即使神经元学会了预测,你还得知道它在预测什么。这是「读出问题」,Parasma 没公开细节,但学术上有 20 多年的路径。
共同祖先:Maass, Natschläger, Markram 2002,Real-Time Computing Without Stable States, Neural Computation 14(11):2531-2560。这是液态状态机(LSM)和储备池计算(reservoir computing)的奠基论文。它的核心洞察对 Parasma 来说至关重要:
一个足够大、足够异质的递归神经网络(不管它内部动力学多复杂、多不可微),只要它有一个高维瞬态状态,你就可以用一个极简的线性读出层从这个瞬态里解码出你想要的信息。内部动力学不需要训练,只训练读出。
翻译成 Parasma 的场景:培养皿是不可微的、内部权重你根本不知道的、随机连接的——但只要它是一个高维动力系统(10⁵ 神经元就够高维),你在 MEA 读出的信号里就藏着输入的全部历史信息,用一个 SGD 训练的线性分类器就能读出来。 LSM 2002 论文让「活神经元做计算」在数学上从「不可能」变成「已有工具链」。
一篇 2025 年的综述把这条路径直接推到 Parasma 门口:Yaron et al. 2025,Dissociated Neuronal Cultures as Model Systems for Self-Organized Prediction, arXiv:2501.18772。摘要明说这些培养皿系统展示了 “predictive coding, adaptive learning, goal-directed behavior, and deviance detection”,并且同时讨论 FEP 与 reservoir computing 两条路径——这两条路径在这个题目里不是竞争关系,是一件事情的训练侧和读出侧。
决策点 4:单次 78.1% 到底意味着什么——一次亲手算的显著性
Parasma 的官方公告有两组数字:
- Binary next-token task:90% 正确率(对照组随机接近 50%)
- 非线性 next-token task:78.1%(单次孤立跑,超过”硅基线性解码器 75% 的天花板”)
我停下来想了一下这两个数字意味着什么,用 python3 -c 手算了一遍二项显著性(三档证据里的 C 类,读者可以复现),得到几个足以克制我的兴奋的观察:
90% binary 的显著性(对照 chance-level 50%):
| N(试次) | 观察到 ≥90% 的 chance-level 概率 |
|---|---|
| n=10 | 1.1e-2 |
| n=30 | 4.2e-6 |
| n=100 | 1.5e-17 |
结论:90% binary 的显著性对 n 非常不敏感——只要样本超过 30 次,这个数字就是稳的。Parasma 没披露具体 n,但这一组数字大概率是硬信号。
78.1% 单次跑的显著性(论断口径不同,要分两问):
先问 “78.1% 是不是显著优于随机(50%)“:n=30 就 p=2.6e-3,n=100 就 p=8e-9——显著,没问题。
再问 “78.1% 是不是显著优于硅基线性解码器的 75% 天花板”(Parasma 官方新闻的原话)——这是关键问题**:
| 每组 N | 78.1% vs 75% 的 z 值 | 单尾 p |
|---|---|---|
| n=100 | 0.52 | 0.30 |
| n=500 | 1.16 | 0.12 |
| n=1000 | 1.64 | 0.05 |
| n=2000 | 2.32 | 0.01 |
结论:3.1 个百分点的差距要在 n≈2000 才刚刚跨过 p=0.01 的门槛。「一次孤立跑」(Parasma 原话 “in one isolated run”)的显著性在数学上远远不到可以宣称击败硅基线性天花板的程度。这不是说他们在撒谎,是说”crossed the ceiling that a linear silicon decoder cannot represent”这句话,作为一次结果,只是「值得进一步复现」的信号,不是「已经证明」。
Parasma 自己的博客里其实写清了这一点——他们下一步的路线图第一件事就是 “repeatable benchmarks across cultures, devices, and time”。也就是说:他们自己知道 78.1% 的数字含金量取决于能否稳定复现,只是他们的营销文案先跑了一步。这是所有早期科技公司都会面对的张力,把这个张力看清楚不影响判断——只影响你信几分。
软处(就地标注):以上手算基于「Parasma 每次 trial 独立同分布」这个假设。真实情况里 trial-to-trial 的电极响应有相关性(同一片皿越跑越漂移)、culture-to-culture 差异也很大——所以真实的有效 N 通常比名义 N 小,也就意味着 78.1% 单次的 p 值只会更差不会更好。这段是我的推理不是论文原文,标注一下。
决策点 5:商业化——不是替换 GPU,是找 GPU 补不上的场景
把上面四条决策合起来看,你就能看到 Parasma 的商业地图根本不是「用生物学电脑取代 NVIDIA」——那是媒体标题党。
根本约束:短期,任何培养皿系统的支撑硬件功耗比它内部生物计算高 5–7 个数量级;「20W 大脑」的能效优势要在支撑硬件工程化后才拿得到,这可能要 10–20 年。中期,Parasma 能卖的是三类 GPU 补不上的能力:
| 场景 | GPU 崩在哪里 | 湿件天然占优 |
|---|---|---|
| 边缘 continual learning | 每次遗忘就要重训;SGD 的灾难性遗忘 | 神经元本身有可塑性,不需要”训练/推理”两阶段区分 |
| 极低功耗嵌入式(robotics 头部) | 100W 起步 | 生物计算本身 μW 级 |
| 长时间任务 sample efficiency | GPT 类模型 sample efficiency 灾难性差 | 大脑一两次示范就能学 |
长期赌注:Parasma 官方博客写的是 “eventually direct biological training”——把参数直接烧进神经元,绕开电刺激这个中介。这是一个大得多的赌注,我把它归到「未来 10+ 年可能不成立」的档位——它需要突破的物理边界比 Kagan 2022 还多一层(要控制到单个突触的可塑性)。
竞品:
- Cortical Labs(澳洲,DishBrain 母公司)——目前是这个赛道领先者,卖 CL1 这台”生物计算机”设备
- FinalSpark(瑞士)——提供云端脑器官计算租用,学术圈用得比较多
- Parasma 的差异化是:不做硬件(CL1、FinalSpark 都做设备),只做算法层,理论上可以跨硬件商——这个卡位类似「PyTorch 而不是 GPU」。能不能坐得稳这个卡位取决于硬件方是否会自己往上做算法(大概率会做),但先占位比不占位强。
小结:一句根本约束 + 一个崩点 + 一个可带走动作
- 根本约束:backprop 用不了活神经元,所以塑造它们行为的唯一可扩展算法是闭环预测反馈。这条约束的直接后果就是 Parasma 的商业形态——做算法层而不做硬件层,因为算法层是活神经元学习的瓶颈;硬件(MEA + 培养箱)已经商品化了。
- 崩点:如果你把 Parasma 的算法层换成”随机搜索式”训练(不用 FEP、不用闭环预测),你会先在时间维度崩——一皿细胞寿命几周,训练一个 token 预测任务需要跑 10⁴+ 次 stimulate-record 循环,直接超时。这解释了为什么这个赛道所有玩家(Cortical Labs / FinalSpark / Parasma)都收敛到 FEP-style 的训练算法。
- 可带走的动作:读一下 Kagan 2022 Neuron 那篇。10 分钟,cell.com 全文页。它是这条赛道的地基——所有后续新闻你都能自己判断「是不是又一次 DishBrain 的换皮」。如果你只有 3 分钟,读 abstract 里那句 “Applying a previously untestable theory of active inference via the Free Energy Principle, learning was apparent within five minutes”——“previously untestable” 这五个字是全篇最重的字。
边界卡:这个结论什么时候不成立
我上面把 Parasma 挂到了 “FEP 商业化” 这个位置,但这个挂法有三种失效情形,读的时候心里要有:
- 如果活神经元的可塑性有隐藏上限——例如 10⁵ 个神经元在几周寿命内学到的最大信息量存在硬顶(我猜有,但没数),那 Parasma 的路径不会输给 Cortical Labs,会输给”硬件方向”——那种上限只能靠堆量(更大培养皿)或堆时长(长期存活)突破,都是硬件问题不是算法问题。
- 如果 backprop 的替代方案(forward-forward、predictive coding networks)先在硅基上跑通并且能效逼近生物——这个 2030 年前不一定不发生。那时候「湿件」的能效优势会缩窄到「体积功耗」这个更窄的场景,Parasma 的商业空间会被压到 robotics 头部。
- 如果伦理监管先落下来——Parasma 用的是人类神经元,Kagan 2022 论文标题里出现了 “sentience” 这个词(虽然作者小心地不主张培养皿有主观体验),一旦监管明确”人源神经细胞不得用于商业计算”,整个赛道要退回鼠源或类脑器官——那 90%/78.1% 的数字可能都要重来。这不是危言耸听,Parasma 官网 About 页面专门有一段谈”consciousness and suffering”,说明他们知道这个风险。
参考来源
Parasma 与湿件计算赛道
- Parasma 官网 与 next-token prediction 官方新闻
- Parasma 的 Y Combinator S26 主页
- Menlo Times 覆盖 Parasma 公开发布
- Cortical Labs 官网 与它的商业产品 CL1
- FinalSpark 官网——瑞士云端脑器官计算平台
这条赛道的地基论文(按时间线)
- Landauer, R. 1961. Irreversibility and Heat Generation in the Computing Process. IBM Journal of Research and Development 5(3):183-191. IEEE 版本——热力学下界,为「湿件为什么有戏」提供物理理由
- Maass, Natschläger, Markram. 2002. Real-Time Computing Without Stable States. Neural Computation 14(11):2531-2560. PDF——液态状态机 / reservoir computing 奠基论文,为「不可微系统如何被读出」提供数学工具
- Friston, K. 2010. The free-energy principle: a unified brain theory? Nature Reviews Neuroscience 11(2):127-138. 官方页面——FEP 综述,Parasma / DishBrain 训练算法的理论内核
- Kagan, Kitchen, Tran, et al. + Friston. 2022. In vitro neurons learn and exhibit sentience when embodied in a simulated game-world. Neuron 110(23):3952-3969. Neuron 全文——DishBrain 论文,FEP 首次被物质化验证
- Yaron, Zhang, Akita, et al. 2025. Dissociated Neuronal Cultures as Model Systems for Self-Organized Prediction. arXiv:2501.18772——把 FEP 与 reservoir computing 两条路径合并的最新综述
站内相关
- 训练小模型的三条路——本文和它的共同祖先是 AI 12 面镜的第 ⑪ 条「反馈闭环」,都在处理「怎么塑造一个学习系统」
- 投机解码的第二本账——一样的思路:把不可控的东西塞进一个可训练的读出层,来自 draft-verify 的血脉
- ToolGrad 深读——另一次「答案→反向生成 query」的实体化,闭环反馈的另一次变体
- AI 顶级原理望远镜(内部索引)——本文用到的第 ⑪ 条「反馈闭环」和第 ⑦ 条「可微即可学」的坐标出处