杨澜访谈录

Anthropic新模型偷吃瓜!最强Fable 5爆冷_我的网站

昼颜

一 |     

Anthropic又有两张新牌,被提前掀开了!今天,第三方开发者应用和Discord社区中,接连出现了两个陌生的模型ID——claude-mashmallow-eap(棉花糖)claude-melon-eap(甜瓜)早期实测流出,Marshmallow表现更强,对话自然度反超 Opus 5,Melon则稍逊一筹。不过,它们的综合能力全不是Fable级别,最快下周上线。就在全网吃瓜的同时,Anthropic内部却先炸出了一颗雷——Fable 5上线两个多月,却遭遇了一场近乎集体的冷落。

Anthropic紧急补牌

Claude新模型曝光这轮更新,似乎比以往来得更急。AI圈大佬们推测,Marshmallow大概率对应Opus级别的迭代升级,可能就是Opus 5.1。北京时间1月15日,据外媒报道,你说话的方式可以透露很多信息,甚至可以用来预测你的爱情关系将如何发展。假设你和你的伴侣的关系处于危险之中。你尝试过各种方法,甚至做过情感咨询。

二 | 而Melon则更接近Sonnet级别。

三 | 一位网友放出的SVG实测结果,也进一步拉开了两款模型之间的差距。

                                  
Anthropic官方目前还没有正式回应,但各种蛛丝马迹已经开始汇聚。如果只是正常升级,这件事本身并不奇怪。真正微妙的是,为什么偏偏是现在?毕竟,就在两个多月前,Anthropic才刚刚把自己最强、最贵的一张牌推上牌桌。但你还是想知道这段关系是否值得你麻烦。

四 | 你的关系会改善吗,还是注定要分裂?事实上,你最好停下来仔细听你的伴侣说什么。你必须用心倾听。

五 | 它就是站在Claude金字塔最顶端的Fable 5。

最强Fable 5,竟然爆冷两个月前,Fable 5顶着Anthropic最强旗舰的光环登场。能力最强,价格最贵,同时还是Claude整个产品线中最顶尖的那个AI。

六 | 当你彼此交谈时,你的声音已经包含了各种信息,可以回答上述问题。按照行业惯性,新旗舰一发布,大厂往往会迅速迁移,把预算向最新、最强的模型倾斜。这一次,规律在Fable 5身上失效了!支付平台Ramp追踪了,美国超70000万家企业的Token消费数据,结果发现:Fable 5上线一个月后,只吃掉了企业在Anthropic上6%的Token调用量,支出占比11.4%。

七 | 如今,两个多月都过去了,FT拿到的最新数据,这一支出份额仍徘徊在11%左右。

八 | 例如,语调的细微变化、短语之间的停顿、语量等,都可以揭示你隐藏的真实感受。也就是说,真正愿意把模型切到Fable 5上的开发者、大厂,寥寥无几。这些基本上是凭直觉完成的。

九 | 对面OpenAI旗舰GPT-5.6 Sol,同期拿走了25%的Token和23%的支出份额。同一个赛场,Anthropic顶配模型份额,只有竞品的四分之一。我们将利用这些变化来对我们所说的内容的含义进行细微的改变。更尴尬的是,Fable 5的总营收贡献大约只有GPT-5.6 Sol的75%,尽管它每个Token贵了一倍。以下三句话有什么区别?”你在这儿干什么?”(重点是做什么。)“你在这里做什么?”(压力在你身上。)“你在这儿干什么?”(压力在“这里”。

十 | )我们的声音所揭示的信息远远超过人类耳朵所能接受的。

十一 | 贵到什么程度呢?Fable 5的单价是,Anthropic自家Opus 4.8的2倍,是Haiku 4.5的10倍。压力的变化是强调言语意义的一种明显方式。

十二 | 虽强,但大多数企业的日常场景,根本用不到那个级别。但我们也会在没有意识到的情况下对我们所说的话进行其他的修改。自家Opus 5,反杀大哥Anthropic另一款模型,才是Fable 5的正面暴击。7月底,Opus 5正式登场,定价只有Fable 5的一半,但在编程、知识工作评测中,反而跑出了更好的成绩。CursorBench 3.2的测试结果,更直接——Opus 5在最大算力下得分70%,每任务成本$8.23。但是有一种方法可以从我们所说的内容中提取隐藏的信息。

十三 | Fable 5得分70.5%,高了0.5个百分点,但要$17.32。相当于多花一倍的钱,也仅多跑出0.5%的成绩。研究人员甚至开发了一种人工智能,可以利用这些信息来预测夫妇的未来。这种人工智能比受过专门训练的情感治疗师更准确地预测。

十四 | 在一项研究中,研究人员跟踪了134对有情感问题的夫妇。两年内,每对夫妇都录下了两次10分钟的心理咨询课程。企业用脚投票的结果毫不意外,Ramp数据显示,Opus 5上线后,它的支出迅速反超了Fable 5。但问题在于,如果旗舰模型只是展示柜,那市场凭什么给出2万亿美元的估值?开源从11%到62%,仅四个月不仅如此,开源AI的疯狂扩张,同样让Anthropic倍感压力。

十五 | 每个人都会选择一个与自己的感受相关、对自己重要的话题,然后一起讨论。研究人员也有数据显示,在过去的两年里,每对夫妻的情绪都发生了怎样的变化,比如他们的情绪是好转还是恶化,以及两年后他们是否还在一起。

十六 | 训练有素的治疗师观看这些视频。Vercel AI Gateway统计显示——4月,开源模型的Token份额只有11%。到了6月,这个数字暴涨到29%。

十七 | 8月最新数据,直接冲到了62%。

十八 | 通过评估夫妻在视频中相互交谈的方式、谈话内容和面部表情,治疗师可以评估他们情绪的可能结果。人工智能可以从我们说话的方式而不是内容中获取有用的信息,以确定我们的关系走向何方。同时,研究人员开发了一种算法来分析这对夫妇之间的对话。以往的研究为人类交流的特定特征提供了线索,如语调、语言长度和交流方式。

十九 | 短短两个月,从不到三成飙升到超过六成。该算法的任务是计算这些特征与情绪强度之间的关系。该算法完全基于视频记录,不考虑视频中的视觉信息。它也忽略了对话的内容,即语言本身。该算法只关注节奏、音调和每个人讲话的长度等特征。

| 令人惊讶的是,该算法还可以注意到一些人类无法察觉的语音特征。这些特征几乎是不可能描述的,因为我们通常没有意识到它们的存在,比如光谱倾斜(一个复杂的语音数学函数)。有了大量的数据,我们可以找到人类眼睛和耳朵可能不会注意到的规则。而它们花掉的钱,不到企业总支出的4%。”南加州大学的工程师、研究负责人Shri Narayanan指出。这种算法预测夫妻是否会离婚的准确性略高于治疗师。换句话说,干了大部分活的模型,几乎不花钱。该算法的预测准确率为79.3%,而治疗师的准确率仅为75.6%,尽管他能够理解谈话和看到肢体语言。”纳拉亚南说:“人类非常擅长解释各种信息。这就让Fable 5的位置越来越尴尬。”“但我们不能处理信息的所有方面。往里看,Opus 5只要一半的价格,就已经能追到它身后;往外看,开源模型还在一轮轮把价格往下打。”关键是,我们泄露了更多关于我们的思想和情感的信息,这超出了我们作为人类所能感知的范围。Fable 5当然可以继续负责冲击能力上限。但计算机算法的能力并不局限于破译人类用来传递信息的声音特征。换句话说,在我们的声音中还有其他“隐藏”的维度,只有人工智能才能触及这些维度。牛津大学的临床心理学家Fjola Helgadottir说,监控可能引发争论的因素可以帮助人工智能提醒夫妻“计算机的一个优点是他们可以从大量数据中找到特定的模式和趋势。”人类行为可以揭示潜在的心理过程。但是机器学习算法可以完成数据的梳理、相关信息的搜索和对未来的预测等任务。

| 预测你的关系寿命的算法可能没有那么吸引人,而且它目前的准确性只能持续四分之三。但Anthropic眼下更缺的,是企业真正愿意长期用、放量用的模型。这么看,Marshmallow(棉花糖)和Melon(甜瓜)突然冒出来,也就没那么意外了。正如你所能想象的那样,这个预测会影响你的情绪发展以及你对伴侣的感觉。但是,如果我们能从我们的说话方式和身体语言中发现隐藏的信息,它可能会帮助我们改善我们的情感关系。德克萨斯州农业和技术大学的计算机工程师西奥多拉·查帕里(TheodoraChaspari)正在开发一个人工智能程序,可以预测冲突何时会爆发。Chaspery和他的同事们使用了一天内从34对情侣佩戴的传感器中收集到的数据,比如像手表一样的运动跟踪装置。

| 它们要补的,可能正是Claude全家桶里最关键的一块——够强,也得够便宜;能秀肌肉,更得有人买单。这些传感器可以测量佩戴者的汗液、心率、音调和其他语音信息。

|

。此外,他们还可以分析夫妻间的对话,例如他们是否使用积极或消极的词汇。

| 在传感器磨损的当天,19对情侣发生了某种程度的冲突。Chaspery和他的同事使用机器学习技术来训练学习婚姻争吵规则的算法。该算法通过对这些数据的训练,仅利用传感器采集的数据判断其他夫妻之间是否存在冲突,准确率为79.3%。该小组目前正在开发一种预测算法,用于检测警告信号,并在即将发生的争吵之前提醒情侣们。

| 根据研究人员的预测,该产品的使用场景如下:你在办公室里忙了一天,在回家的路上可能会有一个非常紧张的会议。你的搭档整天都很累。

| 通过监测你的呼吸频率、心率以及你在过去几个小时内的谈话方式,该算法可以预测你回家后与同样心烦意乱的伴侣发生摩擦的可能性。

| ”然后我们可以以一种更积极的方式介入并解决你们的冲突。”查帕里指出。佛罗里达国际大学临床与定量心理学中心的心理学家Adela Timmons参与了该项目,他解释说,这只是在冲突开始前向这对夫妇传递信息的问题。”我们相信,如果我们能在人们日常生活中最需要的时候给他们一些指导,情感治疗会更有效。”传统的情感治疗模式不能达到这一目标。通常,夫妻需要每周参加一次咨询会议,在这期间,他们会回忆上一次咨询会议以来发生的事情,并讨论会议期间出现的问题。

| ”迪蒙斯指出,当人们最需要支持的时候,治疗师不可能立刻出现在现场。传统的治疗方法有很多步骤是无效和无效的,但是,通过对人的生理活动和声音特征的持续监测,自动化手段可以满足实时干预治疗的梦想。

| Hergadottier指出,这种方法也可以标准化情绪疗法的工作方式。想要改善人际关系的夫妇可以从人工智能的预测能力中获益。”“没人知道在封闭的治疗室里会发生什么,”赫加多蒂说。有时最有效的治疗需要治疗师付出更多的努力,所以它没有被采用。另一方面,人工智能治疗系统在临床实践中是完全开放和透明的。

| ”这些算法可以由该领域的顶级研究人员和实践者设计和考虑。此外,电脑不需要休假,也可以让许多用户同时受益。然而,这种算法也有一些缺点。当争论升级时,如果你的手机突然发出警报,很难知道它是否会助长你的愤怒。干预的时机至关重要。”“我们不想卷入冲突,”戴蒙斯说。如果人们已经生气了,他们就不会听从手机的指令,让自己平静下来。

| 但如果我们能抓住机会,当人们的愤怒开始上升,但仍能调节自己的行为,这是一个非常合适的时间来干预。在这种软件真正上市之前,还有许多技术障碍需要解决。该团队将继续改进其算法,并对各种人进行测试。此外,用户隐私也是一个大问题。有了这样一个可以记录你和伴侣关系数据的设备,你可能会把很多敏感信息置于危险之中。此外,如果有人被控家庭暴力和其他犯罪,使用这些数据也将是一个问题。”我们必须考虑如何处理这些情况,以及如何保护用户的隐私,同时确保他们的人身安全。“我们将继续讨论这些社会问题,”Dimons说。如果这种情感治疗模式真的有效,它也可以帮助我们改善其他类型的关系,如家庭关系、工作场所关系、医患关系等等。我们的身体系统被监控得越多,我们的关系就越能被发现。

| 除了声音和基本的生理反应,可能还有其他维度可以揭示我们的意图,隐藏的信息最好由机器来解释。

Current article:http://www.liawucunsainantaonao.sbs/news/20260826_4123218.htm

Published on:17:53:05