栏目上新
推荐专题
AI智能体的记忆会撒谎:一场发生在系统内部的授权洗白
AI智能体的持久化记忆会在跨会话更新中悄悄丢失或篡改授权信息,导致执行者依据错误记忆做出未经授权的操作。论文提出EAL-BENCH基准,揭示了这种发生在系统内部、无需外部攻击者的授权洗白现象及其安全与实用性权衡。
当AI说它能修好你的代码时,它其实假设了一件事
论文提出REALSWE框架,揭示AI编程助手在真实用户简短请求下表现下降6.4%,发现"期望行为"和"动机"是决定成败的关键信息,而环境细节等反而影响甚微。
瑞萨推出64位RZ/G3L和RZ/G3SE微处理器,赋能HMI与IoT边缘系统
瑞萨电子推出RZ/G3L和RZ/G3SE两款引脚兼容的64位MPU,面向HMI与IoT边缘系统,具备GPU、PCIe、TSN以太网及1毫瓦级待机功耗,支持快速Linux唤醒。
当AI裁判自己都判不准的时候,我们该信谁?
本文解读AgentJudgeBench基准测试,揭示LLM裁判在评判AI工具调用任务时的可靠性问题:难度越高判断越差,标准答案有时反而降低准确率,六大裁判在难题上共同卡在同一天花板下。
Peridio加入Arm物理AI生态计划提速机器人量产
Peridio宣布加入Arm Total Design for Physical AI计划,其Avocado OS与Peridio Core将为机器人提供可移植、可更新的设备软件层,加速从研发到量产部署。
AI追问一个问题要花掉一美元,问题出在哪?
AI处理复杂文档问答时成本高昂,论文提出智能体式数据裂解技术,让AI在回答问题时顺手提取文档中相关结构化信息供后续复用,实测降低53%成本且准确率几乎不变。
Kimi打造者月之暗面瞄准20亿美元年营收目标
Moonshot AI(月之暗面)计划年底实现20亿美元年化收入,为8月水平的两倍,K3模型开源后需求强劲,但Anthropic近日指控其训练中大量蒸馏Claude Opus数据。
不用梯度更新模型,怎么做测试时适应?CASTER给出了一个答案
论文提出CASTER,一种无需梯度更新的测试时适应方法,通过仿射变换搬运源域类别统计量完成适应,并设计可迁移性证书识别失效场景,在多个骨干网络和数据集上验证了效果与局限。
OpenAI与数学家的争端持续升级
25位菲尔兹奖得主联名发信,指AI实验室在数学证明竞赛中损害学术署名与研究透明度,OpenAI被指施压学者隐去合作者贡献,并撤回对加州理工数学活动的赞助。
短剧生产链上,谁在为最后的烂尾负责?
腾讯混元团队提出DramaChain Bench,首个覆盖短剧全生产链的评测基准,用真实生产数据、时空定位标注和智能体自动评审,揭示上游缺陷如何沿链条放大成片质量问题。
Mecka AI估值近5亿美元,红杉领投抢占机器人数据赛道
机器人训练数据公司Mecka AI正洽谈由Sequoia Capital领投的新一轮融资,估值约5亿美元,距其上轮6000万美元融资仅三个月。
让机器解几何题时,我们到底在教它什么
该论文提出可寻址推理框架,用Code-CoT把几何图转成可引用代码并拆分为事件,配合CE-GRPO在关键事件处分支采样定位精准信用分配,九个几何数据集平均准确率达76.04,显著优于传统GRPO方法。
一个企业级AI模型如何吃下50%的内部流量
一家企业面对200多个内部应用抢占同一批GPU资源,通过分析生产流量找出指令遵循、工具调用、任务分布三大短板,分别训练强化学习专家再合并权重,最终用320亿参数模型吃下50%流量,超越七倍参数量的大模型,成本降低数倍。
卡特彼勒推出更重型电驱推土机,采用百年铁路电传动技术
卡特彼勒发布D11 XE Electric Drive混合动力推土机,采用电驱技术,单位物料能耗降低达25%,每小时作业量提升5%至10%,并延长发动机大修间隔。
AI能不能自己造出更强的AI
论文提出递归再生数RAI,衡量AI辅助AI研发何时从普通加速转变为自我放大的临界状态,发现该转变取决于反馈结构而非智能水平本身,并揭示多机构网络可能比单一机构更早触发这一临界点。
亚马逊在德国部署50辆奔驰纯电重卡
亚马逊宣布2026年底前在德国投用50辆奔驰eActros 600电动重卡,用于配送中心间中程运输,续航500公里,公司在欧洲电动化投资已超10亿欧元。
循环两次的Transformer,怎么用同样的算力训练出更聪明的大模型
论文提出SMELT架构,在训练算力、参数量、KV缓存三项预算严格对齐的前提下,让循环中间层两次的MoE Transformer持续跑赢普通模型,最高省下18%训练算力,并揭示第二次循环通过降低注意力沉没提升长文本与上下文...

