栏目上新
推荐专题
当AI生成图片需要“看图说话“时,我们到底在考什么?
这篇论文提出TRACE-Bench,一个用锚定、解耦、应用、组合四个原子操作符拆解多参考图像生成任务的评测框架。基于631个公式模板、约4000张参考图构建了1600个测试案例,测试9个主流模型后发现,当前瓶颈集中在属性...
OpenAI将能源规划纳入数据中心组织,布局清洁能源战略
OpenAI正将能源规划整合至其工业计算组织,招聘清洁能源与新技术负责人,负责评估清洁能源、储能、电网灵活性及低碳备用电源等技术。此举背景是OpenAI在乔治亚州卡梅利亚园区承诺向佐治亚电力公司提供最高1GW的灵活需求响...
让机器人看懂动作,却不需要它看清深度
这篇论文提出一种插件式2D动作接口,让已训练好的3D运动语言模型无需修改或微调即可直接理解2D姿态输入。实验证明2D输入效果媲美3D输入,且在真实视频场景下配合专门的降噪适配器,2D方案比3D姿态估计更省算力、更实用,为...
比尔·盖茨对AI深感忧虑,开始公开发声
微软联合创始人比尔·盖茨近日发表近6000字长文,态度从昔日的AI乐观主义者转变为深度悲观者。他警告AI将是"人类历史上最动荡的时代",可能成为"最大的不公正根源"。盖茨提出征税机器人、设立"人类保留岗位"等政策建议,并...
当AI科学家开始写论文:我们扒开了800份研究报告,发现了一个共同的秘密
研究团队让8种AI智能体独立完成100项真实科研任务,深度剖析800份研究轨迹后发现,即便是最强模型,也普遍存在"发现问题却不修正"的现象,背后根源指向AI缺乏检验自身产出、主动纠错的元认知能力。
我亲测了GoPro可换镜头相机,说实话,它真的很出色
GoPro推出的Mission 1 Pro ILS搭载Micro Four Thirds镜头卡口,支持多种镜头互换,最高可录制8K/60p画面,并具备4K/240fps慢动作及接近1000fps的全高清高帧率拍摄能力。新...
训练AI理解世界,到底缺了什么数据
WorldRover是一套面向可探索世界建模的合成视频数据引擎,基于虚幻引擎构建,能让同一段探索轨迹在保持路线与场景一致的前提下,重新渲染为多种视角和外观状态,并同步提供深度、光流、长程点追踪等丰富标注,最终发布Worl...
新平台深入AI“黑箱“:Goodfire推出Silico工具助力模型可解释性研究
AI可解释性初创公司Goodfire近日将其Silico平台向公众开放,该平台集成多种机械可解释性工具,可帮助研究人员理解AI模型的内部运作机制。用户可用自然语言描述研究目标,平台自动生成实验方案并调度AI智能体并行执行...
训练大模型做数学题时,为什么“表现好的能力“反而被过度关照?
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。
AI助力设计可落地应用的新型材料
MIT研究人员开发出名为CrysVCD的材料生成框架,通过在生成前期引入语言模型约束化学价规则,显著提升材料稳定性。该框架可与任意扩散模型结合,将晶格动力学稳定率提升至近70%,同时支持定向生成高热导率或高介电常数等特性...
当AI听不懂“嘈杂世界“的时候:一套不用训练、9毫秒搞定的降噪魔法
这篇论文提出PRISM,一种无需训练、无需梯度、无需噪声标注的音频文本模型降噪方法。基于"仿射噪声假设",它用三步闭式几何修正压缩成静态矩阵,实现单样本0.0009毫秒的推理速度,在多个噪声基准上超越现有方法及需要特权提...
芝加哥全电动快线计划2030年开通,15分钟直达奥黑尔机场
芝加哥一批商界领袖宣布推出"O'Hare Flyer"项目,计划打造美国首条机场快线电动列车,实现芝加哥西环区至奥黑尔机场T2航站楼的全程直达,单程约15分钟、票价25至35美元。该线路整合CSX、加拿大国家铁路及联合太...
从垃圾堆里捡出一台能跑大模型的超级计算机
研究团队用128块二手V100 GPU搭建了一台成本仅2.2万美元的大模型推理集群,通过设备级流水线并行策略实现了LLaMA-70B的规模化服务。研究发现二手硬件在经济性上大幅领先新款GPU,但运营碳排放可能高出40倍以...
Arga获千万美元融资,专为企业智能体打造专属训练环境
AI智能体初创公司Arga完成1000万美元种子轮融资,由General Catalyst领投,Box Group、Emergence等参投。Arga专为Salesforce、Workday等企业软件构建数字孪生训练环境...
像素空间和潜空间打了一架,谁赢了?
这篇论文研究了如何高效训练像素空间文生图扩散模型。研究发现直接在像素空间预训练收敛很慢,因此提出先在潜空间预训练再转换到像素空间的策略,并系统探索了权重初始化、数据配比、预测目标、解码器架构、噪声调度等关键设计,最终使像...
QueryStory:让企业真正信任AI给出的数据答案
QueryStory由前谷歌安全工程师Shapor Naghibzadeh联合创办,专为大型企业打造AI数据分析平台。该平台将数据查询与叙事分析结合,自动展示SQL查询过程,并提供置信度指标,让用户能够验证AI分析结果的...
HiFi-BRep:如何让AI画出真正能用的工业零件图纸
HiFi-BRep是一篇聚焦工业CAD模型自动生成的论文,提出通过高保真潜在表示和单阶段拓扑约束解码器,同时解决B-Rep生成中的表示噪声和错误累积问题,在结构有效性和几何精度上显著超越现有方法,为可靠的三维工业设计自动...
IBM Granite 4.2系列大语言模型发布,主打本地部署推理能力
IBM推出Granite 4.2开源大语言模型系列,提供3B、8B和30B三种参数规模版本,原生支持128K上下文窗口。该系列主打本地部署,8B和30B版本经过强化学习训练,支持终端操作、网络搜索和外部工具调用。Gran...
2014年,一段视频里藏着两条完全不同的线索
这篇论文提出双流卷积网络,用两个独立卷积网络分别学习视频的静态画面信息和运动光流信息再融合,首次让深度学习在动作识别任务上追平甚至超越手工特征方法密集轨迹,在UCF-101上达到约88%准确率,是视频理解领域的关键转折点...

