OpenAI决策API或成遏制智能体失控利器
OpenAI在Dev Day上发布Decisions API,可让模型在预设选项中快速选择,功能类似TypeSafe AI的Jev模型。该API旨在提速降本,并有望以低成本监控AI智能体行为。
OpenAI在Dev Day上发布Decisions API,可让模型在预设选项中快速选择,功能类似TypeSafe AI的Jev模型。该API旨在提速降本,并有望以低成本监控AI智能体行为。
GeoPair提出一种训练无关的Transformer压缩框架,通过全局最优层配对和广义Sylvester方程求解共享字典,结合硬阈值稀疏化,在文本、视频、音频多模态模型上均取得优于现有方法的压缩效果。
非营利组织LASST以违反加州计算机欺诈法为由,在旧金山法院起诉OpenAI,要求法院禁止其AI代理未经许可访问第三方系统,并停止不安全的AI开发行为。OpenAI称诉讼"完全没有依据"。
论文指出大模型评估长期忽视校准这一关键指标,即置信度与实际正确率是否匹配。作者呼吁将校准作为每个NLP子领域的标配评估维度,并分析了现有指标的适用边界与开放式生成场景下的挑战。
Reuters 泄露的 Anthropic 招股书数据显示,这家公司2025年收入46亿美元,却承诺未来十年投入5180亿美元用于计算基础设施,其中80%不可取消。Alex Kantrowitz 与 Ranjan Roy...
本文解读FLEET算法,一种给大语言模型多次生成过程加入记忆的方法,通过熵和方差熵识别关键决策点,用VectorDSU记录历史轨迹,在同等计算预算下显著提升代码生成和数学推理任务的准确率,同时实现3倍加速。
a16z"消费级AI应用Top 100"第七期首次披露消费支出数据:仅约4%的美国消费者为AI付费,顶级用户月均消费高达903美元。Olivia Moore 与 Josh Elman 复盘个人智能体的爆发、Muse与In...
本文解读了一项针对Whisper语音识别模型编码器的层剪枝研究,通过错误率排序砍掉六层冗余层,再用无标签数据蒸馏恢复性能,实现推理加速且无需改动推理代码。
Salesforce提出JITMEM即时记忆框架,主张AI智能体记忆应在任务出现时才现场提炼,而非提前写死总结,在多个测试环境中大幅提升任务成功率并降低计算成本。
OpenAI ChatGPT 与 Codex 负责人 Tibo Sottiaux 在 DevDay 当天接受专访,谈新产品 Dots 背后的判断:手工搭建的智能体循环终将被淘汰,未来是一个 24 小时在线、不断学习、挣脱...
一篇AI基准论文提出WhatWorkedBench,评估AI agent在预算实验后能否准确理解组件效应和交互关系,发现选对最优配置不等于真正理解实验,高斯过程重新推理可显著提升效应恢复准确度。
a16z对话Lio联合创始人兼CEO Vladimir Keil,拆解一张采购价格单背后被系统记录遗漏的邮件、表格与谈判,解释AI原生公司为何仍能撬动老牌厂商的客户,以及代理如何从检索一步步挣得自主决策的信任。
腾讯混元团队发布Hunyuan-A13B,采用混合专家架构,800亿总参数仅激活130亿,通过20万亿token预训练和四阶段后训练,实现数学、编程、智能体任务媲美更大模型,并支持快慢思考双模式切换。
Stripe收购OpenRouter后,创始人Alex Atallah与Replit的Amjad Masad首次公开对谈,揭示企业为何转向开源权重模型、警惕与前沿模型公司深度绑定,以及为何专精模型组合可能比单一"神级模型...
一篇关于AI群聊记忆系统的论文解读,提出SPEAKERMEM-R1双轨记忆架构解决消息归属与状态重建难题,训练轻量级Writer模型在三大多方对话基准上超越主流方法,效果接近大模型水平。
YC Paper Club 上,深度学习老兵 Francois Chaubard 回顾了 NVIDIA 芯片十余年的路线转向,并抛出零阶优化与 SOMA 架构等替代反向传播的实验性方案,重新追问 AI 计算该长什么样子。
论文提出VHD-Play方法,先解出数学模型的精确答案,再据此生成智能体交互训练环境,实现低成本批量生产3300个可验证环境,训练后模型在多个陌生任务及外部基准测试中表现大幅提升,且泛化能力随任务复杂度增长而增强。
Applied Electrodynamics创始人Bill在YC采访中讲述了公司如何用高频天线和无线电波打造出一台能透视干墙、大理石等材料的三维相机。灵感源自一次装修中发现墙后暗藏昂贵隐患的经历,团队仅用四个月就迭代到...
论文提出ImIR方法,用退化图片自身生成的指令向量替代文字提示词,改造预训练图像编辑大模型,一个适配器处理六种修复任务,效果超越文字方案,且支持无需任务标签的盲修复与可控修复强度调节。