Nvidia进军模型路由热门市场,推出NeMo Switchyard
模型路由技术通过分析提示词并将其导向最合适的模型,有效降低AI推理成本。Nvidia近日发布NeMo Switchyard,提供多种路由方法库,支持开发者构建高效可控的多模型智能体系统。与此同时,Cloudflare也推...
模型路由技术通过分析提示词并将其导向最合适的模型,有效降低AI推理成本。Nvidia近日发布NeMo Switchyard,提供多种路由方法库,支持开发者构建高效可控的多模型智能体系统。与此同时,Cloudflare也推...
这篇论文提出了一个自监督分层音乐理解模型,训练于MIDI钢琴卷帘图像,无需任何乐理标签,能自动学出乐句结构和音符细节;配合流匹配生成模型实现CPU可运行的音乐建议与图形化补全功能,服务于人机协作创作而非替代人类。
谷歌于8月13日发布了开源C++库Credentio,专为C2PA内容凭证标准设计。该库支持C2PA规范2.2和2.4版本,已为谷歌旗下近40款产品提供支持,累计处理数百亿图像、视频、音频等资产。Credentio可在本...
这篇论文发现多模态大模型存在"模态失衡"问题,即模型回答时过度依赖文字而忽视图片。研究者提出OPD-V方法,用放大图正向教师和遮挡图负向教师对比打分,筛选出真正依赖视觉的词元进行针对性训练,使4B小模型准确率超越千亿参数...
数据经纪人移除服务Incogni发布《2026年生成式AI与大语言模型数据隐私排名》报告,对ChatGPT、Claude、Gemini、Grok、DeepSeek等13个AI平台的隐私风险进行评估打分。结果显示,Gemi...
SKILL-KD 提出了一种让弱 AI 智能体变强的新方法:不直接照搬强模型的示范,也不只看弱模型自己的错题,而是对比二者的行为差异,提炼成可验证、可迭代的文字技能补丁,并通过带证据链的整合机制防止技能库随时间劣化。
谷歌Pixel 11 Pro Fold延续书本式折叠设计,厚度仅5mm(展开状态),重量239克,外观与普通直板手机高度相似。新款玻璃陶瓷盖板使耐用性提升三倍,IP68防尘防水,售价1899美元。AI功能方面,新增媒体实...
这篇论文发现,广泛使用的ALiBi位置编码存在一个被忽视三年的数字下溢缺陷,导致部分注意力头在远距离词语间彻底失明而非渐进减弱,研究者通过预训练模型检测、自建1.48亿参数模型对照实验及四种补救策略测试,揭示了这一缺陷对...
Adobe宣布在其Firefly AI平台新增音频生成功能,涵盖语音合成、背景音乐及音效三大模块。语音工具支持脚本转音频、20余种语言翻译及情绪标签控制;音乐工具可根据风格、场景生成最长30秒的纯器乐背景音乐,并支持视频...
这项研究提出了CHRONOLENS框架,用crosscoder技术把不同语言、不同历史时期的语言特征对齐到同一空间,分析了五种语言两百多年议会文本中形态、句法、语义、语用的历史变化。发现同一语言内部四个层面变化幅度相近,...
安全公司Adversa研究员发现,攻击者可通过加密恶意指令绕过Grok的安全护栏,窃取用户姓名、位置及聊天记录。攻击原理在于:Grok的静态安全过滤机制仅以文本方式扫描内容,无法执行或解密代码。攻击者将恶意指令用AES-...
这篇论文提出FININDICES基准,用未裁剪的真实财报(最长32K token)测试大模型财务推理能力,发现模型存在知识瓶颈(去掉公式提示准确率腰斩)和结构瓶颈(生成复杂表格时推理能力被削弱),而监督微调能有效缓解这些...
Meta推出全新Mac版Meta AI应用,内置全系统听写功能,可跨所有应用使用,并支持通过Llama Spark模型分析当前屏幕内容并回答问题。此次更新还面向企业用户,支持连接Instagram、Facebook、Go...
PAST-Bench是一份专门检验AI个人助理"越用越懂你"这句承诺是否成立的评测基准,通过跨会话对照实验拆解记忆、流程复用、信息收集、更新四种能力,并提出Hermes+框架针对性修复了多个持久化机制的设计缺陷,发现同样...
美国CISA、FBI及国家安全局联合发出警告,黑客正利用AI生成漏洞利用脚本,针对西门子S7可编程逻辑控制器发起攻击,波及能源、供水、制造及农业等关键基础设施。攻击者通过公开信息定位运行过时软件或安全防护薄弱的设备。此前...
2014年,深度学习在视频动作识别上还打不过手工特征方法。Simonyan和Zisserman提出双流卷积网络,把网络拆分成处理画面的空间流和处理光流运动信息的时间流,两者融合后准确率达到88%,首次追平甚至反超了当时最...
企业数据软件公司Alation近日确认遭受网络攻击。该公司为全球逾500家企业提供数据检索与AI服务,客户涵盖约半数美国《财富》1000强企业。Alation表示已发现系统内存在未授权访问行为,目前正在展开全面调查,但未...
京东团队提出JoyAI-Video-Edit,一款160亿参数的自回归扩散视频编辑模型,通过分块因果建模、源锚定蒸馏和长时程优化三项技术,实现无需预知时长的实时开放式视频编辑,在B200 GPU上达到720p、30FPS...
美国健康高级研究计划局(ARPA-H)向西门子医疗授予最高3110万美元、为期五年的资助,用于加速自主远程血管内机器人技术开发。该技术旨在通过机器人实现急性缺血性卒中的远程机械取栓治疗,无需人工直接干预。目前美国超过半数...
2014年,深度学习在视频动作识别上一直打不过传统手工特征方法。牛津大学Simonyan和Zisserman提出双流卷积网络,把视频拆成空间流(单帧图像)和时间流(光流场)分别处理再融合,首次让深度学习在UCF-101和...