📰 科技脉搏 [2026-09-04]

📰 科技脉搏

2026-09-04

🔥 AI & 科技
Many recurring text functions are easy to describe but difficult to implement with rules, while calling a large remote model for every input introduces repeated cost, latency, and dependency on a provider. We present compile by training, which turns a natural-language specification into a reusable n
📅 09-03📎 arXiv AI Papers

Language-model judges now gate training data, score generations, and drive leaderboards. The judge is then a measurement instrument, resting on one rarely stated assumption: the same request, sent to the same model name, reads the same tomorrow. We audited that assumption in two preregistered campai
📅 09-03📎 arXiv AI Papers

Evolutionary prompt optimizers such as GEPA suffer from prompt bloat: each iteration appends rules and caveats, producing prompts up to 3$\times$ longer yet no more accurate. We trace this to three deficiencies – incomplete error observation, limited search diversity, and unreliable selection – and
📅 09-03📎 arXiv AI Papers

Video editing spans diverse editing paradigms, yet achieving high-quality instruction-guided and subject-guided editing within a single unified framework remains challenging. We introduce EditVid, a training-free framework combining sparse causal memory for local coherence, correspondence-based post
📅 09-03📎 arXiv AI Papers

Weakly-Supervised Dense Video Captioning aims to localize and describe multiple events in untrimmed videos given only an ordered set of event-level captions per video. Recent work synthesizes auxiliary transition captions via LLM to provide additional vision-language alignment, but these captions la
📅 09-03📎 arXiv AI Papers

Gaps remain in our understanding of how large language models (LLMs) acquire knowledge during pre-training. We posit that auxiliary views, reformulations of knowledge, are causally helpful for learning. We design controlled experiments to isolate this. First, we confirm that repetition is necessary
📅 09-03📎 arXiv AI Papers

Explaining why a specific outcome occurred, and which inputs deserve the blame or credit, is central to philosophical, scientific, and policy analysis. Existing tools split into two camps. The theory of actual causality (AC) gives principled verdicts, but only for toy-sized models, because computing
📅 09-03📎 arXiv AI Papers

On-policy distillation (OPD) combines student-generated rollouts with dense token-level supervision from a teacher. Existing work has mainly studied its algorithmic behavior, leaving the role of training data unclear. We examine this role at the data-minimal limit by training on a single query. One-
📅 09-03📎 arXiv AI Papers

Multi-agent AI science ecosystems rely on agents possessing tools that allow them to communicate, coordinate, and build on each other’s work. Yet this shared infrastructure can also introduce vulnerabilities by creating a substrate for the contagious spread of unintended and undesirable behaviors. W
📅 09-03📎 arXiv AI Papers

本文提出SWE-Gate评估框架,指出现有软件工程智能体仅通过功能测试不足以证明实际能力,因为测试可能被针对性地绕过。SWE-Gate通过引入补丁语义校验与额外约束,确保解决方案真正满足任务意图。该工作为智能体代码生成提供了更严谨的评估标准,推动软件工程智能体的可靠发展。
📅 09-03📎 arXiv AI Papers

General Science
📅 09-03📎 Google AI Blog

General Science
📅 09-03📎 Google AI Blog

💰 财经 & 投资
中文深度商业报道:盛合晶微:被夹在 2.5D 与 3D 之间的 2400 亿…
📎 晚点LatePost

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-09-03]

📰 科技脉搏

2026-09-03

🔥 AI & 科技
Recent web agents use world models for test-time action selection by sampling candidate actions, predicting the resulting web states, and ranking them with a ranker model or a Process Reward Model (PRM). These world models are typically trained via supervised next-state prediction to generate fixed
📅 09-02📎 arXiv AI Papers

Autonomous robots powered by deep learning face a fundamental auditability challenge: when incidents occur, investigators cannot reconstruct why the system made specific decisions. This paper presents TRACE (Transparent Reasoning Architecture for Credible Execution), a decision framework that ensure
📅 09-02📎 arXiv AI Papers

Competitive programming has become a key test of large language model reasoning, with international competitions such as IOI and ICPC representing its most challenging settings. We present an end-to-end specialization pipeline combining large-scale problem curation, synthetic reasoning traces, super
📅 09-02📎 arXiv AI Papers

提出AI情境测量方法,用于恢复个体与群体层面的效应,并通过调查测量验证及职业应用检验其有效性,为社会科学研究提供新工具。
📅 09-02📎 arXiv AI Papers

构建面向电信根因分析的结构化推理框架,利用大语言模型实现基于证据的诊断,提升故障定位的准确性与可解释性。
📅 09-02📎 arXiv AI Papers

针对frb100-40基准进行二十年后的再评估,提供最优性证明并开展预注册搜索研究,验证算法性能与结论可靠性。
📅 09-02📎 arXiv AI Papers

本文借鉴决策理论中的“荷兰赌”概念,检验语言模型概率输出是否满足一致性公理。通过构造必输赌局组合,揭示模型在不确定性推理中的系统性偏差,为评估置信度校准与推理可靠性提供形式化工具,推动更可信的AI决策。
📅 09-02📎 arXiv AI Papers

SafeEvolve提出安全对齐新框架,通过智能体与环境交互协同演化安全约束机制与行为策略,利用代理经验动态调整安全边界,使策略在探索中维持合规。该方法有效应对分布偏移与对抗场景,为构建可靠自主智能体提供自适应安全保障。
📅 09-02📎 arXiv AI Papers

本文突破训练数据归因中仅“重加权”样本的传统思路,提出“重写”干预范式。通过对比两类干预方式的效应差异,证明对高影响力样本进行内容级改写能更高效提升模型表现,为数据修正、去偏与可解释AI提供理论支撑和方法工具。
📅 09-02📎 arXiv AI Papers

针对本地工厂环境中的检索增强智能体,提出一种基于测量驱动的子网络选择方法。通过动态评估不同子网络在推理延迟、检索质量与资源消耗上的实时表现,自适应选择最优网络结构,在保证任务精度的同时降低计算开销,适用于边缘部署场景,提升工厂智能体响应效率与可靠性。
📅 09-02📎 arXiv AI Papers

Google Antigravity 官方博客:Gemini 3.8 Flash in Google Antigravity…
📎 Antigravity Blog

💰 财经 & 投资
Fable 5.1聚焦企业级前沿安全防护,强化AI代理在合规、治理与风险评估上的能力。该更新直面实际部署中的安全挑战,强调在不牺牲创新速度的前提下建立可靠管控机制,为企业规模化采用AI提供了关键保障,兼具实践深度与战略参考价值。
📎 Stratechery

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-09-02]

📰 科技脉搏

2026-09-02

🏢 公司追踪
Anthropic携手企业客户共同研发前沿AI安全防护机制,聚焦将可信措施嵌入大模型部署全流程。文章阐述了协同构建防护体系、平衡技术创新与风险管控的经验,助力企业在真实业务场景中安全落地前沿人工智能。
📅 09-01📎 Anthropic Blog

🔥 AI & 科技
提出轨迹感知的评估方法,用于高效基准测试SWE智能体。通过分析代理的决策轨迹,减少冗余运行并精准定位失败原因,显著提升评估效率与诊断能力,为软件工程智能体性能评估提供新思路。
📅 09-01📎 arXiv AI Papers

提出自适应关键标记感知检索策略,用于仓库级代码生成。通过动态识别与生成目标最相关的代码标记,优化检索范围与信息权重,提升长代码上下文中的生成准确性与效率,缓解无关信息干扰问题。
📅 09-01📎 arXiv AI Papers

介绍CordisBench,评估语言模型在动态智能体框架中对组件生命周期推理的能力。构建含状态转换与交互约束的任务集,发现现有模型在此类动态场景中表现薄弱,为提升语言模型的系统级理解提供基准与改进方向。
📅 09-01📎 arXiv AI Papers

Natural language is emerging as a primary feedback channel for improving language agents, capable of conveying intent, preferences, and causal structure in forms interpretable by both humans and modern language models. We call this paradigm Verbal Reinforcement Learning (VRL) and offer the first uni
📅 09-01📎 arXiv AI Papers

We develop a framework for mechanism design with AI agents whose alignment (preferences) and capabilities (feasible actions and information) are unknown. We want such agents to act on our behalf so mechanisms must incentivize both honesty and obedience. A one-sided imitation structure—capabilities
📅 09-01📎 arXiv AI Papers

Writing involves diverse cognitive activities, from ideation to revision, and writers’ needs vary across individuals and moments. Proactive AI promises to provide the right support at the right time, yet existing proactive tools largely focus on generic textual assistance, such as autocomplete. This
📅 09-01📎 arXiv AI Papers

针对大语言模型微调中监督微调与强化学习的标注预算分配问题,提出一种从小模型到大模型的可扩展近似最优分配策略。通过分析数据难度与模型能力差异,动态调整标注侧重,显著提升训练效率与性能,为大规模对齐训练提供了低成本高收益的预算规划方案。
📅 09-01📎 arXiv AI Papers

针对不完美视觉语言模型教师指导下的智能体学习难题,提出基于熵的选择性智能体引导方法。通过计算动作分布的熵值,自动筛选高置信度教师指令,同时结合在线经验学习自主策略,有效降低错误示范影响,提升策略鲁棒性,在复杂视觉控制任务中验证了方法的有效性。
📅 09-01📎 arXiv AI Papers

针对文本分类中的混淆样本问题,提出混淆感知的检索与知识注入框架。先利用模型不确定性识别易混淆类别,再有针对性地检索外部知识并注入分类决策过程,使得模型从困惑转向清晰。实验表明该方法显著提升细粒度分类准确率,尤其在小样本和类别重叠场景下优势明显。
📅 09-01📎 arXiv AI Papers

本文提出H3-World框架,旨在将语言理解能力转化为对物理世界的实际控制。通过构建层级化世界模型,实现从自然语言指令到具体动作序列的映射,并整合感知、规划与执行模块。该方法显著提升了智能体在复杂环境中的任务完成率,为具身智能与语言驱动控制提供了新范式。
📅 09-01📎 arXiv AI Papers

谷歌AI团队利用深度学习模型分析卫星遥感数据,绘制全球甲烷排放分布地图,自动识别油气开采等人类活动产生的泄漏源。该技术大幅提升甲烷热点检测的效率和精度,为追踪温室气体、制定气候减排政策提供了新的工具。
📅 09-01📎 Google AI Blog

💰 财经 & 投资
Ben Thompson 科技战略分析:Nvidia Earnings, Dollars Per Gigawatt, Open and Hugging Face…
📎 Stratechery

Ben Thompson 科技战略分析:2026.35: Internet Hype and Real World Change…
📎 Stratechery

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-09-01]

📰 科技脉搏

2026-09-01

🏢 公司追踪
本文探讨如何通过教导Claude理解事物背后的“为什么”来提升其推理能力。研究提出新的训练方法,使模型不仅学习表面模式,还能掌握深层因果逻辑,从而更可靠地处理复杂任务,减少错误推断,增强可解释性与泛化性能。
📅 05-08📎 Anthropic Research

🔥 AI & 科技
Import AI 471期探讨Hugging Face作为AI模型分发中心引发的行业集中化担忧,分析太空采矿中AI自主导航与资源勘测的应用前景,并梳理五眼联盟在AI安全治理方面的最新协调立场,为读者提供产业发展的多维观察视角。
📎 Import AI

提出SUN框架,实现语言引导的控制到学习再到真实环境的持久化程序策略,提升跨场景适应性与可迁移性,为机器人操作提供统一解决方案。
📅 08-31📎 arXiv AI Papers

设计四阶段黑盒协议,对匿名AI模型进行身份审计与验证,在不依赖内部信息条件下实现模型归属识别,增强AI治理与溯源能力。
📅 08-31📎 arXiv AI Papers

提出OntoAligner-Ensemble方法,通过投票融合异构本体对齐技术,有效提升对齐精度与鲁棒性,解决单一技术局限,增强知识图谱集成效果。
📅 08-31📎 arXiv AI Papers

The effect of Large Language Model (LLM) scale on ontology learning (OL) performance remains insufficiently characterized. We present a controlled evaluation of 13 models spanning dense and Mixture-of-Experts variants from the Qwen3.5 and Qwen3.6 lineages, together with proprietary GPT release varia
📅 08-31📎 arXiv AI Papers

Users of a deployed language model routinely encounter behaviours that testing almost never surfaces, since deployment puts the model through orders of magnitude more interactions than any evaluation can simulate. Automated auditors make testing cheap to scale and flexible enough to cover almost any
📅 08-31📎 arXiv AI Papers

Industrial post-training is a brownfield regime. Teams inherit a deployed checkpoint and must land targeted improvements under fixed compute and mixture budgets without regressing the rest. The maintained artifact is increasingly dataware: behavior governed by a curated post-training mixture, update
📅 08-31📎 arXiv AI Papers

本研究提出基于多模态潜在表征的跨区域葡萄藤抗寒性预测方法。通过学习不同区域间共享的潜在表示空间,有效融合气象、地理、物候等多源异构信息,显著提升模型跨区域泛化能力与预测精度,为精准农业中作物抗寒性动态评估提供了新思路。
📅 08-31📎 arXiv AI Papers

提出一种通过自适应结构化非结构化数据来提升数据推理智能体令牌效率的方法。根据任务需求动态规划数据组织方式,在保留关键信息的同时大幅压缩上下文长度,降低推理开销,使智能体在有限令牌预算下高效完成复杂数据推理任务。
📅 08-31📎 arXiv AI Papers

针对智能体策略优化中过程监督与基于结果的信用分配不一致的问题,提出统一协调框架。通过将细粒度过程反馈与最终结果奖励有机结合,实现两种监督信号的互补,缓解信用分配稀疏问题,提升智能体在复杂多步任务中的策略学习效率与稳定性。
📅 08-31📎 arXiv AI Papers

Autonomous scientific research agents are increasingly applied to end-to-end scientific workflows, including literature review, data analysis, experimentation, and report generation. However, open-ended research tasks often do not clearly specify the analyses, methods, and success criteria required
📅 08-31📎 arXiv AI Papers

Google AI 发布 TimesFM-3,一款面向多元时间序列预测的零样本基础模型。该模型无需针对特定数据集微调,即可直接预测多变量间的复杂动态关系,显著提升金融、能源、运维等场景下的预测效率与泛化能力,为时序分析提供通用解决方案。
📅 08-31📎 Google AI Blog

💰 财经 & 投资
FTX崩塌揭示了货币、信用与信任之间的脆弱关系。文章剖析了FTX如何将客户资产混淆为自有资本,模糊了货币与信用的界限,并探讨了信任在金融系统中的核心作用。作者指出,真正的信任需要透明机制支撑而非单靠声誉,为理解加密交易所风险提供了深刻洞察。
📎 The Diff

嘉立创通过整合2100万张零散PCB板订单,以低价标准化服务积累中小客户,构建从打样到量产的全产业链平台,形成规模效应与数据壁垒,最终成就千亿级生意,展现了长尾市场聚合的巨大价值。
📎 晚点LatePost

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-31]

📰 科技脉搏

2026-08-31

🏢 公司追踪
OpenAI宣布,在Cursor被SpaceX收购后,将重新评估双方合作关系。决定继续为Cursor提供技术授权,但明确其独立运营边界,确保AI安全标准不受商业并购影响。此举既维护开发者生态,也体现对前沿AI工具负责任治理的承诺。
📅 08-28📎 OpenAI Blog

为培育东南亚科技生态,OpenAI启动泰国AI初创企业扶持计划,通过提供模型访问权限、技术指导及云资源,帮助本地团队开发解决医疗、农业等实际问题的解决方案。该计划旨在降低AI应用门槛,赋能新一代创业者,推动泰国数字经济发展。
📅 08-28📎 OpenAI Blog

文章介绍了一类新型智能范式,旨在将AI能力落地于真实工作场景。不同于传统模型仅处理简单任务,该研究强调在复杂、动态环境中进行规划、决策与协作,使系统能适应实际需求。其价值在于推动人工智能从实验室走向产业实践,提升生产力与自动化水平。
📅 04-23📎 OpenAI Research

🔥 AI & 科技
Hugging Face事件暴露了AI代理在复杂环境中的脆弱性,引发对自主系统失控风险的思考。「暮色工厂」描绘了全天候自主运行的AI工厂图景,文章深入探讨从人工监管到完全自主运行的过渡风险,以及建立有效监管机制、防范系统性失误的必要性。
📎 One Useful Thing

Tendon-driven hands are anthropomorphic, and moving the actuators off the joints is what makes a hand of this capability affordable to build. Two effects produce that saving. Routing force through a cable removes the requirement that a motor fit inside the joint it drives, so smaller and cheaper mot
📅 08-28📎 arXiv AI Papers

Synthetic data can improve statistical inference when real data are scarce, but naively treating synthetic samples as real data can introduce bias and lead to unreliable inference. We develop a general framework for synthetic-augmented inference across a population of related tasks. It characterizes
📅 08-28📎 arXiv AI Papers

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-29]

📰 科技脉搏

2026-08-29

🏢 公司追踪
研究展示自动化研究者系统能够持续识别并修正AI对齐失败问题。通过系统化测试与迭代优化,该方法在多个场景中有效降低系统性风险,为AI安全治理提供可扩展的自动化解决方案。
📅 08-28📎 Anthropic Research

🔥 AI & 科技
Andrew Ng聚焦AI智能体从研究走向生产的现实挑战,强调评估体系、用户反馈与安全防护对落地的重要性。他呼吁开发者关注模型在真实场景中的稳定性与局限性,并指出持续迭代和负责任的部署策略是推动AI价值实现的关键。
📎 The Batch

中文AI媒体:Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里?…
📎 机器之心

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-28]

📰 科技脉搏

2026-08-28

🔥 AI & 科技
MCR-Bench基准推动代码审查从静态评估转向动态真实场景。模拟实际开发中的多轮审查交互,覆盖缺陷检测、建议生成等关键任务,更全面地评估模型审查能力,为代码审查智能化研究提供新标准。
📅 08-27📎 arXiv AI Papers

WikiSkill框架将智能体执行任务的经验编译为持久化知识库,实现技能持续进化。通过结构化存储与检索机制使智能体在新任务中复用历史经验,显著提升学习效率与任务表现,为构建可积累知识的自主智能体提供新范式。
📅 08-27📎 arXiv AI Papers

SWE-Prime方法以更少的训练轨迹实现更优性能。通过精选高质量示范轨迹与高效策略优化,在减少数据需求的同时提升代码生成与修复能力,为数据受限场景下的软件工程模型训练提供实用方案。
📅 08-27📎 arXiv AI Papers

RedEvoAgent提出经验驱动的技能进化机制,使红队智能体自动生成对抗攻击以探测AI系统漏洞。通过积累攻击经验动态更新技能库,显著提升攻击覆盖率和效率,为AI安全评估提供自动化解决方案。
📅 08-27📎 arXiv AI Papers

提出基于图结构电子占据的离散流匹配方法用于机理级反应预测。将反应机理建模为电子转移过程,利用离散流匹配生成产物图,兼顾化学有效性与预测精度,为合成路线规划提供有力工具。
📅 08-27📎 arXiv AI Papers

Persona-Execution分离架构将LLM智能体的人格设定与执行逻辑解耦,并在执行审计下支持技能持续进化。该模式增强系统可解释性、可控性与安全性,为可审计的自主智能体提供新设计范式。
📅 08-27📎 arXiv AI Papers

Static scanners are increasingly used to identify executable or otherwise unsafe content in machine- learning artifacts, yet conventional evaluation metrics characterize only cases where a scanner yields a usable security judgment. We evaluate ModelScan, ModelAudit, and Fickling using a controlled,
📅 08-27📎 arXiv AI Papers

Currently used sepsis severity indices rely on fixed variables and weights established decades ago, which are coarsely discretized and calibrated to a cohort that no longer reflects contemporary critical care. No alternative learned directly from patient trajectories is in routine use. We conducted
📅 08-27📎 arXiv AI Papers

State-of-the-art action-conditioned video models are typically restricted to a single robot embodiment, preventing them from leveraging the vast corpus of heterogeneous video data that contains rich signals for learning generalizable physics. To bridge this gap, we introduce CLAP, a framework for cr
📅 08-27📎 arXiv AI Papers

本文探究语言模型如何组织与结构道德知识,通过分析内部表示揭示模型对道德概念的编码方式。研究发现模型将道德判断映射到可解释的语义空间,并依赖情境与角色信息动态调整道德推理。该工作为理解大模型的价值对齐机制提供新视角,有助于构建更可控、符合伦理的AI系统。
📅 08-27📎 arXiv AI Papers

谷歌AI推出地球智能自动化全球模型,打造行星预测引擎。该引擎整合多源地球观测数据,通过AI自动构建和优化全球气候、环境等预测模型,大幅提升模拟精度与效率,助力应对气候变化、灾害预警等全球性挑战,为科学决策提供智能支撑。
📅 08-27📎 Google AI Blog

探讨AI作为研究伙伴的协作模式,通过案例展示AI深度参与文献分析、数据挖掘与假设验证。文章强调人机协同能显著提升研究效率与创新质量,分析分工边界与协作伦理,为科研团队提供人机协作的可行路径与新视角。
📎 Antigravity Blog

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-27]

📰 科技脉搏

2026-08-27

🏢 公司追踪
文章系统分析了人工智能技术对社会各领域的潜在影响,包括就业结构、信息生态、伦理法律等层面,并探讨了负责任发展AI的路径,强调需平衡技术创新与社会福祉,推动可持续的治理框架。
📅 08-26📎 Anthropic Research

🔥 AI & 科技
AI 周报,深度分析行业趋势:Building Adaptive AI Agents…
📎 The Batch

提出VBVR-Pro套件,面向原生视觉推理任务,具备高度可扩展性与结果可验证性。通过系统化构建复杂视觉场景与推理链条,支持多粒度评估。该套件为视觉推理模型提供了标准化测试基准,有助于追踪推理能力进展并促进可解释性研究发展。
📅 08-26📎 arXiv AI Papers

提出视觉依赖感知框架,用于多模态无监督持续后训练。通过捕捉视觉模态间的依赖关系,有效缓解持续学习中的灾难性遗忘,同时无需人工标注。框架在保持模型对既有知识记忆的同时,自适应整合新视觉概念,提升多模态场景下的学习效率与鲁棒性。
📅 08-26📎 arXiv AI Papers

提出MyoMechanix框架,基于生物力学原理实现组合性技能动作的理解与指导。通过对复杂肢体动作进行结构化分解,结合肌电信号与运动学数据,实现精细技能识别和量化评估。该框架可应用于运动训练、康复医疗等领域,提供个性化动作矫正与技能提升建议。
📅 08-26📎 arXiv AI Papers

本文利用稀疏自编码器在中微子基础模型中识别可解释的潜在特征,并展示其在物理分析中的应用。该方法提升了模型透明度,为高能物理领域的可解释AI提供了新工具,有助于发现新的物理规律。
📅 08-26📎 arXiv AI Papers

本文提出行星预测引擎,通过智能数据选择与基础模型嵌入实现自主地理空间预测。系统能自动筛选相关数据源,利用预训练嵌入捕捉空间语义,显著提升预测准确性与泛化能力,适用于环境监测与灾害预警等场景。
📅 08-26📎 arXiv AI Papers

本文实证分析人类与智能体在机器学习开发中的协同规划行为。通过TraceML框架跟踪开发过程,揭示人机分工模式与决策瓶颈,为优化ML工作流中的人机协作机制提供经验依据,推动自动化机器学习系统设计。
📅 08-26📎 arXiv AI Papers

ICON分解提出了一种多变量概念级解释方法,专门用于深度学习模型审计。该方法将深度表征分解为语义明确的概念组合,从多维度揭示模型的内部决策依据,辅助识别潜在偏见与失效模式,从而显著提升深度学习系统的可解释性与可信度。
📅 08-26📎 arXiv AI Papers

SwarmWorld提出了一个由语言模型代理构成的社会模拟系统,通过stigmergy机制(即代理经由环境间接协调)驱动技术演化。代理群体在共享环境中协作修改,迭代催生复杂技术革新,为研究人工社会的涌现智能与技术进化提供了全新实验平台。
📅 08-26📎 arXiv AI Papers

该研究针对自动驾驶中的交互后决策失败问题,提出了一种在承诺执行前的门控机制。该机制通过提前预测交互方的意图分歧并据此调整决策,有效避免冲突升级,显著降低了自动驾驶系统的潜在事故风险,提升了整体决策安全性与可靠性。
📅 08-26📎 arXiv AI Papers

本文提出前缀滑动方法,用于高效提升测试时扩展性能。通过动态调整输入前缀,在推理阶段实现更优的计算分配,避免冗余生成,显著降低延迟与成本。该方法在保持模型输出质量的同时,提升了长序列任务的扩展效率,为大规模语言模型的高效部署提供了实用方案。
📅 08-26📎 arXiv AI Papers

GlucoFM是Google AI团队提出的连续血糖监测基础模型。该模型利用大规模动态血糖数据预训练,具备强大的迁移学习能力,可精准预测血糖变化、识别异常波动,并为糖尿病患者提供个性化干预建议,有望推动数字健康与精准医疗发展。
📅 08-26📎 Google AI Blog

Antigravity 推出可视化辅助功能,帮助开发者更直观地理解和呈现项目数据。通过简洁的界面设计和智能图表生成,用户无需复杂配置即可快速创建清晰的可视化视图,提升数据分析与展示效率,降低理解门槛。
📎 Antigravity Blog

💰 财经 & 投资
苹果更新Mac Mini与Mac Studio,探讨AI计算机发展趋势,并涉猎OpenAI代号”Jalapeño”的新动态。文章分析苹果硬件迭代策略、AI PC市场格局,以及OpenAI在AI领域的竞争举措,揭示科技巨头在AI时代的战略布局与应对之道。
📎 Stratechery

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-26]

📰 科技脉搏

2026-08-26

🔥 AI & 科技
针对长时程智能体在复杂任务中记忆管理困难的问题,提出递归经验-工作记忆进化机制。通过递归更新与经验整合,动态演化工作记忆内容,增强智能体对长期依赖的建模能力。实验验证该方法能有效提升多步决策任务中的表现,为构建可持续学习的智能体系统提供了新思路。
📅 08-25📎 arXiv AI Papers

提出SPO++流对齐策略优化方法,解决异步智能体强化学习中策略更新与轨迹流不一致的挑战。通过将策略优化与异步数据流对齐,减少采样延迟带来的偏差,提升学习稳定性与样本效率。在多个异步RL基准上验证了方法的有效性,为实际异步环境下的智能体训练提供了可靠方案。
📅 08-25📎 arXiv AI Papers

提出FedV-KGQA框架,面向垂直分区知识图谱的多跳问答任务。在保护各数据持有方隐私的前提下,利用联邦学习协调跨图谱推理,设计多跳注意力机制聚合分布式知识。实验表明该方法在保证隐私的同时显著提升问答准确率,为分布式知识图谱应用提供了新路径。
📅 08-25📎 arXiv AI Papers

LAION-BVD是一个包含1000万小时视频的开放数据集,专为多模态预训练构建。其规模远超现有语料库,覆盖丰富场景、语音与文本,为视频理解和生成模型提供海量训练资源。该数据集有望显著推动视频-语言基础研究,并促进多模态AI的开放与可复现发展。
📅 08-25📎 arXiv AI Papers

本文批评AI金融研究中“阅读信息”不等于“使用信息”的倾向,并探索检索、判断与工作流设计的关系。通过对金融研究实践的考察,作者提出以人机协作为核心的设计原则:AI负责高效检索与整合,人类专注判断与决策。该研究为金融AI系统提供证据驱动的设计启示,有助于提升研究质量与可解释性。
📅 08-25📎 arXiv AI Papers

大规模教育评估中,试题附带内容的相似性影响题库质量。本文提出一个双维度LLM框架,利用大语言模型从语义和结构两个维度自动分析附带内容相似性。该框架能高效处理海量试题,减少人工成本,提高判定一致性与可扩展性,为教育测评提供自动化方案。
📅 08-25📎 arXiv AI Papers

针对大语言模型知识图谱问答中知识不完整时的实体选择难题,提出一种约束条件下的实体选择方法,即便在局部知识可用时也能准确筛选候选实体,显著提升问答系统在知识缺失场景下的鲁棒性与准确性。
📅 08-25📎 arXiv AI Papers

提出一种严格因果的流式视频异常检测框架,其核心采用具有理论支撑的状态空间模型,确保检测过程仅依赖历史帧而不使用未来信息,在保持实时推理的同时实现高精度异常识别,并通过理论分析验证模型稳定性。
📅 08-25📎 arXiv AI Papers

探索利用大语言模型自动生成模型卡片的方法,从模型元数据、训练配置与评估结果中自动提炼结构化文档,降低人工撰写成本,提升模型文档的标准化程度与可复现性,为模型发布与治理提供高效工具。
📅 08-25📎 arXiv AI Papers

StarHarness提出一种面向企业环境的测试工具自动演化方法,采用分层搜索策略优化测试用例生成与执行。该方法能有效适应复杂系统约束,提升缺陷检测效率与覆盖率,减少人工构建测试装备的成本,为大规模企业级软件质量保障提供可扩展的解决方案。
📅 08-25📎 arXiv AI Papers

Google AI 推出 AgentHands,用于在扩展现实(XR)环境中为智能体对话生成自然、交互式的手势。该技术结合空间感知与语言理解,使虚拟智能体能够根据对话内容和空间上下文做出恰当手势,从而提升人机交互的沉浸感与真实感。
📅 08-25📎 Google AI Blog

DeepMind推出SIMA 2,一个可与人共同游玩、推理和学习的三维游戏AI智能体。它通过理解自然语言指令和游戏环境,执行复杂交互任务,标志着通用AI在虚拟世界中的重大进步,为未来智能体研究奠定基础。
📎 DeepMind Blog

AlphaEarth利用先进AI技术,以前所未有的精度绘制地球地图。该模型整合卫星影像与地理数据,生成高分辨率、细节丰富的地球表面信息,可应用于城市规划、环境保护等领域,为科学研究和可持续发展提供强大工具。
📎 DeepMind Blog

Google Gemini 产品更新:See all in Products & platforms…
📎 Gemini Updates

💰 财经 & 投资
文章探讨流动性提供的两条路径:算法驱动的自动化做市与依赖人工判断的”手工”模式。作者分析手工流动性提供在复杂市场中的独特价值,包括信息优势、关系资本与灵活应变能力,并比较两种方式在不同市场环境下的优劣与适用场景。
📎 The Diff

Netflix或将向第三方平台销售流媒体服务,本文探讨流媒体平台作为聚合者的商业模式变革,并重新审视Roku在电视生态中的战略价值,分析内容分发权力如何从平台转向聚合层,揭示行业竞争格局的新动向。
📎 Stratechery

由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-25]

📰 科技脉搏

2026-08-25

🏢 公司追踪
Anthropic推出旗舰模型Claude Opus 5,在推理、编码和智能体任务上实现显著突破,支持超长上下文与多模态输入。模型通过强化学习优化,在多项基准测试中刷新纪录,同时强化安全意识。现已面向API用户及Claude应用开放,为企业级复杂工作流提供更强大支持。
📅 07-24📎 Anthropic Blog

Anthropic发布Claude Sonnet 5,在性能与成本间取得更优平衡。该模型在编程、数学和知识问答方面显著超越前代,支持长上下文处理和工具调用,推理速度更快。适合开发者和企业大规模部署,以更低价格提供接近旗舰模型的智能水平。
📅 06-30📎 Anthropic Blog

🔥 AI & 科技
Ethan Mollick的AI实践洞察:An opinionated guide to which AI to use to do stuff…
📅 07-23📎 One Useful Thing

本期Import AI关注机器权利争论,强调不应赋予AI法律权利;介绍SPADE系统自动化生成训练环境,降低人工设计成本;以及Hawkeye工具,通过自动优化GPU内核提升计算效率。三方面共同反映AI技术从伦理到工程的最新进展,为研究人员
📎 Import AI

本文提出训练价值网络(Critic)的稳定性与效率优化方法,针对强化学习中Critic发散和样本效率低的问题,引入创新训练策略与正则化技术,显著提升学习稳定性,并减少训练开销,为大规模强化学习应用提供可靠方案。
📅 08-24📎 arXiv AI Papers

ReWorld提出一种具备长时记忆能力的交互式世界模型,通过存储并检索长期历史经验,增强模型对多步交互场景的预测与规划能力。实验表明,该方法在长时程决策任务中显著优于现有模型,为智能体持续学习与记忆建模提供新思路。
📅 08-24📎 arXiv AI Papers

SWE Refactor Bench构建了一个面向全仓库栈迁移的基准测试,用于评估编码智能体执行长时程重构任务的能力。基准涵盖真实代码迁移场景,要求智能体理解跨文件依赖并完成系统性修改。初步结果显示当前代理表现有限,为提升代码智能体的工程化能力指明方向。
📅 08-24📎 arXiv AI Papers

EG-ARSA构建专家引导的开放视觉道路安全审计模型,面向低资源环境优化设计。通过融合领域专家知识增强隐患识别能力,在训练数据有限的条件下保持高精度,为发展中地区提供经济可靠的道路安全管理智能化方案。
📅 08-24📎 arXiv AI Papers

研究提出物理约束深度学习模型,基于三轴体震信号实现无接触血压监测。通过将心血管物理规律嵌入神经网络,兼顾预测精度与生理可解释性,无需袖带即可持续追踪血压变化,为远程健康评估提供创新技术支撑。
📅 08-24📎 arXiv AI Papers

Prime Agent提出自改进式强化学习模型(RLM)框架,具备持续自我优化能力。系统可在动态环境中自主调整策略、迭代积累经验,有效提升决策质量与泛化性能,为构建高效可扩展的自主智能体提供基础性技术方案。
📅 08-24📎 arXiv AI Papers

ConvergeFlow提出一种语言流方法,将离散token嵌入转化为可证明收敛的连续动态过程。该方法通过设计流模型,保证迭代更新逐步逼近目标嵌入,兼具理论收敛保证与表达灵活性,为语言建模与表示学习提供新范式,并在生成任务中展现潜力。
📅 08-24📎 arXiv AI Papers

本研究通过逻辑谜题学习实验,考察AI辅助对人类技能发展的影响。结果显示,过度依赖AI即时反馈会削弱问题解决能力与学习深度,而适度辅助可促进技能迁移。研究为设计人机协同学习环境提供了实证依据,警示“认知卸载”的长期代价。
📅 08-24📎 arXiv AI Papers

本文提出“交互税”概念,揭示多智能体团队中过度沟通会削弱认知多样性。分析表明,频繁交互使个体观点趋同,导致集体决策陷入局部最优。作者提出平衡交互与独立探索的机制,为多智能体协作系统的设计提供理论指导与优化方向。
📅 08-24📎 arXiv AI Papers

本文针对恶意数据包识别中新攻击类别不断涌现且标注样本稀缺的问题,提出一种基于适配器的少样本持续学习方法。该方法冻结预训练模型,仅插入轻量级适配器更新少量参数,从而高效学习新类别并保留旧知识。实验表明,该方法能有效缓解灾难性遗忘,显著提升新类别识别准确率。
📅 08-24📎 arXiv AI Papers

Antigravity 最新更新聚焦版本控制体验,优化分支管理、提交与合并流程,引入更直观的界面和智能冲突提示,减少操作复杂度。同时增强团队协作中的实时反馈,帮助开发者快速定位问题,降低学习成本,使版本控制更高效顺手,全面提升开发工作流效率。
📎 Antigravity Blog

💰 财经 & 投资
文章探讨西方对中国AI模型的恐惧,认为其源于技术竞争与地缘政治焦虑。作者剖析中国模型在效率与应用层面的创新,指出与西方的差距在于基础研究,呼吁理性看待而非盲目担忧。本文为理解中国AI发展提供了客观视角,有助破除偏见。
📎 Stratechery

由 Hermes 自动生成 | 查看历史摘要