📰 科技脉搏 [2026-09-05]

📰 科技脉搏 2026-09-05 🏢 公司追踪 Formalizing Fermat’s Last Theorem 本文介绍了将费马大定理进行形式化证明的研究。Anthropic研究人员利用AI辅助,将这一经典数学难题转换为机器可验证的严格逻辑表述,展示了AI在数学推理中的潜力,为形式化数学和自动化证明发展提供了关键案例。 📅 09-04📎 Anthropic Research 🔥 AI & 科技 验证器是 RLVR 的隐形天花板,还是下一个能力突破口? 中文AI媒体:验证器是 RLVR 的隐形天花板,还是下一个能力突破口?… 📎 机器之心 从 VLA 到 WBI,具身智能的大脑在如何改变? 中文AI媒体:从 VLA 到 WBI,具身智能的大脑在如何改变?… 📎 机器之心 💰 财经 & 投资 An Interview with OpenAI President Greg Brockman About Astra and Alignment Ben Thompson 科技战略分析:An Interview… Continue reading “📰 科技脉搏 [2026-09-05]”

📰 科技脉搏 [2026-09-04]

📰 科技脉搏 2026-09-04 🔥 AI & 科技 Compile by Training: Turning Natural-Language Specifications into Local Neural Functions Many recurring text functions are easy to describe but difficult to implement with rules, while calling a large remote model for every input introduces repeated cost, latency, and dependency on a provider. We present compile by training, which… Continue reading “📰 科技脉搏 [2026-09-04]”

📰 科技脉搏 [2026-09-03]

📰 科技脉搏 2026-09-03 🔥 AI & 科技 Discriminative World Models for Web Agents Recent web agents use world models for test-time action selection by sampling candidate actions, predicting the resulting web states, and ranking them with a ranker model or a Process Reward Model (PRM). These world models are typically trained via supervised next-state prediction… Continue reading “📰 科技脉搏 [2026-09-03]”

📰 科技脉搏 [2026-09-02]

📰 科技脉搏 2026-09-02 🏢 公司追踪 Developing Enterprise Frontier Safeguards with our customers Anthropic携手企业客户共同研发前沿AI安全防护机制,聚焦将可信措施嵌入大模型部署全流程。文章阐述了协同构建防护体系、平衡技术创新与风险管控的经验,助力企业在真实业务场景中安全落地前沿人工智能。 📅 09-01📎 Anthropic Blog 🔥 AI & 科技 Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation 提出轨迹感知的评估方法,用于高效基准测试SWE智能体。通过分析代理的决策轨迹,减少冗余运行并精准定位失败原因,显著提升评估效率与诊断能力,为软件工程智能体性能评估提供新思路。 📅 09-01📎 arXiv AI Papers Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation 提出自适应关键标记感知检索策略,用于仓库级代码生成。通过动态识别与生成目标最相关的代码标记,优化检索范围与信息权重,提升长代码上下文中的生成准确性与效率,缓解无关信息干扰问题。 📅 09-01📎 arXiv AI Papers CordisBench: Can Language Models Reason About Component… Continue reading “📰 科技脉搏 [2026-09-02]”

📰 科技脉搏 [2026-09-01]

📰 科技脉搏 2026-09-01 🏢 公司追踪 Teaching Claude why 本文探讨如何通过教导Claude理解事物背后的“为什么”来提升其推理能力。研究提出新的训练方法,使模型不仅学习表面模式,还能掌握深层因果逻辑,从而更可靠地处理复杂任务,减少错误推断,增强可解释性与泛化性能。 📅 05-08📎 Anthropic Research 🔥 AI & 科技 Import AI 471: Why Hugging Face worries me; space mining; FIve Eyes on AI Import AI 471期探讨Hugging Face作为AI模型分发中心引发的行业集中化担忧,分析太空采矿中AI自主导航与资源勘测的应用前景,并梳理五眼联盟在AI安全治理方面的最新协调立场,为读者提供产业发展的多维观察视角。 📎 Import AI SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies 提出SUN框架,实现语言引导的控制到学习再到真实环境的持久化程序策略,提升跨场景适应性与可迁移性,为机器人操作提供统一解决方案。 📅 08-31📎 arXiv AI Papers Auditing Anonymous AI Models:… Continue reading “📰 科技脉搏 [2026-09-01]”

📰 科技脉搏 [2026-08-27]

📰 科技脉搏 2026-08-27 🏢 公司追踪 Societal Impacts 文章系统分析了人工智能技术对社会各领域的潜在影响,包括就业结构、信息生态、伦理法律等层面,并探讨了负责任发展AI的路径,强调需平衡技术创新与社会福祉,推动可持续的治理框架。 📅 08-26📎 Anthropic Research 🔥 AI & 科技 Building Adaptive AI Agents AI 周报,深度分析行业趋势:Building Adaptive AI Agents… 📎 The Batch VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 提出VBVR-Pro套件,面向原生视觉推理任务,具备高度可扩展性与结果可验证性。通过系统化构建复杂视觉场景与推理链条,支持多粒度评估。该套件为视觉推理模型提供了标准化测试基准,有助于追踪推理能力进展并促进可解释性研究发展。 📅 08-26📎 arXiv AI Papers A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training 提出视觉依赖感知框架,用于多模态无监督持续后训练。通过捕捉视觉模态间的依赖关系,有效缓解持续学习中的灾难性遗忘,同时无需人工标注。框架在保持模型对既有知识记忆的同时,自适应整合新视觉概念,提升多模态场景下的学习效率与鲁棒性。 📅… Continue reading “📰 科技脉搏 [2026-08-27]”

📰 科技脉搏 [2026-08-26]

📰 科技脉搏 2026-08-26 🔥 AI & 科技 Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 针对长时程智能体在复杂任务中记忆管理困难的问题,提出递归经验-工作记忆进化机制。通过递归更新与经验整合,动态演化工作记忆内容,增强智能体对长期依赖的建模能力。实验验证该方法能有效提升多步决策任务中的表现,为构建可持续学习的智能体系统提供了新思路。 📅 08-25📎 arXiv AI Papers SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL 提出SPO++流对齐策略优化方法,解决异步智能体强化学习中策略更新与轨迹流不一致的挑战。通过将策略优化与异步数据流对齐,减少采样延迟带来的偏差,提升学习稳定性与样本效率。在多个异步RL基准上验证了方法的有效性,为实际异步环境下的智能体训练提供了可靠方案。 📅 08-25📎 arXiv AI Papers FedV-KGQA: Multi-Hop Question Answering over Vertically Partitioned Knowledge Graphs 提出FedV-KGQA框架,面向垂直分区知识图谱的多跳问答任务。在保护各数据持有方隐私的前提下,利用联邦学习协调跨图谱推理,设计多跳注意力机制聚合分布式知识。实验表明该方法在保证隐私的同时显著提升问答准确率,为分布式知识图谱应用提供了新路径。 📅 08-25📎 arXiv AI Papers LAION-BVD: A 10-Million-Hour Open Video… Continue reading “📰 科技脉搏 [2026-08-26]”

📰 科技脉搏 [2026-08-25]

📰 科技脉搏 2026-08-25 🏢 公司追踪 Introducing Claude Opus 5 Anthropic推出旗舰模型Claude Opus 5,在推理、编码和智能体任务上实现显著突破,支持超长上下文与多模态输入。模型通过强化学习优化,在多项基准测试中刷新纪录,同时强化安全意识。现已面向API用户及Claude应用开放,为企业级复杂工作流提供更强大支持。 📅 07-24📎 Anthropic Blog Introducing Claude Sonnet 5 Anthropic发布Claude Sonnet 5,在性能与成本间取得更优平衡。该模型在编程、数学和知识问答方面显著超越前代,支持长上下文处理和工具调用,推理速度更快。适合开发者和企业大规模部署,以更低价格提供接近旗舰模型的智能水平。 📅 06-30📎 Anthropic Blog 🔥 AI & 科技 An opinionated guide to which AI to use to do stuff Ethan Mollick的AI实践洞察:An opinionated guide to which AI to use to do stuff… 📅… Continue reading “📰 科技脉搏 [2026-08-25]”

📰 科技脉搏 [2026-08-22]

📰 科技脉搏 2026-08-22 🔥 AI & 科技 当 AI 开始造 AI,「强 RSI」还有多远? 人工智能已开始设计甚至生成新模型,引发对强递归自我改进(强RSI)的探讨。文章分析现状与瓶颈:自动化机器学习虽在特定领域超越人类,但真正的通用自我改进仍面临算法、算力、数据与安全对齐等挑战,距离遥远。 📎 机器之心 An AI tool for prioritizing candidate biomarkers from wearable sensor data 谷歌研究团队开发出一款AI工具,可从可穿戴设备传感器数据中优先筛选候选生物标志物。该工具能高效处理海量生理信号,帮助研究人员快速锁定最具价值的健康指标,为疾病早期检测和个性化医疗提供有力支持,显著提升健康数据分析效率。 📅 08-21📎 Google AI Blog How mobility gives language models a deeper understanding of place 该研究探讨如何将移动性数据融入语言模型,使其对地理位置形成更深入的理解。通过分析人群移动模式与空间交互关系,模型能够掌握地点的动态特征和功能属性,从而增强对地理空间的语义认知,为位置推荐、城市规划等应用提供更智能的解决方案。 📅 08-21📎 Google AI Blog Antigravity Anywhere with Remote Control 本文介绍Antigravity远程控制功能,用户可随时随地通过移动设备操控桌面应用,实现跨空间无缝协作。该功能显著提升工作灵活性与响应速度,尤其适合多任务处理及远程办公场景,让高效计算体验不再受物理距离限制。 📎… Continue reading “📰 科技脉搏 [2026-08-22]”

📰 科技脉搏 [2026-08-21]

📰 科技脉搏 2026-08-21 🔥 AI & 科技 G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation 面向患者导向的医学报告解读,提出G-CARL方法,将报告生成与既定检查表对齐,并结合奖励学习优化模型,以确保解读内容准确、全面且通俗易懂。实验证明该方法显著提升报告质量与患者体验,为医学AI提供可解释、可信赖的实用方案。 📅 08-20📎 arXiv AI Papers An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction 提出一种智能体驱动的主动数据收集与出行行为建模方法,并用于天气敏感需求预测。智能体自主决策采集关键数据,构建精细的行为模型,有效捕捉天气变化对交通需求的影响。实验验证其在预测精度和数据效率上的优势,为智能交通动态管控提供新思路。 📅 08-20📎 arXiv AI Papers Inducing Task Models from Computer-Use Traces 提出从计算机操作痕迹中自动归纳任务模型的新方法。通过分析用户操作序列,识别子任务结构、执行目标与流程顺序,生成可复用的任务模型。该方法无需人工标注,可适配多样化操作场景,大幅降低任务建模成本,为智能助手与自动化流程设计提供有力支撑。 📅 08-20📎 arXiv AI Papers… Continue reading “📰 科技脉搏 [2026-08-21]”