📰 科技脉搏 [2026-09-04]

📰 科技脉搏 2026-09-04 🔥 AI & 科技 Compile by Training: Turning Natural-Language Specifications into Local Neural Functions Many recurring text functions are easy to describe but difficult to implement with rules, while calling a large remote model for every input introduces repeated cost, latency, and dependency on a provider. We present compile by training, which… Continue reading “📰 科技脉搏 [2026-09-04]”

📰 科技脉搏 [2026-09-03]

📰 科技脉搏 2026-09-03 🔥 AI & 科技 Discriminative World Models for Web Agents Recent web agents use world models for test-time action selection by sampling candidate actions, predicting the resulting web states, and ranking them with a ranker model or a Process Reward Model (PRM). These world models are typically trained via supervised next-state prediction… Continue reading “📰 科技脉搏 [2026-09-03]”

📰 科技脉搏 [2026-09-02]

📰 科技脉搏 2026-09-02 🏢 公司追踪 Developing Enterprise Frontier Safeguards with our customers Anthropic携手企业客户共同研发前沿AI安全防护机制,聚焦将可信措施嵌入大模型部署全流程。文章阐述了协同构建防护体系、平衡技术创新与风险管控的经验,助力企业在真实业务场景中安全落地前沿人工智能。 📅 09-01📎 Anthropic Blog 🔥 AI & 科技 Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation 提出轨迹感知的评估方法,用于高效基准测试SWE智能体。通过分析代理的决策轨迹,减少冗余运行并精准定位失败原因,显著提升评估效率与诊断能力,为软件工程智能体性能评估提供新思路。 📅 09-01📎 arXiv AI Papers Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation 提出自适应关键标记感知检索策略,用于仓库级代码生成。通过动态识别与生成目标最相关的代码标记,优化检索范围与信息权重,提升长代码上下文中的生成准确性与效率,缓解无关信息干扰问题。 📅 09-01📎 arXiv AI Papers CordisBench: Can Language Models Reason About Component… Continue reading “📰 科技脉搏 [2026-09-02]”

📰 科技脉搏 [2026-09-01]

📰 科技脉搏 2026-09-01 🏢 公司追踪 Teaching Claude why 本文探讨如何通过教导Claude理解事物背后的“为什么”来提升其推理能力。研究提出新的训练方法,使模型不仅学习表面模式,还能掌握深层因果逻辑,从而更可靠地处理复杂任务,减少错误推断,增强可解释性与泛化性能。 📅 05-08📎 Anthropic Research 🔥 AI & 科技 Import AI 471: Why Hugging Face worries me; space mining; FIve Eyes on AI Import AI 471期探讨Hugging Face作为AI模型分发中心引发的行业集中化担忧,分析太空采矿中AI自主导航与资源勘测的应用前景,并梳理五眼联盟在AI安全治理方面的最新协调立场,为读者提供产业发展的多维观察视角。 📎 Import AI SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies 提出SUN框架,实现语言引导的控制到学习再到真实环境的持久化程序策略,提升跨场景适应性与可迁移性,为机器人操作提供统一解决方案。 📅 08-31📎 arXiv AI Papers Auditing Anonymous AI Models:… Continue reading “📰 科技脉搏 [2026-09-01]”

📰 科技脉搏 [2026-08-31]

📰 科技脉搏 2026-08-31 🏢 公司追踪 Our decision on Cursor following its acquisition by SpaceX OpenAI宣布,在Cursor被SpaceX收购后,将重新评估双方合作关系。决定继续为Cursor提供技术授权,但明确其独立运营边界,确保AI安全标准不受商业并购影响。此举既维护开发者生态,也体现对前沿AI工具负责任治理的承诺。 📅 08-28📎 OpenAI Blog Supporting Thailand’s next generation of AI startups 为培育东南亚科技生态,OpenAI启动泰国AI初创企业扶持计划,通过提供模型访问权限、技术指导及云资源,帮助本地团队开发解决医疗、农业等实际问题的解决方案。该计划旨在降低AI应用门槛,赋能新一代创业者,推动泰国数字经济发展。 📅 08-28📎 OpenAI Blog A new class of intelligence for real work 文章介绍了一类新型智能范式,旨在将AI能力落地于真实工作场景。不同于传统模型仅处理简单任务,该研究强调在复杂、动态环境中进行规划、决策与协作,使系统能适应实际需求。其价值在于推动人工智能从实验室走向产业实践,提升生产力与自动化水平。 📅 04-23📎 OpenAI Research 🔥 AI & 科技 From the Hugging Face Incident to Twilight… Continue reading “📰 科技脉搏 [2026-08-31]”

📰 科技脉搏 [2026-08-29]

📰 科技脉搏 2026-08-29 🏢 公司追踪 Automated researchers can reliably mitigate alignment failures 研究展示自动化研究者系统能够持续识别并修正AI对齐失败问题。通过系统化测试与迭代优化,该方法在多个场景中有效降低系统性风险,为AI安全治理提供可扩展的自动化解决方案。 📅 08-28📎 Anthropic Research 🔥 AI & 科技 Andrew's Letter Andrew Ng聚焦AI智能体从研究走向生产的现实挑战,强调评估体系、用户反馈与安全防护对落地的重要性。他呼吁开发者关注模型在真实场景中的稳定性与局限性,并指出持续迭代和负责任的部署策略是推动AI价值实现的关键。 📎 The Batch Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里? 中文AI媒体:Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里?… 📎 机器之心 由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-28]

📰 科技脉搏 2026-08-28 🔥 AI & 科技 From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench MCR-Bench基准推动代码审查从静态评估转向动态真实场景。模拟实际开发中的多轮审查交互,覆盖缺陷检测、建议生成等关键任务,更全面地评估模型审查能力,为代码审查智能化研究提供新标准。 📅 08-27📎 arXiv AI Papers WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution WikiSkill框架将智能体执行任务的经验编译为持久化知识库,实现技能持续进化。通过结构化存储与检索机制使智能体在新任务中复用历史经验,显著提升学习效率与任务表现,为构建可积累知识的自主智能体提供新范式。 📅 08-27📎 arXiv AI Papers SWE-Prime: Fewer Trajectories, Better Performance SWE-Prime方法以更少的训练轨迹实现更优性能。通过精选高质量示范轨迹与高效策略优化,在减少数据需求的同时提升代码生成与修复能力,为数据受限场景下的软件工程模型训练提供实用方案。 📅 08-27📎 arXiv AI Papers RedEvoAgent: Automatic Red-Teaming Agent with… Continue reading “📰 科技脉搏 [2026-08-28]”

📰 科技脉搏 [2026-08-27]

📰 科技脉搏 2026-08-27 🏢 公司追踪 Societal Impacts 文章系统分析了人工智能技术对社会各领域的潜在影响,包括就业结构、信息生态、伦理法律等层面,并探讨了负责任发展AI的路径,强调需平衡技术创新与社会福祉,推动可持续的治理框架。 📅 08-26📎 Anthropic Research 🔥 AI & 科技 Building Adaptive AI Agents AI 周报,深度分析行业趋势:Building Adaptive AI Agents… 📎 The Batch VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 提出VBVR-Pro套件,面向原生视觉推理任务,具备高度可扩展性与结果可验证性。通过系统化构建复杂视觉场景与推理链条,支持多粒度评估。该套件为视觉推理模型提供了标准化测试基准,有助于追踪推理能力进展并促进可解释性研究发展。 📅 08-26📎 arXiv AI Papers A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training 提出视觉依赖感知框架,用于多模态无监督持续后训练。通过捕捉视觉模态间的依赖关系,有效缓解持续学习中的灾难性遗忘,同时无需人工标注。框架在保持模型对既有知识记忆的同时,自适应整合新视觉概念,提升多模态场景下的学习效率与鲁棒性。 📅… Continue reading “📰 科技脉搏 [2026-08-27]”

📰 科技脉搏 [2026-08-26]

📰 科技脉搏 2026-08-26 🔥 AI & 科技 Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 针对长时程智能体在复杂任务中记忆管理困难的问题,提出递归经验-工作记忆进化机制。通过递归更新与经验整合,动态演化工作记忆内容,增强智能体对长期依赖的建模能力。实验验证该方法能有效提升多步决策任务中的表现,为构建可持续学习的智能体系统提供了新思路。 📅 08-25📎 arXiv AI Papers SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL 提出SPO++流对齐策略优化方法,解决异步智能体强化学习中策略更新与轨迹流不一致的挑战。通过将策略优化与异步数据流对齐,减少采样延迟带来的偏差,提升学习稳定性与样本效率。在多个异步RL基准上验证了方法的有效性,为实际异步环境下的智能体训练提供了可靠方案。 📅 08-25📎 arXiv AI Papers FedV-KGQA: Multi-Hop Question Answering over Vertically Partitioned Knowledge Graphs 提出FedV-KGQA框架,面向垂直分区知识图谱的多跳问答任务。在保护各数据持有方隐私的前提下,利用联邦学习协调跨图谱推理,设计多跳注意力机制聚合分布式知识。实验表明该方法在保证隐私的同时显著提升问答准确率,为分布式知识图谱应用提供了新路径。 📅 08-25📎 arXiv AI Papers LAION-BVD: A 10-Million-Hour Open Video… Continue reading “📰 科技脉搏 [2026-08-26]”

📰 科技脉搏 [2026-08-25]

📰 科技脉搏 2026-08-25 🏢 公司追踪 Introducing Claude Opus 5 Anthropic推出旗舰模型Claude Opus 5,在推理、编码和智能体任务上实现显著突破,支持超长上下文与多模态输入。模型通过强化学习优化,在多项基准测试中刷新纪录,同时强化安全意识。现已面向API用户及Claude应用开放,为企业级复杂工作流提供更强大支持。 📅 07-24📎 Anthropic Blog Introducing Claude Sonnet 5 Anthropic发布Claude Sonnet 5,在性能与成本间取得更优平衡。该模型在编程、数学和知识问答方面显著超越前代,支持长上下文处理和工具调用,推理速度更快。适合开发者和企业大规模部署,以更低价格提供接近旗舰模型的智能水平。 📅 06-30📎 Anthropic Blog 🔥 AI & 科技 An opinionated guide to which AI to use to do stuff Ethan Mollick的AI实践洞察:An opinionated guide to which AI to use to do stuff… 📅… Continue reading “📰 科技脉搏 [2026-08-25]”