📰 科技脉搏 [2026-08-31]

📰 科技脉搏 2026-08-31 🏢 公司追踪 Our decision on Cursor following its acquisition by SpaceX OpenAI宣布,在Cursor被SpaceX收购后,将重新评估双方合作关系。决定继续为Cursor提供技术授权,但明确其独立运营边界,确保AI安全标准不受商业并购影响。此举既维护开发者生态,也体现对前沿AI工具负责任治理的承诺。 📅 08-28📎 OpenAI Blog Supporting Thailand’s next generation of AI startups 为培育东南亚科技生态,OpenAI启动泰国AI初创企业扶持计划,通过提供模型访问权限、技术指导及云资源,帮助本地团队开发解决医疗、农业等实际问题的解决方案。该计划旨在降低AI应用门槛,赋能新一代创业者,推动泰国数字经济发展。 📅 08-28📎 OpenAI Blog A new class of intelligence for real work 文章介绍了一类新型智能范式,旨在将AI能力落地于真实工作场景。不同于传统模型仅处理简单任务,该研究强调在复杂、动态环境中进行规划、决策与协作,使系统能适应实际需求。其价值在于推动人工智能从实验室走向产业实践,提升生产力与自动化水平。 📅 04-23📎 OpenAI Research 🔥 AI & 科技 From the Hugging Face Incident to Twilight… Continue reading “📰 科技脉搏 [2026-08-31]”

📰 科技脉搏 [2026-08-29]

📰 科技脉搏 2026-08-29 🏢 公司追踪 Automated researchers can reliably mitigate alignment failures 研究展示自动化研究者系统能够持续识别并修正AI对齐失败问题。通过系统化测试与迭代优化,该方法在多个场景中有效降低系统性风险,为AI安全治理提供可扩展的自动化解决方案。 📅 08-28📎 Anthropic Research 🔥 AI & 科技 Andrew's Letter Andrew Ng聚焦AI智能体从研究走向生产的现实挑战,强调评估体系、用户反馈与安全防护对落地的重要性。他呼吁开发者关注模型在真实场景中的稳定性与局限性,并指出持续迭代和负责任的部署策略是推动AI价值实现的关键。 📎 The Batch Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里? 中文AI媒体:Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里?… 📎 机器之心 由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-28]

📰 科技脉搏 2026-08-28 🔥 AI & 科技 From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench MCR-Bench基准推动代码审查从静态评估转向动态真实场景。模拟实际开发中的多轮审查交互,覆盖缺陷检测、建议生成等关键任务,更全面地评估模型审查能力,为代码审查智能化研究提供新标准。 📅 08-27📎 arXiv AI Papers WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution WikiSkill框架将智能体执行任务的经验编译为持久化知识库,实现技能持续进化。通过结构化存储与检索机制使智能体在新任务中复用历史经验,显著提升学习效率与任务表现,为构建可积累知识的自主智能体提供新范式。 📅 08-27📎 arXiv AI Papers SWE-Prime: Fewer Trajectories, Better Performance SWE-Prime方法以更少的训练轨迹实现更优性能。通过精选高质量示范轨迹与高效策略优化,在减少数据需求的同时提升代码生成与修复能力,为数据受限场景下的软件工程模型训练提供实用方案。 📅 08-27📎 arXiv AI Papers RedEvoAgent: Automatic Red-Teaming Agent with… Continue reading “📰 科技脉搏 [2026-08-28]”

📰 科技脉搏 [2026-08-27]

📰 科技脉搏 2026-08-27 🏢 公司追踪 Societal Impacts 文章系统分析了人工智能技术对社会各领域的潜在影响,包括就业结构、信息生态、伦理法律等层面,并探讨了负责任发展AI的路径,强调需平衡技术创新与社会福祉,推动可持续的治理框架。 📅 08-26📎 Anthropic Research 🔥 AI & 科技 Building Adaptive AI Agents AI 周报,深度分析行业趋势:Building Adaptive AI Agents… 📎 The Batch VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 提出VBVR-Pro套件,面向原生视觉推理任务,具备高度可扩展性与结果可验证性。通过系统化构建复杂视觉场景与推理链条,支持多粒度评估。该套件为视觉推理模型提供了标准化测试基准,有助于追踪推理能力进展并促进可解释性研究发展。 📅 08-26📎 arXiv AI Papers A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training 提出视觉依赖感知框架,用于多模态无监督持续后训练。通过捕捉视觉模态间的依赖关系,有效缓解持续学习中的灾难性遗忘,同时无需人工标注。框架在保持模型对既有知识记忆的同时,自适应整合新视觉概念,提升多模态场景下的学习效率与鲁棒性。 📅… Continue reading “📰 科技脉搏 [2026-08-27]”

📰 科技脉搏 [2026-08-26]

📰 科技脉搏 2026-08-26 🔥 AI & 科技 Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 针对长时程智能体在复杂任务中记忆管理困难的问题,提出递归经验-工作记忆进化机制。通过递归更新与经验整合,动态演化工作记忆内容,增强智能体对长期依赖的建模能力。实验验证该方法能有效提升多步决策任务中的表现,为构建可持续学习的智能体系统提供了新思路。 📅 08-25📎 arXiv AI Papers SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL 提出SPO++流对齐策略优化方法,解决异步智能体强化学习中策略更新与轨迹流不一致的挑战。通过将策略优化与异步数据流对齐,减少采样延迟带来的偏差,提升学习稳定性与样本效率。在多个异步RL基准上验证了方法的有效性,为实际异步环境下的智能体训练提供了可靠方案。 📅 08-25📎 arXiv AI Papers FedV-KGQA: Multi-Hop Question Answering over Vertically Partitioned Knowledge Graphs 提出FedV-KGQA框架,面向垂直分区知识图谱的多跳问答任务。在保护各数据持有方隐私的前提下,利用联邦学习协调跨图谱推理,设计多跳注意力机制聚合分布式知识。实验表明该方法在保证隐私的同时显著提升问答准确率,为分布式知识图谱应用提供了新路径。 📅 08-25📎 arXiv AI Papers LAION-BVD: A 10-Million-Hour Open Video… Continue reading “📰 科技脉搏 [2026-08-26]”

📰 科技脉搏 [2026-08-25]

📰 科技脉搏 2026-08-25 🏢 公司追踪 Introducing Claude Opus 5 Anthropic推出旗舰模型Claude Opus 5,在推理、编码和智能体任务上实现显著突破,支持超长上下文与多模态输入。模型通过强化学习优化,在多项基准测试中刷新纪录,同时强化安全意识。现已面向API用户及Claude应用开放,为企业级复杂工作流提供更强大支持。 📅 07-24📎 Anthropic Blog Introducing Claude Sonnet 5 Anthropic发布Claude Sonnet 5,在性能与成本间取得更优平衡。该模型在编程、数学和知识问答方面显著超越前代,支持长上下文处理和工具调用,推理速度更快。适合开发者和企业大规模部署,以更低价格提供接近旗舰模型的智能水平。 📅 06-30📎 Anthropic Blog 🔥 AI & 科技 An opinionated guide to which AI to use to do stuff Ethan Mollick的AI实践洞察:An opinionated guide to which AI to use to do stuff… 📅… Continue reading “📰 科技脉搏 [2026-08-25]”

📰 科技脉搏 [2026-08-24]

📰 科技脉搏 2026-08-24 🔥 AI & 科技 Primal Acceleration of Newton’s Method 针对牛顿法收敛速度受限于条件数的问题,本文提出一种原始加速策略,通过结合动量项与自适应步长,在不显著增加单步计算成本的前提下提升收敛阶数。理论分析证明该方法在强凸和非凸情形下均具有更优的复杂度界,数值实验验证了其在高维优化问题中的实际加速效果,为大规模机器学习训练提供了高效求解方案。 📅 08-21📎 arXiv AI Papers VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences VIALS基准数据集旨在评估AI系统对生命科学图像中视觉伪影的解释能力,涵盖显微成像、电泳凝胶、组织切片等多种模态的常见伪影类型,并附带专家标注的成因说明。该基准填补了该领域缺乏标准化评估的空白,支持了伪影检测、归因分析及可解释性研究,可推动计算病理学等应用中模型鲁棒性与可信度的提升。 📅 08-21📎 arXiv AI Papers 由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-22]

📰 科技脉搏 2026-08-22 🔥 AI & 科技 当 AI 开始造 AI,「强 RSI」还有多远? 人工智能已开始设计甚至生成新模型,引发对强递归自我改进(强RSI)的探讨。文章分析现状与瓶颈:自动化机器学习虽在特定领域超越人类,但真正的通用自我改进仍面临算法、算力、数据与安全对齐等挑战,距离遥远。 📎 机器之心 An AI tool for prioritizing candidate biomarkers from wearable sensor data 谷歌研究团队开发出一款AI工具,可从可穿戴设备传感器数据中优先筛选候选生物标志物。该工具能高效处理海量生理信号,帮助研究人员快速锁定最具价值的健康指标,为疾病早期检测和个性化医疗提供有力支持,显著提升健康数据分析效率。 📅 08-21📎 Google AI Blog How mobility gives language models a deeper understanding of place 该研究探讨如何将移动性数据融入语言模型,使其对地理位置形成更深入的理解。通过分析人群移动模式与空间交互关系,模型能够掌握地点的动态特征和功能属性,从而增强对地理空间的语义认知,为位置推荐、城市规划等应用提供更智能的解决方案。 📅 08-21📎 Google AI Blog Antigravity Anywhere with Remote Control 本文介绍Antigravity远程控制功能,用户可随时随地通过移动设备操控桌面应用,实现跨空间无缝协作。该功能显著提升工作灵活性与响应速度,尤其适合多任务处理及远程办公场景,让高效计算体验不再受物理距离限制。 📎… Continue reading “📰 科技脉搏 [2026-08-22]”

📰 科技脉搏 [2026-08-21]

📰 科技脉搏 2026-08-21 🔥 AI & 科技 G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation 面向患者导向的医学报告解读,提出G-CARL方法,将报告生成与既定检查表对齐,并结合奖励学习优化模型,以确保解读内容准确、全面且通俗易懂。实验证明该方法显著提升报告质量与患者体验,为医学AI提供可解释、可信赖的实用方案。 📅 08-20📎 arXiv AI Papers An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction 提出一种智能体驱动的主动数据收集与出行行为建模方法,并用于天气敏感需求预测。智能体自主决策采集关键数据,构建精细的行为模型,有效捕捉天气变化对交通需求的影响。实验验证其在预测精度和数据效率上的优势,为智能交通动态管控提供新思路。 📅 08-20📎 arXiv AI Papers Inducing Task Models from Computer-Use Traces 提出从计算机操作痕迹中自动归纳任务模型的新方法。通过分析用户操作序列,识别子任务结构、执行目标与流程顺序,生成可复用的任务模型。该方法无需人工标注,可适配多样化操作场景,大幅降低任务建模成本,为智能助手与自动化流程设计提供有力支撑。 📅 08-20📎 arXiv AI Papers… Continue reading “📰 科技脉搏 [2026-08-21]”

📰 科技脉搏 [2026-08-19]

📰 科技脉搏 2026-08-19 🏢 公司追踪 How Claude is accelerating protein design and analytical chemistry 本文介绍Claude在蛋白质设计与分析化学中的突破应用。借助强大推理能力,Claude辅助科研人员预测蛋白质结构、设计新型分子,并高效处理化学实验数据,大幅缩短研究周期,展现AI加速科学发现与实验室自动化的广阔前景。 📅 08-18📎 Anthropic Research ChatGPT Ads expands across Europe OpenAI宣布ChatGPT广告业务扩展至欧洲,广告主可在多个欧洲国家投放原生广告,触达海量用户。此举加速商业化布局,为企业提供对话式AI广告新渠道,助力精准营销,同时需应对欧盟严格的数字广告监管。 📅 08-18📎 OpenAI Blog Partnering with CodeAI to prepare the first AI generation OpenAI与CodeAI达成战略合作,共同培养首批AI原生代。通过将AI编程工具融入教育,提升学生编程能力与AI素养,为未来AI时代储备人才。合作旨在推动AI教育普及,弥合数字鸿沟,帮助年轻一代掌握与AI协作的核心技能。 📅 08-18📎 OpenAI Blog More intelligence from every token for your hardest work OpenAI发布o3与o4-mini推理模型,突破”测试时计算”范式,让每个token蕴含更强推理能力。模型可自主思考、规划并融合多路径探索,在ARC、AIME及编程等基准上刷新纪录,显著提高复杂任务处理效率,为最严峻工程挑战提供智能加持。 📅 07-09📎… Continue reading “📰 科技脉搏 [2026-08-19]”