📰 科技脉搏 [2026-09-05]

📰 科技脉搏 2026-09-05 🏢 公司追踪 Formalizing Fermat’s Last Theorem 本文介绍了将费马大定理进行形式化证明的研究。Anthropic研究人员利用AI辅助,将这一经典数学难题转换为机器可验证的严格逻辑表述,展示了AI在数学推理中的潜力,为形式化数学和自动化证明发展提供了关键案例。 📅 09-04📎 Anthropic Research 🔥 AI & 科技 验证器是 RLVR 的隐形天花板,还是下一个能力突破口? 中文AI媒体:验证器是 RLVR 的隐形天花板,还是下一个能力突破口?… 📎 机器之心 从 VLA 到 WBI,具身智能的大脑在如何改变? 中文AI媒体:从 VLA 到 WBI,具身智能的大脑在如何改变?… 📎 机器之心 💰 财经 & 投资 An Interview with OpenAI President Greg Brockman About Astra and Alignment Ben Thompson 科技战略分析:An Interview… Continue reading “📰 科技脉搏 [2026-09-05]”

📰 科技脉搏 [2026-09-02]

📰 科技脉搏 2026-09-02 🏢 公司追踪 Developing Enterprise Frontier Safeguards with our customers Anthropic携手企业客户共同研发前沿AI安全防护机制,聚焦将可信措施嵌入大模型部署全流程。文章阐述了协同构建防护体系、平衡技术创新与风险管控的经验,助力企业在真实业务场景中安全落地前沿人工智能。 📅 09-01📎 Anthropic Blog 🔥 AI & 科技 Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation 提出轨迹感知的评估方法,用于高效基准测试SWE智能体。通过分析代理的决策轨迹,减少冗余运行并精准定位失败原因,显著提升评估效率与诊断能力,为软件工程智能体性能评估提供新思路。 📅 09-01📎 arXiv AI Papers Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation 提出自适应关键标记感知检索策略,用于仓库级代码生成。通过动态识别与生成目标最相关的代码标记,优化检索范围与信息权重,提升长代码上下文中的生成准确性与效率,缓解无关信息干扰问题。 📅 09-01📎 arXiv AI Papers CordisBench: Can Language Models Reason About Component… Continue reading “📰 科技脉搏 [2026-09-02]”

📰 科技脉搏 [2026-09-01]

📰 科技脉搏 2026-09-01 🏢 公司追踪 Teaching Claude why 本文探讨如何通过教导Claude理解事物背后的“为什么”来提升其推理能力。研究提出新的训练方法,使模型不仅学习表面模式,还能掌握深层因果逻辑,从而更可靠地处理复杂任务,减少错误推断,增强可解释性与泛化性能。 📅 05-08📎 Anthropic Research 🔥 AI & 科技 Import AI 471: Why Hugging Face worries me; space mining; FIve Eyes on AI Import AI 471期探讨Hugging Face作为AI模型分发中心引发的行业集中化担忧,分析太空采矿中AI自主导航与资源勘测的应用前景,并梳理五眼联盟在AI安全治理方面的最新协调立场,为读者提供产业发展的多维观察视角。 📎 Import AI SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies 提出SUN框架,实现语言引导的控制到学习再到真实环境的持久化程序策略,提升跨场景适应性与可迁移性,为机器人操作提供统一解决方案。 📅 08-31📎 arXiv AI Papers Auditing Anonymous AI Models:… Continue reading “📰 科技脉搏 [2026-09-01]”

📰 科技脉搏 [2026-08-31]

📰 科技脉搏 2026-08-31 🏢 公司追踪 Our decision on Cursor following its acquisition by SpaceX OpenAI宣布,在Cursor被SpaceX收购后,将重新评估双方合作关系。决定继续为Cursor提供技术授权,但明确其独立运营边界,确保AI安全标准不受商业并购影响。此举既维护开发者生态,也体现对前沿AI工具负责任治理的承诺。 📅 08-28📎 OpenAI Blog Supporting Thailand’s next generation of AI startups 为培育东南亚科技生态,OpenAI启动泰国AI初创企业扶持计划,通过提供模型访问权限、技术指导及云资源,帮助本地团队开发解决医疗、农业等实际问题的解决方案。该计划旨在降低AI应用门槛,赋能新一代创业者,推动泰国数字经济发展。 📅 08-28📎 OpenAI Blog A new class of intelligence for real work 文章介绍了一类新型智能范式,旨在将AI能力落地于真实工作场景。不同于传统模型仅处理简单任务,该研究强调在复杂、动态环境中进行规划、决策与协作,使系统能适应实际需求。其价值在于推动人工智能从实验室走向产业实践,提升生产力与自动化水平。 📅 04-23📎 OpenAI Research 🔥 AI & 科技 From the Hugging Face Incident to Twilight… Continue reading “📰 科技脉搏 [2026-08-31]”

📰 科技脉搏 [2026-08-29]

📰 科技脉搏 2026-08-29 🏢 公司追踪 Automated researchers can reliably mitigate alignment failures 研究展示自动化研究者系统能够持续识别并修正AI对齐失败问题。通过系统化测试与迭代优化,该方法在多个场景中有效降低系统性风险,为AI安全治理提供可扩展的自动化解决方案。 📅 08-28📎 Anthropic Research 🔥 AI & 科技 Andrew's Letter Andrew Ng聚焦AI智能体从研究走向生产的现实挑战,强调评估体系、用户反馈与安全防护对落地的重要性。他呼吁开发者关注模型在真实场景中的稳定性与局限性,并指出持续迭代和负责任的部署策略是推动AI价值实现的关键。 📎 The Batch Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里? 中文AI媒体:Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里?… 📎 机器之心 由 Hermes 自动生成 | 查看历史摘要

📰 科技脉搏 [2026-08-27]

📰 科技脉搏 2026-08-27 🏢 公司追踪 Societal Impacts 文章系统分析了人工智能技术对社会各领域的潜在影响,包括就业结构、信息生态、伦理法律等层面,并探讨了负责任发展AI的路径,强调需平衡技术创新与社会福祉,推动可持续的治理框架。 📅 08-26📎 Anthropic Research 🔥 AI & 科技 Building Adaptive AI Agents AI 周报,深度分析行业趋势:Building Adaptive AI Agents… 📎 The Batch VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 提出VBVR-Pro套件,面向原生视觉推理任务,具备高度可扩展性与结果可验证性。通过系统化构建复杂视觉场景与推理链条,支持多粒度评估。该套件为视觉推理模型提供了标准化测试基准,有助于追踪推理能力进展并促进可解释性研究发展。 📅 08-26📎 arXiv AI Papers A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training 提出视觉依赖感知框架,用于多模态无监督持续后训练。通过捕捉视觉模态间的依赖关系,有效缓解持续学习中的灾难性遗忘,同时无需人工标注。框架在保持模型对既有知识记忆的同时,自适应整合新视觉概念,提升多模态场景下的学习效率与鲁棒性。 📅… Continue reading “📰 科技脉搏 [2026-08-27]”

📰 科技脉搏 [2026-08-25]

📰 科技脉搏 2026-08-25 🏢 公司追踪 Introducing Claude Opus 5 Anthropic推出旗舰模型Claude Opus 5,在推理、编码和智能体任务上实现显著突破,支持超长上下文与多模态输入。模型通过强化学习优化,在多项基准测试中刷新纪录,同时强化安全意识。现已面向API用户及Claude应用开放,为企业级复杂工作流提供更强大支持。 📅 07-24📎 Anthropic Blog Introducing Claude Sonnet 5 Anthropic发布Claude Sonnet 5,在性能与成本间取得更优平衡。该模型在编程、数学和知识问答方面显著超越前代,支持长上下文处理和工具调用,推理速度更快。适合开发者和企业大规模部署,以更低价格提供接近旗舰模型的智能水平。 📅 06-30📎 Anthropic Blog 🔥 AI & 科技 An opinionated guide to which AI to use to do stuff Ethan Mollick的AI实践洞察:An opinionated guide to which AI to use to do stuff… 📅… Continue reading “📰 科技脉搏 [2026-08-25]”

📰 科技脉搏 [2026-08-19]

📰 科技脉搏 2026-08-19 🏢 公司追踪 How Claude is accelerating protein design and analytical chemistry 本文介绍Claude在蛋白质设计与分析化学中的突破应用。借助强大推理能力,Claude辅助科研人员预测蛋白质结构、设计新型分子,并高效处理化学实验数据,大幅缩短研究周期,展现AI加速科学发现与实验室自动化的广阔前景。 📅 08-18📎 Anthropic Research ChatGPT Ads expands across Europe OpenAI宣布ChatGPT广告业务扩展至欧洲,广告主可在多个欧洲国家投放原生广告,触达海量用户。此举加速商业化布局,为企业提供对话式AI广告新渠道,助力精准营销,同时需应对欧盟严格的数字广告监管。 📅 08-18📎 OpenAI Blog Partnering with CodeAI to prepare the first AI generation OpenAI与CodeAI达成战略合作,共同培养首批AI原生代。通过将AI编程工具融入教育,提升学生编程能力与AI素养,为未来AI时代储备人才。合作旨在推动AI教育普及,弥合数字鸿沟,帮助年轻一代掌握与AI协作的核心技能。 📅 08-18📎 OpenAI Blog More intelligence from every token for your hardest work OpenAI发布o3与o4-mini推理模型,突破”测试时计算”范式,让每个token蕴含更强推理能力。模型可自主思考、规划并融合多路径探索,在ARC、AIME及编程等基准上刷新纪录,显著提高复杂任务处理效率,为最严峻工程挑战提供智能加持。 📅 07-09📎… Continue reading “📰 科技脉搏 [2026-08-19]”

📰 科技脉搏 [2026-08-11]

📰 科技脉搏 2026-08-11 🏢 公司追踪 Learning more about Claude’s mathematical capabilities 本文深入评估了Claude的数学能力,发现其在符号运算、逻辑推理和问题求解方面表现优异,但复杂应用题和严谨性上仍有局限,并提出了改进方向与评估方法。 📅 08-10📎 Anthropic Research 🔥 AI & 科技 Import AI 468: 23 RSI ideas; PostTrainBench+; and how trust and transparency interplay with AI racing Jack Clark的AI研究简报:Import AI 468: 23 RSI ideas; PostTrainBench+; and how trust and transparency int… 📎 Import AI Beyond Naturalness:… Continue reading “📰 科技脉搏 [2026-08-11]”

📰 科技脉搏 [2026-08-10]

📰 科技脉搏 2026-08-10 🏢 公司追踪 Inviting hard questions Anthropic发起的“邀请难题”活动,旨在鼓励用户与开发者向AI提出极具挑战性的问题,通过深度互动检验模型边界,推动安全性与能力持续进化,共同塑造负责任的人工智能未来。 📅 07-09📎 Anthropic Blog 🔥 AI & 科技 CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity While post-training improves the capabilities of large language models (LLMs), it generally lowers their output diversity and creativity, negatively impacting tasks that explicitly require creativity (e.g., story generation)… Continue reading “📰 科技脉搏 [2026-08-10]”