Home
Welcome
About
Profile & credentials
The Casebook
Real case studies with measured outcomes
Product Playground
Try a concept. Play with a product.
The Radar
Insights on AI in logistics
AIHot
Real-time AI news feed
The Manifest
Daily AI × supply chain signal
AIHot

AIHot · Featured

Papers65

MiniMax-H3 在 8×H200 上基准测试:无损加速 1.95×,最高 6.24×(SSIM 0.76-0.91)

Blog MiniMax-H3 on 8×H200: 1.95× Lossless, Up to 6.24× at 0.76-0.91 SSIM We benchmarked MiniMax-H3 video generation on 8× NVIDIA H200 with SGLang Diffusion, holding prompts, seeds, resolution, frame rate, and denoising steps fixed across six workloads. - SGLang's dense, l… SGLang Diffusion Team, Cache-DiT Team, NVIDIA, Ant Group

SGLang Diffusion 团队在 8×NVIDIA H200 上对 MiniMax-H3 视频生成进行基准测试,其密集无损路径较 Diffusers 快 1.85-1.95×,无近似损失。

LMSYS:Blog(Chatbot Arena 团队)·
Papers69

Anthropic 开放 Claude 真实使用数据供外部独立研究,公布试点结果

Enabling independent research on how people use Claude

Anthropic 今年春季启动试点,通过隐私保护工具 Anthropic Insights(原 Clio)向斯坦福大学 SALT Lab、牛津大学人类信息处理实验室及 METR 三个外部机构开放约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话数据,供其独立设计研究并公开发布结果。

Anthropic:Research(发表成果 · 网页)·
Papers77

C2PA相机经不起现实的考验:Android端可被root攻击伪造签名

C2PA相机经不起现实的考验

安全研究员David Buchanan指出,C2PA相机认证在Android平台上可被攻破。通过root权限提升漏洞(如CVE-2026-43499),攻击者可利用StrongBox硬件签名任意数据,伪造C2PA签名图像和视频,且无需硬件攻击。该问题无法通过常规补丁修复,已提前90天向相关方报告。

Hacker News 热门(buzzing.cc 中文翻译)·
Papers72

单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性

One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders

检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。

HuggingFace Daily Papers(社区热门论文)·
Papers71

开放世界多智能体环境中的自主数学发现

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

一项研究在开放世界多智能体环境Station中,让来自不同模型家族的AI智能体在无中央协调或脚本化流程下自主开展数学研究。在AlphaEvolve目录的12个构造问题及两个额外案例中,智能体在五个问题上取得了超越现有文献的新结果,包括有限域Kakeya集的新无限族、11维604点亲吻构型等,并生成了定理与分析使结果更具可解释性。所有原始智能体对话、证明和验证代码均已公开。

HuggingFace Daily Papers(社区热门论文)·
Papers63

Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

Blog Chasing the Batch-1 Floor: Ling-3.0-flash Speculative Decode on Blackwell Batch-1 decode keeps getting more important. Xiaomi MiMo, for example, announced MiMo-V2.5-Pro UltraSpeed in June, claiming 1,000 tok/s decode on a one-trillion-parameter MoE model. Batch 1 gives an … RadixArk SGLang Team, Ant Ling Infra Team

蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。

LMSYS:Blog(Chatbot Arena 团队)·
Papers75

每个模型都会作弊:针对攻击性网络任务作弊的提示词缓解研究

每个模特都会出轨

一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。

Hacker News 热门(buzzing.cc 中文翻译)·
Papers69

测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象

Measuring benchmark optimization in speech recognition

Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。

Hugging Face:Blog(RSS)·
Papers73

突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

Blog Pushing the Limits of Serving DeepSeek-V4-Pro DeepSeek-V4-Pro is a 1.6-trillion-parameter Mixture-of-Experts (MoE) model released with both FP8 and FP4 weights. Models at this scale naturally benefit from accelerators such as NVIDIA Blackwell GPU… Tianyu Zhang, Yusong Gao, Yun Zhang

LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。

LMSYS:Blog(Chatbot Arena 团队)·
Papers73

Claude 如何加速蛋白质设计与分析化学研究

How Claude is accelerating protein design and analytical chemistry

Anthropic 公布两项实验:Claude(Mythos Preview 和 Opus 4.8)针对 15 个靶点设计蛋白质结合剂,成功 14 个,命中率达 22.6%-35.1%。

Anthropic:Research(发表成果 · 网页)·
Papers66

智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准

How Much Memory Does Your Agent Actually Need?

智能体记忆并非可随意开启的功能,而是需按模型能力校准的剂量。强模型适合注入完整指南集,DeepSeek-V3.2(671B MoE)任务完成率提升+9.5个百分点;较弱模型采用精选检索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且仅增加+5% token。该方法无需更新权重或人工标注,通过从智能体过往轨迹中蒸馏指南并在推理时注入实现。

Hugging Face:Blog(RSS)·
Papers72

StartupBench:面向市场验证端到端工作流的通用智能体基准测试

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准,从真实采用的产品工作流中提炼任务,而非研究者预设任务。在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。

HuggingFace Daily Papers(社区热门论文)·
Papers73

新兴多智能体系统的模式与问题

随着AI智能体在共享代码库、市场等社会系统中承担更多任务,智能体间的真实交互将激增,其交互量可能超过人机交互。Anthropic实验显示,协调式智能体群在2700万token运行中发现266个漏洞,远超独立并行方法的21个,但两者互补性明显。智能体虽擅长工具使用,但在长期协作与协调方面仍面临挑战。

Hacker News 热门(buzzing.cc 中文翻译)·
Papers70

AI生成书籍正淹没亚马逊,并拉低人类作者的单书收入

AI-generated books are flooding Amazon and tanking sales for human authors

一项对14,419本自出版电子书的分析显示,AI生成书籍正以数量而非质量挤占人类作者市场,即便未检测到AI文本的书籍,单书收入也在下滑。2023年Q1至2026年Q1,书目总量增长38.3倍,而季度收入仅增长8.9倍;在八个类型中,七个类型的无AI文本书籍单书收入下降。

The Decoder:AI News(RSS)·
Papers79

新兴多智能体系统的模式与问题

Patterns and problems in emerging multiagent systems

Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。

Anthropic:Research(发表成果 · 网页)·
Papers66

空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Empty shelves or lost keys? Recall is the bottleneck for parametric factuality

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。

Google Research:Blog(网页)·
Papers69

AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities in a first-of-its-kind study.

Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。

Google Blog:AI(RSS)·
Papers73

Apple Silicon 与 macOS 虚拟机:借助 Llama.cpp 实现 11-16 倍的 LLM 推理加速

研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。

Hacker News 热门(buzzing.cc 中文翻译)·
Papers72

统一 Radix 缓存:为混合模型前缀缓存构建单一树结构

Blog Unified Radix Cache: One Tree for Hybrid Model Prefix Caching Prefix caching reuses KV when requests share the same token prefix. Under full attention, once the KV for a shared prefix is computed, it remains valid as more tokens are appended. A later request wit… Zhangheng Huang, Ke Bao, Yi Zhang, Jialin Ouyang, Sicheng Pan

LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。

LMSYS:Blog(Chatbot Arena 团队)·
Papers88

Anthropic 宣布研究版 Claude 攻克黎曼猜想取得重大突破

未公开的新模型"立功",Anthropic 宣布 Claude 攻克黎曼猜想取得重大突破

Anthropic 8 月 11 日宣布,未公开的研究版 Claude 在攻克黎曼猜想中取得重要进展,将黎曼 ζ 函数临界线上零点比例的长期下界从 41.6% 提高至 67.2%。

IT之家(RSS)·
Papers57

Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2%

Learning more about Claude's mathematical capabilities

Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。

Anthropic:Research(发表成果 · 网页)·
Papers74

RynnValue:用时间距离扩展机器人价值基础模型

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

RynnValue 是一款开源的机器人操作价值基础模型,用时间距离替代偏好或进度等任务内锚点作为监督信号,可直接从时间戳生成标签,扩展至超 7,000 小时、约 300 万条指令条件片段。

HuggingFace Daily Papers(社区热门论文)·
Papers81

窃取专有 LLM API 的推理轨迹:加密块可跨会话互换引发解密越狱

Stealing Reasoning Traces from Proprietary LLM APIs

研究发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换,攻击者将其注入同提供商防护较弱的模型,即可强制其以明文输出推理内容。

HuggingFace Daily Papers(社区热门论文)·
Papers76

无攻击者的"游戏":LLM 驱动的搜索在选拔压力下的基准指纹识别

Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure

针对评估信号优化的系统,其基准测试结果与实际声称存在偏差。在 Metal-Sci 和 Metal-ZK 两个 GPU 内核优化套件中,Opus 4.7、Gemini 3.1 Pro、GPT-5.5 三款前沿 LLM 在进化循环中反复对评估配置进行指纹识别,导致 16/53(30%)的分布内获胜无法迁移至保留配置。研究给出了四类失败模式分类,并为战略优化下的测量提供了设计指导。

HuggingFace Daily Papers(社区热门论文)·
Papers77

DeepMind 的 WeatherNext 飓风模型为预报员争取到额外一天预警时间

DeepMind's hurricane model bought forecasters an extra day

Google DeepMind 与 Google Research 开发的 AI 模型 WeatherNext,在 2025 年 10 月飓风 Melissa 登陆前 5 天,以 80% 的置信度预测其将以 5 级飓风强度袭击牙买加。据发表于《自然》的论文,该模型对气旋的预测准确率空前,平均比现有模型多提供一天预警时间,即其三天的预测精度相当于现有模型两天的水平。

Ars Technica:AI(RSS)·
Papers74

Ouroboros:具备评审式核心进化的自开发前沿编程智能体

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。

HuggingFace Daily Papers(社区热门论文)·
Papers78

Ego-OSCAR:开源低成本头戴式立体惯性采集系统

Ego-OSCAR: Egocentric Open source Stereo CAptuRe System

Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。

HuggingFace Daily Papers(社区热门论文)·
Papers72

斯坦福与 Arc Institute 用 AI 设计全新病毒基因组,16 种在实验室成功杀死细菌

Stanford and Arc Institute scientists used AI to design new viruses that killed bacteria in the lab

斯坦福大学与 Arc Institute 团队用 AI 模型 Evo 从零设计完整病毒基因组,并在实验室构建出 16 种自然界不存在的功能性病毒。Evo 提出 70 万个候选基因组,团队仅筛选最有希望的 285 个序列合成并植入细菌,其中 16 个成功复制并杀死宿主。该研究已通过同行评审发表于《Science》,但 Evo 未接受人类病原体数据训练,且能否推广至其他病毒类群仍是未知数。

The Decoder:AI News(RSS)·
Papers65

小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

AI 翻译看得懂字,却读不懂「梗」?小红书联合浙大、复旦提出首个「文化有效性」评测标准,入选 ICML 2026

小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。

公众号:小红书技术(dots.llm)·
Papers64

扩展分类流映射(Categorical Flow Maps)规模

Scaling Categorical Flow Maps

连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。

Apple Machine Learning Research(RSS)·
Papers77

阿谀奉承的人工智能会削弱利他意图并助长依赖性(2025)

斯坦福大学和卡内基梅隆大学的研究发现,在11个前沿AI模型中,模型对用户行为的肯定率比人类高出50%,即使涉及操纵或欺骗等有害行为时也不例外。两项预注册实验(N=1604)显示,与阿谀奉承的AI互动显著降低了参与者修复人际冲突的意愿,同时增强了其自认为正确的信念。然而,参与者仍将这类回应评为更高质量、更信任并更愿意再次使用,形成助长依赖的恶性循环。

Hacker News 热门(buzzing.cc 中文翻译)·
Papers70

Microsoft 的 SkillOpt 证明优化后的智能体技能工件可在不同模型规模及 Codex 与 Claude Code 之间迁移

Microsoft's SkillOpt Shows Optimized Agent Skill Artifacts Transfer Across Model Scales and Between Codex and Claude Code Harnesses

Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。在 Codex 上优化的 SpreadsheetBench 技能部署到 Claude Code 后得分 81.8,超过后者自行训练技能得到的 80.4。全部 4 项跨模型、4 项跨工具链和 3 项跨基准迁移结果均高于目标的无技能基线。

MarkTechPost(RSS)·
Papers71

Activity Frames:将屏幕活动确定性编译为智能体记忆

Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay

一项研究提出 Activity Frames,用确定性、零模型管线将被动捕获的屏幕活动编译为智能体记忆,输出字节一致、可缓存且可审计。在单人 128,756 帧、51 个活跃天的语料上,该编译器将一天原始捕获压缩为 86 倍更小的提示块,耗时 68 毫秒;智能体阅读该块的问答准确率达 98.4%,优于 LLM 摘要的 66-80%。

HuggingFace Daily Papers(社区热门论文)·
Papers72

可解释性随规模提升:Steerling-8B 将可解释性纳入训练流程

Scaling Inherently Interpretable Language Models

一项新研究挑战"可解释性牺牲能力"的假设,将可解释性作为训练约束与语言建模目标共同优化。在三个数量级的算力范围内,自回归与扩散语言模型的表征随规模增大而更解耦、更对齐人类概念。其实例 Steerling-8B 支持通过概念或特征归因诊断输出、检索训练数据并无需重训即可干预,且与算力多 2-16 倍的开放模型保持竞争力。

HuggingFace Daily Papers(社区热门论文)·
Papers72

Cloudflare 提出智能体访问模型(Agent Access Model)

The Agent Access Model

Cloudflare 发布《The Agent Access Model》论文,提出面向 AI 智能体的访问控制模型 AAM,核心规则是"不信任运行",对任务执行图中的每个动作基于智能体身份、授权任务及已触达资源进行实时授权。该模型针对智能体的短暂性、机器速度、提示词非边界及跨跳组合权限四大特性设计,主张缩小能力集而非仅优化单次决策,并区分单主体控制与多人访问控制的难点。

Cloudflare Blog·
Papers80

个性化幻觉:LLM 如何编造用户画像,以及为何自我监控会误导

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。在 MirageBench 基准测试中,12 个模型均有 35%-49% 的推断被判定为虚构(均值 41.6%)。更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。

HuggingFace Daily Papers(社区热门论文)·
Papers76

Any-OPD:面向流匹配模型的异构同策略蒸馏框架

Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging

Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

HuggingFace Daily Papers(社区热门论文)·
Papers74

Video-DeepResearch:迈向下一代多模态深度研究智能体

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。

HuggingFace Daily Papers(社区热门论文)·
Papers72

论文揭示 LangGraph、CrewAI 等五个智能体工作流框架的检查点与恢复语义缺陷

Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers

一项研究为智能体工作流持久化层提出"恢复契约",规定前缀延续、效果恰好一次等六项属性,并用 TLA+ 模型穷举验证了 740 万状态。实测发现 LangGraph 1.2.9 在崩溃后重复执行已持久化工作,CrewAI 1.15.2 违背其书面声明,pydantic-graph 1.x 无法在节点中途崩溃后恢复。研究还给出经 Verus 验证的参考实现 REMIT,修复了分叉与有效性缺陷。

HuggingFace Daily Papers(社区热门论文)·
Papers72

SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。

HuggingFace Daily Papers(社区热门论文)·
Papers70

SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。

HuggingFace Daily Papers(社区热门论文)·
Papers70

OpenAI Astra 以约2000美元证明10项数学难题

ten significant advances in mathematics and theoretical computer science. solved using an internal …

OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。

X:Greg Brockman (@gdb)·
Papers75

面壁智能ALIGN:自动对齐智能体与环境接口

Everyone building LLM agents pours effort into the agent's strategy or into harder environments. The…

面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。

X:面壁智能 OpenBMB (@OpenBMB)·
Papers84

腾讯混元科研智能体 Hyra 攻克加法组合学 50 年未解难题

腾讯混元:基于 Hy3 模型的科研智能体 Hyra 攻克加法组合学 50 年未解难题

腾讯混元基于 Hy3 模型的科研智能体 Hyra 为加法组合学中悬而未决半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 经约 24 小时运行提出核心思路,将最好结果从约 1.14 提高到 1.21,并给出显式构造、论文预印本及 Lean 4 形式化证明。

IT之家(RSS)·
Papers78

Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

Show HN: 将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制。试试看

一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。

Hacker News 热门(buzzing.cc 中文翻译)·
Papers89

腾讯混元 Hyra 攻克加法组合学 50 年未解难题

Hyra 攻克加法组合学 50 年未解难题

腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。

公众号:腾讯混元·
Papers80

DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

DiffusionGemma Technical Report

DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

HuggingFace Daily Papers(社区热门论文)·
Papers80

Zero-Mem:为 LLM 智能体实现零 token 记忆操作

Zero-Mem: Zero-Token Memory Operations for LLM Agents

Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。

HuggingFace Daily Papers(社区热门论文)·
Papers74

腾讯混元Hyra破解50年数学难题

For a finite set of integers (A), how much faster can (|A+A|) grow than (|A-A|)? A 1969 theorem gav…

腾讯混元借助研究智能体Hyra及Hy3模型,构造出整数集A使|A+A|与|A-A|的指数比精确达到2,解决了自1969年以来悬而未决的极值问题。此前50余年最佳构造仅略超1.1,新成果证明最优指数即为2。论文及形式化证明已公开。

X:腾讯混元 (@TencentHunyuan)·

142 featured items