<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0"><channel>
<title>雷达站</title>
<link>https://radar.chouzz.com</link>
<description>个人知识雷达：每日采集、去重、归档与解读</description>
<item>
<title>雷达日报 · 2026-09-10</title>
<link>https://radar.chouzz.com/daily/2026-09-10</link>
<guid>https://radar.chouzz.com/daily/2026-09-10</guid>
<pubDate>2026-09-10</pubDate>
<description># 雷达日报 · 2026-09-10

&gt; 今日 65 条信号 · SI 正常 · 精选 4

## 🎯 今日精选

### 1. Procedural Graphs: Self-Evolving Execution Structures for LLM Agents
`2609.09153` · ? · HF 🔥23 · #untagged
**核心 idea**：Large language models are increasingly deployed as agents that plan over long horizons and act through external </description>
</item>
<item>
<title>SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions</title>
<link>https://radar.chouzz.com/items/2510.08999</link>
<guid>https://radar.chouzz.com/items/2510.08999</guid>
<pubDate>2026-09-10</pubDate>
<description>Compressing large-scale neural networks is essential for deploying models on resource-constrained devices. Most existing methods adopt weight pruning or low-bit quantization individually, often resulting in suboptimal compression rates to preserve acceptable performance drops. We introduce a unified</description>
</item>
<item>
<title>Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions</title>
<link>https://radar.chouzz.com/items/2608.29109</link>
<guid>https://radar.chouzz.com/items/2608.29109</guid>
<pubDate>2026-09-10</pubDate>
<description>Large language models often answer structurally unanswerable questions, such as computing cot(-540°) or evaluating (1).startswith("1"), instead of abstaining. We ask whether this failure reflects missing recognition or failed routing from recognition to abstention. Across instruction-tuned models fr</description>
</item>
<item>
<title>Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation</title>
<link>https://radar.chouzz.com/items/2609.00369</link>
<guid>https://radar.chouzz.com/items/2609.00369</guid>
<pubDate>2026-09-10</pubDate>
<description>Generating co-speech gestures that are temporally coherent, semantically aligned with speech, and grounded with surrounding objects remains challenging. Prior speech-driven gesture models emphasize audio-gesture alignment but do not explicitly account for posture constraints or surrounding objects, </description>
</item>
<item>
<title>StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability?</title>
<link>https://radar.chouzz.com/items/2609.00787</link>
<guid>https://radar.chouzz.com/items/2609.00787</guid>
<pubDate>2026-09-10</pubDate>
<description>Humans need to study only a handful of well-written textbooks to master a discipline and attempt its hardest problems. We argue that an ideal self-evolution method should share the same property, that is autonomously learning from raw training material for transferable problem-solving capability. Ho</description>
</item>
<item>
<title>Graph Machine: Towards Better Pretraining via Edges</title>
<link>https://radar.chouzz.com/items/2609.02881</link>
<guid>https://radar.chouzz.com/items/2609.02881</guid>
<pubDate>2026-09-10</pubDate>
<description>We introduce the Graph Machine (GM), an architecture that maintains an O(n)-sized state and accesses it through sparse, dynamic routing. Unlike methods with fixed-size states or sparse but static routing, GM preserves O(n) complexity in its sparse layers without restricting the potentially accessibl</description>
</item>
<item>
<title>MasterControl Seventeen Every Time</title>
<link>https://radar.chouzz.com/items/2609.03209</link>
<guid>https://radar.chouzz.com/items/2609.03209</guid>
<pubDate>2026-09-10</pubDate>
<description>We study a governed approach to enterprise analytics: a language model interprets the question, while deterministic policy selects and runs a pre-approved analytical program that returns both results and evidence. We show that this restriction can remain expressive within a defined analytical class,</description>
</item>
<item>
<title>EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness?</title>
<link>https://radar.chouzz.com/items/2609.04280</link>
<guid>https://radar.chouzz.com/items/2609.04280</guid>
<pubDate>2026-09-10</pubDate>
<description>Modern LLM-based agents operate through a harness of tools, reusable skills, and specialist agents that shapes what they observe and what they can do. In practice, this harness continually evolves as new capabilities are added. We introduce EVOHARNESSBENCH, a benchmark for evaluating agents under co</description>
</item>
<item>
<title>Learning 3D Editing without Paired Supervision via Generative Prior Distillation</title>
<link>https://radar.chouzz.com/items/2609.04942</link>
<guid>https://radar.chouzz.com/items/2609.04942</guid>
<pubDate>2026-09-10</pubDate>
<description>Instruction-guided 3D editing is essential for interactive content creation, yet it faces a significant bottleneck: the severe scarcity of high-quality paired training data. Existing approaches attempt to bypass this by either relying on slow test-time optimization or training on pseudo-pairs constr</description>
</item>
<item>
<title>BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference</title>
<link>https://radar.chouzz.com/items/2609.04971</link>
<guid>https://radar.chouzz.com/items/2609.04971</guid>
<pubDate>2026-09-10</pubDate>
<description>Large Reasoning Models (LRMs) achieve superior problem-solving through extended Chain-of-Thought (CoT) generation, but the resulting key-value (KV) cache grows linearly with sequence length and creates severe memory bottlenecks, often exceeding GPU capacity for long reasoning traces. Existing KV cac</description>
</item>
<item>
<title>RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?</title>
<link>https://radar.chouzz.com/items/2609.05324</link>
<guid>https://radar.chouzz.com/items/2609.05324</guid>
<pubDate>2026-09-10</pubDate>
<description>Vision-Language-Action (VLA) models have shown promising progress in language-conditioned robotic manipulation. However, existing datasets and benchmarks mainly evaluate task completion under predefined settings, offering limited insight into model reasoning under increasing spatial and procedural c</description>
</item>
<item>
<title>WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data</title>
<link>https://radar.chouzz.com/items/2609.05405</link>
<guid>https://radar.chouzz.com/items/2609.05405</guid>
<pubDate>2026-09-10</pubDate>
<description>Recent advances in wearable sensing enable continuous monitoring of physiological and behavioral signals, yet existing benchmarks rarely evaluate whether AI systems can reason over a real user's longitudinal wearable record. We introduce WearableQA, a benchmark comprising 4,084 10-option multiple-ch</description>
</item>
<item>
<title>GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation</title>
<link>https://radar.chouzz.com/items/2609.05588</link>
<guid>https://radar.chouzz.com/items/2609.05588</guid>
<pubDate>2026-09-10</pubDate>
<description>World-action models (WAM) predict future states to guide robot actions, enabling learning from both action-free video and action-labeled interaction. Most inherit pretrained video generators, leaving WAM pretraining and scaling underexplored. We introduce Genie Envisioner Act 2.0 (GE-Act 2.0), a wor</description>
</item>
<item>
<title>What Did I Just Say? Self-Listening for Full-Duplex Speech Models</title>
<link>https://radar.chouzz.com/items/2609.05592</link>
<guid>https://radar.chouzz.com/items/2609.05592</guid>
<pubDate>2026-09-10</pubDate>
<description>Full-duplex spoken language models can listen and speak simultaneously, enabling them to handle interruptions and backchannels in human conversation. However, text generation, speech synthesis, and audio playback proceed asynchronously. As a result, what a model believes it has said may not match wh</description>
</item>
<item>
<title>RenderFormer-V2: Neural Rendering with Heterogeneous Scene Primitives</title>
<link>https://radar.chouzz.com/items/2609.05738</link>
<guid>https://radar.chouzz.com/items/2609.05738</guid>
<pubDate>2026-09-10</pubDate>
<description>We present 'RenderFormer-V2', a unified learned transformer-based neural rendering model, complementary to modern physics-based rendering systems, that can handle diverse light-transport effects such as caustics, volumetric scattering, environment lighting, textured and displaced surfaces and out-of</description>
</item>
<item>
<title>Diffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models</title>
<link>https://radar.chouzz.com/items/2609.05779</link>
<guid>https://radar.chouzz.com/items/2609.05779</guid>
<pubDate>2026-09-10</pubDate>
<description>Large language models used for code editing can be trained and deployed in at least two output regimes: direct generation, where the model emits the entire modified file in one shot, and iterative diff-based generation ("steps"), where the model emits a sequence of localized search/replace edits app</description>
</item>
<item>
<title>Cadence: Error-Bounded Lossy Compression of Demand Time Series with a Time-Series Foundation Model</title>
<link>https://radar.chouzz.com/items/2609.06008</link>
<guid>https://radar.chouzz.com/items/2609.06008</guid>
<pubDate>2026-09-10</pubDate>
<description>We present Cadence, an error-bounded lossy compressor for numeric time series pairing a 330M-parameter time-series foundation model (Google TimesFM-3) with an adaptive arithmetic coder, guaranteeing |x_t-x_t|leτ on every sample. One negative result constrains the design space: for lossless coding a </description>
</item>
<item>
<title>Counter-Swarm Doctrine: Containing Coordinated Agent Intrusions</title>
<link>https://radar.chouzz.com/items/2609.06140</link>
<guid>https://radar.chouzz.com/items/2609.06140</guid>
<pubDate>2026-09-10</pubDate>
<description>Agents can turn shared infrastructure into a channel for coordinated intrusion. The Hugging Face incident and a separate public-wiki investigation show why a security assessment may need evidence from several executions and the artifacts they leave behind. We argue that the operational unit of defen</description>
</item>
<item>
<title>VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification</title>
<link>https://radar.chouzz.com/items/2609.06245</link>
<guid>https://radar.chouzz.com/items/2609.06245</guid>
<pubDate>2026-09-10</pubDate>
<description>Multimodal Large Language Models (MLLMs) perform strongly on general visual understanding tasks such as visual question answering, yet they often struggle with a basic comparative skill: identifying what has changed between two similar images. We introduce VDiff-Bench, a challenging multiple-choice </description>
</item>
<item>
<title>Steering Geometry: Validating Human Value Geometry in LLM Steering Space</title>
<link>https://radar.chouzz.com/items/2609.06289</link>
<guid>https://radar.chouzz.com/items/2609.06289</guid>
<pubDate>2026-09-10</pubDate>
<description>As large language models (LLMs) are increasingly deployed in alignment-sensitive contexts, activation steering has emerged as a lightweight, inference-time alternative to fine-tuning methods (e.g., RLHF, DPO) for behavioral control. However, existing work typically validates steering on isolated beh</description>
</item>
<item>
<title>TransNormal-2: Geometry-Grounded Rectified Flow with Edge-Aware Decoding for Precise Normal Estimation</title>
<link>https://radar.chouzz.com/items/2609.06665</link>
<guid>https://radar.chouzz.com/items/2609.06665</guid>
<pubDate>2026-09-10</pubDate>
<description>Diffusion-based models enable monocular geometry estimation, yet their pixel-space precision is limited by a shared, under-studied error source: VAE reconstruction degradation. The 8x spatial compression in the VAE encoder-decoder degrades surface normals at object boundaries; even encoding and deco</description>
</item>
<item>
<title>DianShi-RxnDB: A Large-Scale, Fine-Grained Organic Reaction Data Platform Built via a Fully Automated Pipeline for Researchers and AI Agents</title>
<link>https://radar.chouzz.com/items/2609.06703</link>
<guid>https://radar.chouzz.com/items/2609.06703</guid>
<pubDate>2026-09-10</pubDate>
<description>High-quality structured organic reaction data are essential for developing artificial intelligence for chemistry (AI4Chem), yet much of this knowledge remains dispersed across patent text, images, and reaction schemes. We present DianShi-RxnDB, a large-scale, fine-grained organic reaction data platf</description>
</item>
<item>
<title>Reason Through the Latent! Making Latent Visual Reasoning Necessary</title>
<link>https://radar.chouzz.com/items/2609.06746</link>
<guid>https://radar.chouzz.com/items/2609.06746</guid>
<pubDate>2026-09-10</pubDate>
<description>Latent visual reasoning aims to perform multimodal reasoning through hidden-state computation rather than explicit textual chains of thought. However, visual information being present in a latent state does not imply that the model actually relies on that state when producing its answer, especially </description>
</item>
<item>
<title>Revisiting Complete Reasoning Traces for Post-Training</title>
<link>https://radar.chouzz.com/items/2609.07103</link>
<guid>https://radar.chouzz.com/items/2609.07103</guid>
<pubDate>2026-09-10</pubDate>
<description>Large language models (LLMs) are often post-trained on pre-collected reasoning trajectories to improve their reasoning capability. Such trajectories tend to be long due to complex, interwoven paths, which often include detours on the path toward the answer. However, it has been underexplored whether</description>
</item>
<item>
<title>Encoded Early, Used Late: Where Transformers Begin to Act on an Inferred Partner's Expertise</title>
<link>https://radar.chouzz.com/items/2609.07139</link>
<guid>https://radar.chouzz.com/items/2609.07139</guid>
<pubDate>2026-09-10</pubDate>
<description>A transformer can make an attribute linearly decodable in its residual stream at a depth where that attribute does not yet influence the output. This gap between where information is readable and where it is used has been shown for attributes stated directly in the input. We ask whether it also hold</description>
</item>
<item>
<title>OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining</title>
<link>https://radar.chouzz.com/items/2609.07398</link>
<guid>https://radar.chouzz.com/items/2609.07398</guid>
<pubDate>2026-09-10</pubDate>
<description>World-Action Models inherit world knowledge from video-generative priors, and channel it into executable control signals through embodied experience. Existing systems, however, are monolithic: the generative backbone, visual representation, architecture, information flow, inference procedure, and tr</description>
</item>
<item>
<title>RelightFormer: Feed-forward Generative Transformer for Multiview Object Relighting</title>
<link>https://radar.chouzz.com/items/2609.07414</link>
<guid>https://radar.chouzz.com/items/2609.07414</guid>
<pubDate>2026-09-10</pubDate>
<description>Image relighting is traditionally tackled via complex inverse rendering pipelines, which suffer from ill-posed optimization, or single-image generative models that ignore crucial multi-view cues necessary for understanding 3D geometry and material interactions. To address these limitations, we intro</description>
</item>
<item>
<title>Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy</title>
<link>https://radar.chouzz.com/items/2609.07470</link>
<guid>https://radar.chouzz.com/items/2609.07470</guid>
<pubDate>2026-09-10</pubDate>
<description>Robot foundation models are trained and evaluated predominantly in English, and robot demonstration corpora do not exist for most languages. We study the addition of Greek to an open vision-language-action stack using only machine-rephrased instructions and no architecture changes. The main challeng</description>
</item>
<item>
<title>CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements</title>
<link>https://radar.chouzz.com/items/2609.07498</link>
<guid>https://radar.chouzz.com/items/2609.07498</guid>
<pubDate>2026-09-10</pubDate>
<description>Transferring human hand demonstrations to robotic grippers has recently emerged as a cost-effective solution for robot learning. However, existing methods are largely confined to simple, planar tasks and fail to handle complex spatial movements (e.g., intricate trajectories involving rotations or fl</description>
</item>
<item>
<title>Harnessing CLIP and DINO: An Uncertainty-Aware Cascaded Fusion Network for Generalizable Deepfake Image Detection</title>
<link>https://radar.chouzz.com/items/2609.07670</link>
<guid>https://radar.chouzz.com/items/2609.07670</guid>
<pubDate>2026-09-10</pubDate>
<description>The growing realism and accessibility of manipulated and generated faces threaten the trustworthiness of digital media. To detect such forgeries, deepfake detectors based on vision foundation models have shown promising performance, but they typically rely on a single pretrained representation and a</description>
</item>
<item>
<title>A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM</title>
<link>https://radar.chouzz.com/items/2609.07821</link>
<guid>https://radar.chouzz.com/items/2609.07821</guid>
<pubDate>2026-09-10</pubDate>
<description>Chain-of-Thought (CoT) improves the reasoning ability of Large Language Models (LLMs) but incurs substantial computation and context costs. Existing methods either lose intermediate information through hard pruning or lack a principled criterion for continuous compression. We present A*-Thought-V2, </description>
</item>
</channel></rss>