Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation
HiRoC通过层次化后训练框架,结合规划与强化学习执行,显著提升VLA模型在长时程机器人操作中的鲁棒性和泛化能力。
HiRoC通过层次化后训练框架,结合规划与强化学习执行,显著提升VLA模型在长时程机器人操作中的鲁棒性和泛化能力。
CogVis通过认知记忆引导的感知-记忆-验证范式,解耦时间感知与语义决策,实现高效稳定的开放词汇变化检测。
HOPE提出从单目视频预测手部网格逐顶点压力的统一框架,结合接触门控和视频变换器,实现泛化压力估计。
ComFuse通过跨类别算子融合,将内存密集型子图隐藏在计算密集型内核中,显著提升GPU利用率。
KARAT 通过将 KV Cache 驻留在通用 PNM 节点上,实现了百万级上下文的高效异构 LLM 解码服务。
本文首次系统分析智能体式AI工作流的架构影响,并提出Agora原型系统优化资源利用率与延迟。
提出线性多时间尺度保留模块,实现线性复杂度视觉语言桥接,支持无限上下文处理。
Bole通过内核-运行时协同设计,将混合注意力模型的树形投机解码效率提升数倍,显著降低内存占用和延迟。
Open-DiffLoco 是首个开源的可微仿真四足机器人盲走策略训练框架,实现高效训练与真实部署的无缝衔接。
DART通过解码循环状态中的键值对并执行状态记忆注意力,实现了高效长上下文建模与检索的统一。
本文通过大规模实证研究,系统揭示了LLM服务框架在开源软件中的采用模式、组合策略及与模型特性的关联,为实践者提供选型指南。
提出内存中心层次化架构MCHA,通过层次化通信和事件驱动机制,实现并行-顺序计算的高效加速。
TELLER通过非侵入式跨层追踪和日志融合,实现LLM推理的自动根因分析,提升诊断效率。
提出基于Mamba和可微PAQM损失的高效音频增强框架,在带宽扩展和压缩恢复中实现高感知质量与低计算成本。
LowRank-SSM 通过软硬件协同设计,利用秩缩减技术显著提升 Mamba 模型在 FPGA 上的推理吞吐量和能效。
本文首次在Meta的定制AI加速器MTIA-2i上实现了Triton的生产级应用,通过编译器后端和语言扩展,证明了高级DSL能弥合编程模型鸿沟,实现高效部署。
MADE通过信念驱动的双智能体协调机制,实现了从模型资源到可调用API的全自动部署,显著提升了部署成功率。
TAP通过轻量级神经网络和参数化时延估计,实现了高效、可泛化的CSI反馈压缩,兼顾速度与可解释性。
FLASH通过融合超图与状态空间模型,实现了高效、准确且可解释的跌倒冲击检测。
本文系统分析了投机解码中有损验证的机制与权衡,提出统一分类框架和过冲控制原则,为高效可靠的加速推理提供理论指导。
提出FedSLM框架,通过SVD低秩分解和嵌套流形聚合,实现异构客户端下基础模型的高效联邦微调。
DualDecoder通过预测性预取和双token解码流水线,消除辅助状态开销,显著加速长上下文LLM推理。
MindForge通过无源环境生成全生命周期训练数据,显著提升小模型从零开始程序合成能力。
GyRot通过算法-硬件协同设计,巧妙融合旋转与细粒度分组量化,实现高效低比特LLM推理。
TraceCoder通过记录、索引和可视化代码修复历史,将LLM代码生成从黑盒转变为可解释、可审计的透明过程。
EvoPINN利用LLM智能体自动搜索并验证PINN算法,将手动设计转变为基于执行验证的算法发现。
提出一种三阶段区域级配准框架,通过对比学习和级联精化,有效解决了小局部点云与大全局点云的尺度不匹配配准难题。
通过窗口化草稿模型注意力,消除长上下文投机解码中的高昂计算成本,实现无损加速。
提出一种证据驱动的LLM框架,通过分析具体失败案例和客观ECG测量值,递归精炼分类器,实现可解释、高效的自动化模型优化。
通过高效多粒度插桩和精准变异策略,实现高保真Web应用模糊测试,显著提升漏洞检测率和性能。