项目地址: https://github.com/cactus-compute/needle 图1 Needle 2 项目概览:45M 参数、14MB 体积与端侧工具调用 如果我们把今天的大模型 Ag…
DeepSeek Harness最近发布,又引来一通热议。 很多人把DPH当成了一个个人使用的agent,可能误解了它的定位和作用。 对于有经验的开发者而言,利用DPH框架更容易构建一个专业agent…
为什么 DeepSeek Harness 说“一切皆插件”?从 Cordis 看懂 Agent 系统的可组合设计 当我们讨论一个 AI Agent,最先想到的往往是模型、提示词和工具调用。 但真正把 …
上篇讲清了 SimWAM 最核心的结构:视频专家和动作专家在训练阶段联合学习,但隔离注意力不允许动作 token 偷看未来帧 token。视频生成负责把交通动态教进当前观察表征,部署时则移除未来视频 …
一辆自动驾驶汽车驶到路口,前方既有并线车辆,也有红绿灯和复杂的道路边界。 如果让模型先生成几帧“接下来可能发生什么”的视频,再根据这些未来画面规划轨迹,直觉上当然合理:既然看见了未来,做决定似乎就会更…
逐际动力发布TRON 2 VLA 开源示例-叠衣服👕 长程任务连续执行,柔性物体精准操作,创学营黑客松赛题同款,核心能力全开源。 具身数据平台、开源数据、开源代码,研究者不用再为硬件适配和调试耗费精力…
过去我们设计 CLI 和 API,默认使用者是人,或者是一段已经写好的程序。 人会看文档,会理解业务,也知道 customer.owner = alice 的实际含义是“把这个客户分配给 Alice”…
π0.5 在 Jetson Orin 上从 0.70 Hz 提升到 6.06 Hz,关键不只是“把模型跑快”,而是让感知、预测、执行和底层引擎一起适配端侧延迟。 图 1 Jetson-PI 工程部署概…
总结出来的核心经验 核心记住这六句: VLA 不是写程序,是让机器人看着你做几十遍,然后自己学。 所以这活儿九成的功夫在"你演得标不标准",不在模型。 模型只会模仿,不会评判。 你手抖,它学会手抖;你…
传统模仿学习最喜欢“干净”的成功示范。 但机器人一旦真正部署,产生最多的往往不是完美轨迹,而是一些更复杂的过程:毛巾从夹爪中掉落,机器人把它重新抓起;纸箱折到一半卡住,人类接管几秒钟,把动作拉回正轨;…
给一个成熟模型添加新模块,最大的风险不是“训练不动”,而是模型根本不需要它。 N0-VTLA 的基础策略已经能靠视觉、语言和机器人状态生成动作。此时再接入一条随机初始化的触觉通路,联合训练看起来最直接…
把插头插入插座,对人来说几乎不需要思考。 视觉先把插头大致对准;插头碰到插孔边缘时,手指会感觉到微小阻力;如果角度不对,我们会稍微抬起、调整,再试一次。整个过程真正决定成败的,往往不是“看见了插孔”,…