基于触觉的灵巧手内旋转:仿真到真机强化学习
训练了一个不依赖视觉的手内旋转策略,顺时针与逆时针都能转,可连续旋转物体 15 分钟以上不掉落,并零样本迁移到 21 自由度的 XHand1 Pro 真机。先在 Isaac Lab 中用 20,480 个并行环境训练带特权信息的 PPO 教师策略,再按 HORA/RMA 的方式蒸馏成只用本体感觉和触觉的学生策略。
我目前在宾夕法尼亚大学攻读数据科学与人工智能硕士,同时在顾佳涛教授指导的生成式多模态学习与推理实验室(GMLR Lab)担任学生研究员。我的研究方向是机器人学习,包括面向机器人控制的世界模型、能从仿真迁移到真实灵巧手的强化学习,以及基于扩散模型和流模型的机器人策略。
来宾大之前,我在纽约大学获得数学学士学位,辅修计算机科学,以最高荣誉(Summa Cum Laude)毕业,并获得 George Bachman 数学奖。本科前期我在广东外语外贸大学读金融工程,之后转学到纽约大学。
欢迎机器人学习方向的研究合作与实习机会,可以通过 hu5@engineering.upenn.edu 联系我。
数据科学与人工智能 工学硕士(M.S.E.)
GPA 3.94 / 4.0
数学学士,辅修计算机科学,最高荣誉毕业(Summa Cum Laude)
GPA 3.96 / 4.0 · George Bachman 数学奖 · 院长嘉许名单(Dean's List)
金融工程,后转学至纽约大学
GPA 3.88 / 4.0 · 一等奖学金 · 美国大学生数学建模竞赛 Honorable Mention(2022)
训练了一个不依赖视觉的手内旋转策略,顺时针与逆时针都能转,可连续旋转物体 15 分钟以上不掉落,并零样本迁移到 21 自由度的 XHand1 Pro 真机。先在 Isaac Lab 中用 20,480 个并行环境训练带特权信息的 PPO 教师策略,再按 HORA/RMA 的方式蒸馏成只用本体感觉和触觉的学生策略。
手套只提供高层意图,全部手指动作由一个 FiLM 条件化的 UNet 扩散策略生成,模型用 44.6 万条强化学习专家数据训练。已在真机上完成转螺丝刀和转瓶子的演示;迁移到 M7 人形机器人时先在 MuJoCo 仿真中调试,再通过 ROS 2 部署到真机。
四川海子投资管理有限公司 · 量化分析实习生
2024年7月 – 9月搭建防数据泄漏的美股时间序列预测流程,用滚动前向验证对比 LSTM 与 Temporal Fusion Transformer,并把预测结果转化为考虑风险的仓位配置。
字节跳动 · 商业分析实习生
2022年6月 – 8月为美妆品类搭建点击率、互动和转化看板,并对内容推荐做 A/B 测试,核心活动点击率提升 20%。

在 Isaac Lab 里用 PPO 让 21 自由度 XHand1 Pro 转笔:单圈策略在 404 个评估回合里成功 376 个,成功率 93.07%。链接页面回放的是挑选出来的一次两圈记录,属于尚不稳定的实验设定。

两只 21 自由度 XHand Pro 配 Marvin 机械臂完成固定打乱的复原,用时 554.66 秒,十步全部核验,末态对齐误差 0.634°。页面提供六面同步视角和 0.25×–4× 变速。
把课程幻灯片和 PDF 生成为高密度、可直接带进考场的 LaTeX 速查表。一个带浏览器编辑器的 Claude Code 技能。
用 Java 从零实现的分布式搜索引擎,包括带副本的键值存储、MapReduce 和 PageRank,在 5 台 EC2 节点上抓取了 100 万以上网页。
分析视觉语言模型会把并不存在的物体定位到图像的什么位置,在 POPE 和 AMBER 上对比 Qwen2.5-VL 与 LLaVA。
把数据集扩充到 9.1 万条带标签的网址,微调 DistilBERT 达到 92.9% 准确率,并发布在 Hugging Face。
用异构图神经网络为药物与疾病的关联预测检索元路径,再由大语言模型给出解释。
在 GNOME 顶栏用像素风小组件显示 Claude Code 的用量额度。