DGX Spark 黑客松“十日谈”开发历程 队伍ZJUCSEDay 1需求分析与核心目标确立在黑客松的第一天团队确立了项目的核心目标构建一个具备隐私边界的论文实验多智能体系统Paper2Bench PIV。 当前学术界和工业界在利用大模型复现和对比文献时面临一个核心矛盾公开发表的论文可以交由强大的云端 API 处理但企业内部的未公开研究数据如果接入云端将面临严重的数据泄露风险。基于此我们确定了项目的基本需求——系统必须能够将公开和私密论文放入同一个工作流中进行 Benchmark 对比但在执行层必须实现严格的物理隔离。Day 2状态管理与控制面设计在架构设计阶段我们需要解决多智能体Multi-Agent运行时的状态持久化问题。考虑到黑客松的时间限制以及系统的容错需求我们放弃了引入复杂的微服务或图数据库最终选择了 SQLite 作为编排核心。 我们开发了ControlPlaneService和WorkflowEngine。所有的 Session、Stage、Paper、Event 以及资源租约Lease都作为结构化数据存入 SQLite 中。通过原生 Python 的原子化 claim 机制系统实现了状态的安全流转。这种设计确保了在训练中断或进程异常时系统可以通过持久化的数据实现断点恢复。Day 3工作流隔离与隐私边界定义为了实现系统级的隔离我们设计了两套平行的 Agent 工作流。 公开论文Public Paper进入标准流水线依次经历Literature文献分析、Implementation代码实现和Training模型训练而私密论文Private Paper则在本地沙盒Workspace中运行。 在策略层我们制定了严格的路由规则。系统禁止将私有模型细节、代码和原始数据发送至云端所有私有流水线的产出必须经过脱敏Sanitization并以携带校验哈希的结构化数据形式输出从而在代码层面堵住了越权访问的漏洞。Day 4本地模型推理环境部署私有数据不能出域这意味着我们需要在本地部署具备代码与逻辑推理能力的大模型。 借助赛场提供的 NVIDIA GB10 节点我们采用llama.cpp方案在本地成功部署了量化版的多模态模型 Step-3.7-Flash。在此过程中我们主要解决了显存分配和并发推理时的 OOM内存溢出问题通过优化参数设置建立了一个稳定的本地 OpenAI-compatible Endpoint专门负责处理私有论文的推理请求。Day 5代码执行安全与沙盒机制在 Agent 生成代码并执行验证的过程中我们发现了严重的安全隐患若允许大模型直接生成并执行 Shell 脚本可能会导致宿主机环境被破坏。 为此我们重构了Implementation阶段的安全策略。系统禁止模型返回任何直接的执行指令强制要求模型输出带 base hash 的 unified diff统一补丁。补丁的合并由 Python 控制面负责且验证测试环境统一采用shellFalse运行受限的 argv有效防止了命令注入攻击。Day 6脱敏机制与人工审批介入在系统联调阶段我们发现在进行跨论文 Evaluation评测前必须确保私有论文的结果中不含有任何敏感信息。 初步尝试通过本地大模型进行自动脱敏但发现单纯依赖 LLM 依然存在隐私泄露风险例如在摘要中隐式包含未公开的网络层信息。经过讨论我们在工作流中引入了强制的 Human-in-the-loop人工审批环节。所有经过脱敏处理的 Private proposal 必须由研究者手动审核并批准生成 Public derivative 后才能进入最终的公开对比池。Day 7Web 控制台开发为了让工作流具有更直观的可观测性我们开始构建可视化控制台。 考虑到部署的轻量化我们避免了使用 Node.js 构建链或 React/Vue 等框架选择使用原生的 HTML、CSS 和 JavaScript 进行开发。通过与后端的 API 交互我们实现了基于状态机的动态渲染包括论文卡片、来源元数据、交互式的 SVG 模型结构图以及运行日志的实时更新完成了一个轻量且功能完整的 Dashboard。Day 8国际化i18n支持与前端重构随着项目进入后期为了提升系统的可用性和展示效果我们决定为 Web 控制台添加国际化支持。 我们将前端页面中硬编码的文本进行了抽离统一管理在i18n.js中。这一重构过程涉及到对前端 DOM 操作逻辑的大量修改以确保在切换中英文时界面的排版和表单状态不会发生错乱最终实现了无刷新的双语切换。Day 9-10无状态 Demo 模式开发与文档完善在准备最终路演时我们评估了完整工作流的执行耗时。由于论文解析、代码验证和模型训练需要数小时无法在答辩的几分钟内进行实时演示。 因此我们开发了一个专用的“无状态 Demo 模式”。该模式复用了真实系统的前端渲染组件但接入了预先生成的静态数据集和可视化的图表如流场和误差场对比图、训练曲线等并且能够展示生成公开安全 PDF 报告的全过程确保了展示环节的流畅度。开发收尾阶段项目代码层面停止合入新功能。团队将重点转向文档的完善和项目的合规性审查。 我们全面更新了README.md及其中文版本README_cn.md补充了 Mermaid 架构图、模型路由策略表格和详细的部署指南。随后我们对系统进行了最终的端到端E2E测试顺利完成了整个黑客松项目的交付。