荆楚理工学院计算机在读,现阶段可全职实习。专注AI应用开发方向,具备大模型应用工程化 + 智能体系统设计 + 多模态检索融合落地能力。熟练使用LangChain、LangGraph、LlamaIndex搭建多Agent智能工作流与RAG知识库,掌握deepagents框架与langextract实体关系抽取,独立完成AI智能体平台全栈开发,落地RAG知识库、Function Calling工具调用闭环、多轮对话流式输出等核心能力。兼具企业级大数据治理实战经验,可独立承接AI应用开发、智能体平台建设、RAG知识库系统、AI工具定制等工作。
大模型应用框架:熟练LangChain、LangGraph、LlamaIndex,可搭建多Agent智能工作流、RAG检索增强、条件路由、状态管理、失败重试机制
检索引擎:熟练向量检索(ChromaDB/Milvus)、图检索(基于networkx实体关系图多跳查询)、时序检索(时间索引),可实现三路融合检索
实体关系抽取与Agent编排:熟练使用langextract(Google开源,Schema驱动)进行结构化实体关系抽取,掌握deepagents框架进行数据分析Agent编排
Function Calling与工具调用:实现插件化工具注册框架,支持网页搜索、代码沙箱、数据分析等多类工具按需挂载,完成大模型工具调用闭环
Prompt工程:多场景Prompt模板设计、输出格式约束、Few-shot优化
Python + FastAPI、SQLAlchemy、Alembic、JWT认证
Vue 3 + TypeScript + Element Plus,前后端分离全栈交付
Git、Linux、Docker、Docker Compose 容器化部署
Hadoop/Hive数仓体系、HiveSQL数据清洗
Spark/Flink计算引擎、DataX数据集成
Pandas/NumPy数据清洗分析
Python(熟练,主力)、SQL(熟练,MySQL/HiveSQL/PostgreSQL)、Java(熟悉)
入选教育部首批国家级现场工程师培养计划(数字城市方向),由中国电子系统技术有限公司与上海德拓信息联合培养。项目分为校内3个月(备赛)+ 校外2个月企业实训。
校内备赛阶段(3个月):备战世界职业技能大赛,项目「数治护航-公交司机健康大数据治理平台」,独立负责DataX多表同步、Python+HiveSQL数据清洗,落地三级数据质量标记规范,依托完整性、唯一性、准确性、一致性四维校验规则,将数据合格率由76.3%提升至98.2%,该模块100%独立开发;完成指标计算并落地PostgreSQL。
校外实训阶段(2个月):负责校企实训课程资源研发、实验环境部署与实战项目落地——完成大数据可视化、Kafka、交通事故数据分析、Hadoop企业经营数分四大课程体系实训手册与教学视频;在Dsight实验室部署JDK、Python、Kafka、Hadoop伪分布式、MySQL、DataX、Hive、Spark整套环境;落地交通事故成因分析(Python全链路清洗+可视化)与企业经营域Hadoop数仓(DataX接入+Hive分层数仓+HiveSQL指标+FineBI可视化)两大实战项目。
面向个人知识管理场景的自研ReAct智能问答Agent,融合语义向量、图谱关系、时序三路检索,实现对个人知识体系、技能经历、事件时间线的全方位问答。系统架构由本人独立设计(结合ChatGPT DeepSearch调研 + Claude Code Plan完善架构文档),代码开发由AI辅助。
三路融合检索架构:语义检索(SQLite存储向量+余弦相似度搜索,实现笔记语义匹配);图谱检索(纯文本JSONL存储实体与关系,通过BFS实现多跳关系路径查询);时序检索(Event/TimePeriod作为一等公民建模,基于时间索引支持时间范围查询与时序关系推理)
自研ReAct Agent Loop:基于Claude原生tool_use自研Think-Act-Observe-Decide循环(不依赖LangChain/LangGraph),设计6个工具(search_notes/search_entities/get_entity/get_relations/temporal_query/find_path);Agent根据问题类型自主决策工具组合与多步推理路径
知识抽取与消歧:Claude API tool_use + Schema约束,从Obsidian笔记抽取实体关系写入JSONL;设计三级消歧Pipeline(精确匹配→字符串模糊匹配>0.85→LLM仲裁),置信度>0.9自动合并、0.6-0.9人工确认
流式对话与可视化:FastAPI + SSE流式输出思考过程与工具调用;Cytoscape.js图谱可视化(节点按类型着色、路径高亮)
技术栈:Python、FastAPI、SQLite、Anthropic Claude API(tool_use)、Cytoscape.js、SSE
难点1:Agent自主检索路径决策 — 自研ReAct Loop让Agent根据问题理解自主选择工具组合而非固定pipeline;通过消息状态管理支持多步推理上下文闭环
难点2:非结构化文本到图谱的抽取质量 — Schema约束+三级消歧Pipeline控制实体合并质量,规避LLM抽取幻觉
难点3:图谱存储的可演进与可维护 — 选纯文本JSONL存图谱(可读、可git、增量追加、零外部服务依赖),SQLite仅存向量/对话/索引
面向企业、个人的AI智能体平台,具备知识库管理、文档向量化RAG检索、可配置智能体、多轮对话流式输出、Function Calling工具调用、智能搜索、文件管理能力;前后端分离架构,Docker Compose一键部署。
RAG知识库引擎:集成ChromaDB向量库与Embedding模型,实现文档自动分块、向量化索引、语义检索;对话时自动注入知识库上下文;多知识库按Collection隔离,检索结果按相似度排序并限制token长度
AI对话引擎:封装兼容OpenAI标准API,支持多轮上下文管理、SSE流式输出、指数退避重试;实现完整的Function Calling工具调用闭环——AIService解析tool_calls,通过ToolRegistry异步执行工具,按OpenAI协议组装工具角色消息发起二次大模型调用
工具中心:插件化ToolRegistry框架,内置网页搜索、代码沙箱、翻译、文件读取、数据分析5类工具,智能体可按需挂载,支持动态扩展
智能体配置:支持自定义系统Prompt、知识库绑定、工具挂载、模型参数调整,用户可零代码创建专属智能体
后端架构:FastAPI + SQLAlchemy搭建10+业务模块,设计15张数据表,Alembic管理数据库迁移
文件系统:大文件分片上传、断点续传、哈希秒传;知识库支持多格式文档上传,后台异步解析、重建向量索引
前端开发:Vue 3 + TypeScript + Element Plus搭建AI问答、AI搜索、智能体广场、知识库、工具中心等12+页面
部署:Docker Compose编排PostgreSQL、Redis、前后端服务,完成前端构建与安全扫描
技术栈:Python、FastAPI、SQLAlchemy、ChromaDB、Vue 3、TypeScript、Element Plus、PostgreSQL、Redis、Docker
难点1:对话列表接口N+1查询导致响应缓慢 — ChatService使用子查询批量统计消息数量,一次性获取会话最新消息
难点2:LLM工具调用结果无法稳定回灌对话上下文 — AIService解析tool_calls,通过ToolRegistry异步执行工具,按OpenAI协议组装工具角色消息发起二次大模型调用
难点3:多知识库向量检索片段过长、跨库干扰 — 向量库按知识库隔离独立Collection,检索结果按相似度排序并限制token长度
结合大数据治理实战经验打造AI辅助工具,依托LangGraph编排多专业Agent协同工作,实现数据质量自动诊断、自然语言转SQL、清洗方案自动生成。
架构设计:基于LangGraph StateGraph搭建Supervisor多Agent架构,通过TypedDict统一全局状态,StateGraph条件边控制流程流转,实现任务自动拆分与动态路由
数据质量Agent:自动扫描数据集,识别空值、格式异常、重复数据等问题,输出结构化诊断报告
SQL生成Agent:接收自然语言数据清洗需求,自动输出Python/HiveSQL清洗代码;新增Validator Agent做语法校验与沙箱试运行,出错携带报错信息重调LLM修正,最多重试3次
RAG知识库:接入ChromaDB向量库,存入数据治理规范、历史清洗方案,辅助Agent决策
多入口交付:封装命令行、FastAPI接口、Streamlit可视化Web界面
技术栈:Python、LangGraph、LangChain、ChromaDB、OpenAI API、Pandas、Streamlit
项目亮点:结合公交大数据治理项目实操经验设计Agent能力,解决重复编写清洗脚本效率低下问题;采用LangGraph动态路由,根据数据问题类型自动匹配处理策略,内置错误重试机制
采用业务层/数据开发层/数据决策层三层架构,采集公交司机健康监测一体机数据,通过ETL完成数据治理,为上层决策提供数据分析支撑。
数据同步:使用DataX配置20+张业务表同步任务,支持增量、全量两种同步模式
数据清洗:编写Python + HiveSQL清洗脚本,实现三级数据加工:字段脱敏与空值兜底、无关数据过滤、质量标记(0=正常/1=缺失/2=格式错误/3=关联失败)
质量保障:搭建覆盖完整性、唯一性、准确性、一致性四维度的数据质量监控机制,数据合格率由76.3%提升至98.2%
指标输出:治理后数据写入PostgreSQL,完成司机健康评分、异常检测等核心业务指标计算
技术栈:DataX、Python、Pandas、Hive/HiveSQL、PostgreSQL
难点1:不同检测一体机输出健康数据格式不统一 — 设计三级质量标记体系,先标记数据状态再针对性处理,状态码存入数据字段,后续流程根据标记执行对应逻辑,规避硬编码
难点2:增量同步场景下数据不一致 — DataX配置时间戳增量策略,结合HiveSQL MERGE操作实现幂等写入
主修:数据仓库、大数据处理技术、Python程序设计、数据库原理、分布式计算、Web开发
分班考试第一,由计算机方向转入大数据方向;在校期间参与校企合作国家级项目,获企业级大数据开发实战经验
基于达梦云原生大数据平台的校园智能实训系统
基于龙架构的智能设备状态综合监控系统
AI应用开发为核心:独立完成AI智能体平台与多模态融合检索Agent开发,具备RAG知识库、Function Calling工具调用、多Agent编排、三路融合检索等核心AI工程能力
数据+AI复合壁垒:兼具企业级大数据治理落地经验与AI应用开发能力,可将数据工程能力融入AI应用,解决纯AI开发人员不懂数据工程的痛点
稳定性强:专升本已上岸,2026.09前可全职实习,无学业顾虑,可长期在岗
快速学习与强执行力:两年内从零起步,独立完成大数据、AI全流程项目开发,持续跟进LangChain、LangGraph、deepagents等前沿技术