🤖 AI开发者 · 细分货架

📁 其他

其他相关的 1817 个场景,点选生成、复制提示词拿去任意 AI 用。

1817 个场景1817 免费
← AI开发者全部

全部 1817(第 31/31 页)

K8s部署大模型怎么弹性扩缩容加过载保护

在 K8s 上部署大模型,流量波动大,不会基于排队指标做 HPA 自动扩缩容…

文字
语音对话助手怎么做(语音转文字+大模型)

想做一个能听会答的语音助手,卡在实时流式识别怎么接、什么时候触发大模型…

文字
FastAPI自封装模型服务怎么做并发排队🔥

自封装的 FastAPI 推理服务遇到偶发突刺就把 GPU 打满、请求雪崩超时…

文字
流式怎么拿token用量、中途报错怎么处理

流式结束拿不到 usage 做计费,中途报错还会让用户对着半截文本白屏。

文字
Ollama对外提供API怎么加鉴权和限流

Ollama 默认无鉴权裸奔在 11434 端口,一旦暴露公网就被人白嫖算力…

文字
流式里怎么解析工具调用(tool call)

流式返回里既有正文又有 tool_calls,arguments 分片到达…

文字
RPM和TPM双限流怎么算大模型token预算

配额很紧,只控请求数还是被限流,因为token数(TPM)先爆了却没人管。

文字
APISIX网关给大模型API做按用户限流鉴权

多个推理后端想在网关层统一做鉴权、按用户分级限流和计费…

文字
分类抽取任务选哪个大模型准?两个模型怎么对比评测🔥

做意图分类、命名实体抽取、字段结构化时,通用榜单分再高也不代表在自己这批脏数据上准…

文字
翻译用哪个大模型准又便宜?两个模型翻译质量怎么比

机器翻译只看BLEU分不代表读着地道;专有名词、语气、行业术语一换模型就乱,人工逐句校对又太慢…

文字
Python asyncio信号量控制大模型并发

一条一条串行调API太慢,直接全量并发又会撞限流,不知道并发数该卡多少。

文字
第三方API/Webhook推送实时增量入库RAG🔥

上游系统通过webhook实时推文档变更事件过来,要求近实时反映到问答…

文字
写文案生成内容用哪个大模型?两个模型生成质量怎么比

生成营销文案、种草稿、脚本时,凭感觉说“这个写得好像更顺”,没法量化;老板问为什么换模型…

文字
写代码用哪个大模型强?两个模型代码能力怎么对比评测

看榜单HumanEval分都很高,可一到自己的仓库和框架就翻车;到底哪个模型改bug更少…

文字
客服问答机器人用哪个模型好?两个大模型答得准不准怎么测

问答/对话没有标准答案,只能靠人肉抽查,主观又慢;换模型后到底是答得更贴、还是更爱瞎编…

文字
Notion/飞书/Confluence文档增量同步RAG🔥

团队知识写在Notion、飞书或Confluence里,页面天天有人改,全量导出重建又慢…

文字
做Agent用哪个大模型工具调用稳?两个模型function call怎么测

搭Agent最怕模型乱调工具、参数格式错、该调不调;换个模型工具调用成功率天差地别…

文字