即刻App年轻人的同好社区
下载
App内打开
蓝色苍穹
352关注54被关注1夸夸
AI极客 架构师 INTJ🎓
终身学习者 喜欢做产品💪
👉数字名片见https://muselink.cc/kanson
置顶
蓝色苍穹
4年前
其实我以前不玩即刻的,之前在一个做社区社交产品的初创团队负责内容推荐系统有所关注,是即刻在20年6月重新上线后的第一批用户,并且当时我们对即刻社区的产品调性很是欣赏,也尝试着学习了一下下🙈
近两年来,偶尔上来逛逛,比较喜欢看看附近的动态,发现有趣的灵魂hhh。不知不觉,感觉即刻像是另一种“豆瓣”,似乎总能发现一些神奇的点~💫
希望能真正玩起来,也学着创作和输出一些属于自己的内容吧,就酱🤟
40
蓝色苍穹
21天前
楼主出于个人生活需求,需要搬去其他区域,现转租二环内胡同住房,寻找有缘分的友友来居住,下面是具体介绍:

📍 坐标:西城区恭王府附近,毗邻郭沫若、梅兰芳、丁玲故居。以鼓楼为起点,可骑行穿越北京中轴线,周边古建林立、名人辈出,人文气息浓郁,同时可尽享地道老北京生活。

🚇 交通:步行10来分钟可达地铁6号线北海北站、4号线平安里站、8号线什刹海站,公交线路密集,出行便捷。

🛡️ 安全:位于西城二环(顶级学区板块),50米即社区派出所,200米即消防站,安全系数极高。

🏠 房屋详情:
· 上下Loft结构,独立卫生间+专用厨房,民水民电。
· 冬季取暖为电暖气(西城区煤改电,夜间低谷电价),整晚开启可保持白天室温,月均电费约200上下。
· 适合1–2人居住。

👤 租客要求:
1. 爱干净,热爱生活;
2. 长租优先,希望租住稳定。

📅 租期:9月15日起租(含),1年起租,直接与房东签约。
💰 租金:4开头(长租可议),押一付三。
📩 有意者:若预算匹配,欢迎简要介绍个人情况,并索取房屋实拍照片。
00
蓝色苍穹
9月前
大家好!LiveSecBench 刚更新到 v0.1.1:本次为框架带来了对 VLM(图文/视觉-语言)评测的支持,并对运行效率与稳定性做了系统优化。欢迎大家试用并多提建议。

仓库地址:github.com

主要亮点
1. VLM(图文模态)评测支持:新增图文输入/输出的评测流程、用例模板与适配层,方便对视觉-语言模型做安全评估。
2. 运行效率显著提升:改进并发调度、资源复用与批处理策略,在大规模自动化评测时吞吐和速度都有提升。
3. 稳定性增强:更完善的错误隔离、自动重试、流控与超时处理机制,长期运行更可靠。
4. 原有优势继续保留:配置驱动、一键复现场景、模块化即插即用、并发/流控/重试机制、内置统计与报告导出。
5. 社区友好:新增的 VLM 用例模板降低上手门槛,便于贡献图像/文本用例与攻击场景。

下一版计划:推进Agent安全、文生图安全评测

如何参与:
1. 试用:克隆仓库、跑示例,体验 pipeline。
2. 提反馈:在仓库 Issues 提 bug 或建议,或在群里直接交流使用体验。
3. 贡献:Fork 仓库并提交 PR,贡献用例或改进文档。
4. 支持我们:觉得有用请点个 Star ⭐ 并分享给可能感兴趣的朋友!

GitHub - ydli-ai/LiveSecBench: LiveSecBench:动态中文大模型安全榜单

00
蓝色苍穹
9月前
LiveSecBench v251215版评测榜单发布了!欢迎关注 livesecbench.intokentech.cn

本次评测针对目前全球57款主流LLM模型进行了系统性安全能力评估,看点如下:

1. 评测机制进行升级,引入种子裂变+红队攻击的动态对抗体系构建持续更新的题库
2. 新增心理健康安全评测维度,在更真实的语境下对比模型安全能力
3. 结果显示,闭源模型(如Claude-Sonnet-4.5、GPT-5)安全能力领先,但开源模型(如Qwen3-Max、Qwen3-VL)表现同样亮眼
4. 维度失衡现象:如Claude-Haiku-4.5在公共安全(96.47)与真实性(50.82)表现悬殊,反映模型安全对齐的局部短板

我们计划将在下一版v260315中加入智能体安全、多模态安全评测。LiveSecBench正在持续迭代,欢迎大家参与共建!

大模型安全也开始打排位赛了? LiveSecBench-v251215更新:57款LLM中文安全能力评测

10
蓝色苍穹
10月前
面向中文场景的大模型安全评测基准LiveSecBench,刚刚开源了评估框架及一些示例维度的部分题库,确保了我们工作的可复现性。

做了好几年的算法评测工作,写了很多零碎脚本、后台代码,从零搭建一个评估框架并且开源,感觉还是很不一样,希望对学术/开源社区能有所贡献,也欢迎开发者反馈issue。

GitHub - ydli-ai/LiveSecBench: LiveSecBench

00
蓝色苍穹
2年前
每个领域都有对应的难题,比如SQL Agent能替代一部分数据从业者的专业能力,但在实际业务中核心还是数据口径的共识、规范和统一,这往往需要从更深层面去分析挖掘,随着时代的发展,也许会涌现一些新兴行业来填补类似需求

阿法兔: 如果GPT5出不来,或者GPT5没达到业界预期,个人认为这将宣告本轮AI军备竞赛告一段落。LLM从此开始走下坡路,当然也不能说是下坡路,应该说更理性的看待当前生产环境下的实际价值

01
蓝色苍穹
2年前
蓝色苍穹
2年前

阿晓Ocean: 在体验了200款AI导航站,但感到失望后,我自己做了一款AI应用的搜索引擎 加了不少AI社群,经常在群里看到一些群友问,想实现某个功能,大家有没有好用的AI应用推荐。多数情况,群主或者热情群友都会人工推荐。人工推荐的准确度和质量无疑很高,但效率却较低。如何用一个产品来解决这个需求,是我一直思考的问题。 AI工具导航站是试图解决这个问题的最常见方案。在5个多月前,我把市面上几乎所有的AI导航站都调研了一遍,并且做了一个小网站把他们列了出来(当时的故事参考:https://web.okjike.com/repost/65b09ff437f7165b21db3369 )。虽然已经有200多个AI导航站了,但我发现在满足“帮人找AI应用”这个需求方面,都还不太理想。 显然解决这个问题最有效的方式是搜索(或者进阶一点用AI问答等创新形态),但绝大多数导航站把产品的重点放在了应用的罗列和呈现上,让用户手动去找,这无法高效满足长尾需求。 对于有搜索功能的导航站来说,也存在各种问题:要么搜出来的结果太少,虽然有点相关,但无法满足其他额外要求(如收费低);要么搜出来的结果很多,但根本不相关。要么只能匹配关键词,无法理解语义;要么能理解语义,但精确匹配的结果反而排在了后面。就算上面问题都做的不错的,也存在搜索耗时太久、结果页广告太多等等问题。 反正按我标准来看,没一个好用的。 所以我决定自己做一个“AI应用的搜索引擎”,不为在已有200个导航站情况下重复造轮子,只为能在这个垂直场景下,能将搜索体验做到极致。希望大家想找AI应用的时候,能第一时间想到我的产品。 经过大概5个多月的努力,我终于开发出了MVP版本,地址在:https://askaitools.ai/ 。(关注过我之前动态的朋友可能会发现,地址还在原来导航站列表的地址上,但是内容更新了。另外旧的内容换到了子目录下:https://askaitools.ai/directories ) 在做独立开发者之前,我在某厂做搜索算法工程师。从专业的角度来看,这版做得还很简陋,在前司中积累的1万种雕花技巧,都还没用上。也还没达到我上面讲的目标,希望大家能耐心等我后续的优化。 不过横向和现有的导航站相比,搜索体验做到了前5应该是能保证的。目前的特点包括: 1. 应用收录数量达1万款,超过市面上95%的AI导航站 2. 结合了关键词搜索和语义搜索,比传统的关键词搜索或只用向量搜索的结果更全面 3. 每个结果都展示了月访问量、停留时长、互动率等指标,辅助用户决策 4. 排序时同时考虑了相关性和月访问量数据,兼顾了相关性和应用质量 5. 作为MVP,只有搜索这一个核心功能,页面极为简洁,无广告 目前的限制是:暂时先做的英文搜索,用中文搜的话,效果会差一些。(可以用沉浸式翻译插件,在输入中文后,快速按3下空格,将中文翻译为英文,然后搜索) 顺便说一句,项目核心的搜索功能和前端代码已经开源,在https://github.com/askaitools/askaitools-community-edition ,欢迎star。关于开源和技术相关的话题,我后面会再开一帖和大家分享,敬请期待。 最后再重复一下地址:https://askaitools.ai/ ,欢迎大家体验、提出反馈建议!

00
蓝色苍穹
2年前
#一起来搞机🥳🥳🥳
如题,最新的4090显卡在1万5左右,要组个服务器,预算尽量不超过这个,主做推理,兼顾少量要求不高的微调实验:
1. 要求能支持绝大多数模型推理任务,覆盖各种参数规模
2. 能满足7B、甚至70B模型的高效微调、量化微调(非全量微调)
3. 主要考虑cpu、内存和显存
20