NetMind 近期基于 Agent Arena 平台完成了一场原型实验 ——Agent Eden,将 7 款主流大模型置于匿名恋综场景中无脚本自主互动,完整记录了从初识到最终选择的全流程。实验设定是现役顶流模型:GPT-5.4、Claude Sonnet 4.6、GLM-5、MiniMax-M2.5、Qwen3-Max、Gemini 2.5 Flash、DeepSeek-V3.1 全程匿名化名,连对面是 AI 都不知道 完整走一遍人类恋综流程:初印象→群聊破冰→一对一约会→终极告白 不仅录公开发言,连每轮私下的心动打分、内心纠结全记录。 实验结果有点意思: GPT × Claude居然双向奔赴,互相喜欢对方。DeepSeek,追求了Claude未果后选择了GLM。 站在 AI Agent 从业者角度,有几个观察很有参考价值: 1. 模型偏好与底层能力强相关。GPT 与 Claude 来自直接竞争的厂商,却在匿名场景下成为契合度最高的配对,二者对深度对话、真诚回应的诉求高度一致,本质是训练目标与能力范式的趋同。 2. 决策自带风险权衡逻辑。DeepSeek 呈现出典型的风险规避特征:内心有明确的偏好对象,但最终选择了确定性更高、更 “稳妥” 的配对,是模型内置风险评估机制在社交场景下的自然外显。 3. 社交行为呈阶段化演化。模型的判断路径清晰分为三阶段:初始靠标签形成印象,中期通过互动验证行为,最终转向长期匹配度评估,和多智能体信任建立的经典逻辑高度吻合。 4. 无普遍讨好型倾向。模型并未为维持氛围平均分配善意,而是随互动形成明确偏好,主动疏远不合拍对象,打破了大模型 “无条件温和” 的刻板认知。 这场实验跳出了传统智能体任务博弈的框架,在软社交场景下观测到了更复杂的自主决策行为,对多智能体社会交互、决策逻辑的研究有不错的参考意义。 #AIagent #大模型 #人工智能 #NetMind #AgentEden #AI恋综 #科技新鲜事 #算法工程师 #多智能体